新闻详情

新闻详情

首页 / 资讯中心 / 详情

Umi-OCR 实战:从截图OCR到批量处理,一篇搞定离线文字识别

发布时间:2026/9/13 14:00:17来源:尧图网络
Umi-OCR 实战:从截图OCR到批量处理,一篇搞定离线文字识别
Umi-OCR 实战从截图OCR到批量处理一篇搞定离线文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR截一张代码图框选几秒后右边出现可选中、可复制的文本。这就是 Umi-OCR——一款免费、开源的离线 OCR 软件不需要联网数据不出本机截图文字识别、批量图片识别、PDF 文档识别都在自己电脑上完成。快速上手三分钟完成第一次识别无需安装。发行版是压缩包解压即用。解压.7z压缩包双击Umi-OCR.exe启动。打开左侧「截图OCR」标签页顶部「文字」开关默认已打开。按快捷键CtrlShiftA或点击顶部截图图标。鼠标框选要识别的区域按Esc取消。看右侧「记录」栏选中记录按CtrlC复制。成功标志框选到的文字出现在右侧「记录」栏带时间戳和置信度。记录可以直接编辑也可以划选多条一起复制。如果嫌截图麻烦还能在别处复制一张图片直接粘贴进 Umi-OCR 识别。界面默认按系统语言显示如果是英文或日文去「全局设置」→「语言/Language」切换成简体中文。截图里的代码怎么变成能跑的文本代码截图只有一个核心要求缩进不能丢。Umi-OCR 靠文本后处理的「排版解析方案」解决预设 8 种最常用的三种排版解析方案适用single_code单栏-保留缩进代码截图保留行首缩进和行中空格multi_para多栏-按自然段换行普通文档、报刊按自然段自动分行none不做处理需要引擎原始输出操作很简单框选代码截图。右侧面板切到「设置」→ 排版解析方案选「单栏-保留缩进」。复制记录直接粘进代码编辑器。效果对比——一个三行 Python 函数的识别结果def add(a, b): total a b return total和原图逐行对照缩进、行内空格完全一致不用手工重排。这个方案在 HTTP/CLI 调用时对应参数tbpu.parser single_code后面会用到。这里有个细节各排版方案都自动处理横排和竖排竖排文字还需要 OCR 引擎本身支持竖排识别才行。批量扫描文档忽略区域怎么设置扫描文档批量入库时水印、页眉页脚都会混进结果里。批量 OCR 的专门工具是「忽略区域」画矩形框内的文字不进结果。切到「批量OCR」标签页点「选择图片」添加文件或文件夹。jpg、png、webp、bmp、tif 都认一次导入几百张也没有数量上限。右侧面板进「设置」→ 忽略区域编辑器按住右键拖动画出若干矩形把水印完全包住。注意只有整个完全处于框内的文本块才会被忽略不会切掉单个字符。选输出格式txt、jsonl、md、csvExcel都有。点「开始任务」顶部进度条显示整体进度还可以设置任务完成后自动关机/待机。遇到超大的长图、大图识别不准或偏慢时把「页面设置 → 文字识别 → 限制图像边长」的数值调高即可。参数调优按场景挑配置绝大多数参数不用动。想调的话看这张「场景 → 配置」映射表覆盖 4 个最高频参数场景排版解析tbpu.parser边长限制ocr.limit_side_len语言库ocr.language代码截图single_code960models/config_en.txt中文文档批量multi_para960models/config_chinese.txt大图长图扫描件multi_para2880或更高models/config_chinese.txt英文论文multi_para2880models/config_en.txt三个参数各用一句话说清tbpu.parser识别出的文字块怎么拼接、怎么换行。ocr.limit_side_len大图先压缩到这个边长值低速度快值高精度好。ocr.language语言模型库。中文config_chinese.txt、英文config_en.txt、日文config_japan.txt、韩文config_korean.txt、俄文config_cyrillic.txt。对应的配置片段也保存在./UmiOCR-data/.settings文件里可手动改完再用--reload重载ocr.language models/config_chinese.txt tbpu.parser multi_para ocr.limit_side_len 960上面ocr.*几个参数属于 PaddleOCR 引擎插件其他引擎可调用参数查询接口/api/ocr/get_options拿到各自支持的全部参数。引擎选择三点就够PaddleOCR精度高、语言库全适合复杂文档。RapidOCR速度快、占内存少适合批量和简单文档。默认先用默认引擎识别不准再切 PaddleOCR 并调高边长限制。接入自动化命令行与 HTTP 接口手动操作嫌累就用两种外部调用方式。它们都走本地 HTTP 服务默认开启端口 1224可在全局设置里改。命令行最轻两条典型命令umi-ocr --path D:/docs -- D:/docs.txt # 批量识别文件夹结果存txt umi-ocr --screenshot --clip # 截图并复制到剪贴板--path可以传文件夹路径会搜索其中所有图片含子文件夹全部识别。注意命令行任务沿用「截图OCR」标签页的设置不想要弹窗就去该标签页关掉对应选项。HTTP 接口适合程序集成最小 Python 示例import requests, json, base64 b64 base64.b64encode(open(a.png, rb).read()).decode() r requests.post(http://127.0.0.1:1224/api/ocr, datajson.dumps({base64: b64, options: {data.format: text}})) print(json.loads(r.text)[data]) # 识别文本返回值里code100表示成功、101表示图中无文本企业场景可以再开几个不同端口的实例做轮询负载均衡天然是容灾 OCR 服务。HTTP 服务的开关、端口、主机范围都在「全局设置」里和快捷键、界面语言放在一起管理。卡点速查与下一步症状大概率原因对应操作识别结果全是乱码语言库不匹配改ocr.language为对应语言大图文字断行/精度差边长限制太小ocr.limit_side_len调到 2880 或 4320多栏排版顺序乱排版解析不合适切到multi_para多栏-按自然段混入水印文字没设忽略区域右键编辑器画矩形包住水印命令行没反应HTTP 服务未开启「全局设置」里检查服务开关下一步先做一次截图识别把快捷键和复制流程跑通。再拿一批扫描文档试忽略区域体会框的大小怎么画。想集成进其他工具读下面两篇接口手册。想查所有参数打开./UmiOCR-data/.settings对照着看。延伸阅读命令行手册HTTP接口手册从截图到批量、从参数到接口这四层用熟离线文字识别这件事基本就闭环了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

机械臂阻抗控制参数物理可行域与在线投影方法 2026/9/13 14:42:21

机械臂阻抗控制参数物理可行域与在线投影方法

简介:本资源是一套面向机器人控制方向研究者与自动化专业学生的MATLAB阻抗控制仿真源码,聚焦机械臂与环境交互中的柔顺性调控问题,适用于高校课程设计、科研原型验证及工程算法预研等场景。压缩包共124个文件,含96个.mat数据文件&…

阅读更多 →
跨境电商ERP源码实战:PHP工程化、地址词典与订单状态机解析 2026/9/13 14:42:21

跨境电商ERP源码实战:PHP工程化、地址词典与订单状态机解析

简介:这是一套面向跨境电商业务场景的ERP系统PHP源码,适合具备一定PHP开发基础的中级开发者学习或二次开发使用。系统覆盖商品管理、订单处理、海外仓对接、物流追踪等跨境电商常见业务模块,可作为独立部署的业务骨架,也可用于深刻…

阅读更多 →
GeneratePress图片对齐精调:CSS覆盖与响应式实战指南 2026/9/13 14:42:21

GeneratePress图片对齐精调:CSS覆盖与响应式实战指南

HTML 和 CSS 在 GeneratePress(后面我都简称 GP)里怎么配合,才能把图片对齐做得很细?我接手的 WordPress 项目里,用 GP 的比例相当高,原因你也知道:轻量、快、不绑架你的排版思路。但“轻量”也…

阅读更多 →
Equal Earth等积投影与全球地形栅格底图:原理、应用与GIS实操指南 2026/9/13 14:42:21

Equal Earth等积投影与全球地形栅格底图:原理、应用与GIS实操指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Data Science for Beginners 实战排障指南:环境安装、Jupyter 与测验应用常见问题全解 2026/9/13 14:42:21

Data Science for Beginners 实战排障指南:环境安装、Jupyter 与测验应用常见问题全解

Data Science for Beginners 实战排障指南:环境安装、Jupyter 与测验应用常见问题全解 【免费下载链接】Data-Science-For-Beginners 10 Weeks, 20 Lessons, Data Science for All! 项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners…

阅读更多 →
提示词工程10个技巧:从角色锚定到模板化封装,让大模型输出稳定可控 2026/9/13 14:39:20

提示词工程10个技巧:从角色锚定到模板化封装,让大模型输出稳定可控

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞