新闻详情

新闻详情

首页 / 资讯中心 / 详情

Umi-OCR:截图和扫描件本地变文本的离线OCR工具

发布时间:2026/8/31 13:49:43来源:尧图网络
Umi-OCR:截图和扫描件本地变文本的离线OCR工具
Umi-OCR截图和扫描件本地变文本的离线OCR工具【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上季度部门把300页扫描版PDF甩给我要求整理成可搜索的文档。在线OCR要么要账号要么就是把合同页一张张传上云端怎么看都不合适。最后我用了一个叫 Umi-OCR 的开源离线OCR工具截图识别、批量图片OCR、文档识别到双层可搜索PDF全部在本机完成不联网、不上传、免费。先跑起来发行版是一个.7z压缩包也有自解压的.7z.exe解压后直接双击Umi-OCR.exe启动没有安装步骤也不需要联网。软件支持 Windows 7 x64 及以上Linux x64 用同目录的umi-ocr.sh启动即可。启动后是一个标签页界面默认打开截图OCR页旁边还有批量OCR文档识别二维码全局设置几个标签左上角可以切换窗口置顶右上角能锁定标签页防止误触关闭。第一次打开时界面语言会按系统自动切换。核心能力按工作流走代码截图识别缩进原样保留打开截图OCR页用快捷键唤起截图划选屏幕区域后左侧出原图预览右侧记录栏列出历次识别结果每条带置信度和时间。记录可以编辑、划选复制在别处复制过图片的话也可以直接粘贴进来识别。真正有用的是右侧设置里的文本后处理 - 排版解析方案。识别代码截图时选单栏-保留缩进行首缩进和行中空格都会保住识别完直接复制进编辑器不用再手动对缩进。学术论文这类多栏版面则选多栏-按自然段换行让段落顺序读起来顺。一批300张图含水印也不怕几百张带水印的截图、几十张发票丢进批量OCR页就行。它支持jpg, png, webp, bmp, tif等格式没有数量上限结果可保存为txt, jsonl, md, csv(Excel)。左栏是文件名、耗时、置信度的任务列表右栏是逐张的识别文本。水印有固定位置的话进右栏设置的忽略区域编辑器按住右键画几个矩形框框内的文字会在任务中被丢弃。注意它忽略的是整个文本块而不是单个字符所以矩形要画得大一些把水印可能出现的位置完全包住。跑完几百张后还可以勾选任务完成后自动关机或待机。从扫描件到可搜索的双层PDF文档识别页接受pdf, xps, epub, mobi, fb2, cbz格式内嵌文本的文档直接提取纯扫描的走OCR最后可以输出双层可搜索PDF——原文保留在底层上层是可选中复制的文字层。这一页同样支持忽略区域适合排掉每页固定的页眉页脚也支持任务完成后自动关机/休眠。二维码标签页顺便提一句支持19种协议截图、粘贴、拖入图片都能读码一图多码也没问题反向输入文本还能生成二维码图片。再挖深一点命令行批处理主程序本身就是命令行入口前提是全局设置里的HTTP服务保持开启默认就是开的。把几个路径一起传进去结果追加写进一个文件umi-ocr --path D:/img1.png D:/img2.png D:/scan_folder --output_append result.txt--screenshot配合screen0 rectx,y,w,h可以免鼠标划选对固定区域自动截图识别所有指令支持前缀简写参数用--clip复制到剪贴板、--output写入文件。HTTP接口调用默认端口1224。先调GET /api/ocr/get_options能拿到当前OCR引擎支持的全部参数定义和默认值不用翻手册然后向POST /api/ocr发一张 base64 编码的图片就返回识别结果。文档识别是上传、轮询状态、生成、下载、清理五步流程仓库里带了现成示例Pythondocs/http/api_doc_demo.pyWebdocs/http/api_doc_demo.html把这套接口接进自动化脚本或小网页工具比自己再包一层OCR引擎省事得多。踩过的坑命令行/HTTP调用没反应跨进程通信依赖本地HTTP服务。去全局设置确认HTTP服务没被关掉主机保持仅本地即可。超长截图识别不全引擎默认把边长超过 960px 的图压缩这是速度优先的默认值。在页面设置里把限制图像边长调高2880 / 4320大图精度就上来了。忽略区域没生效它是按整个文本块丢弃的框太小、只包住半个字就不会触发。矩形画大、把水印位置完全盖住。批量跑几百张太慢换 RapidOCR 引擎、适当调低图像边长限制或者分批跑并勾选任务完成后待机。接着看docs/README_CLI.md命令行手册含范围截屏和指令简写docs/http/README.mdHTTP接口手册OCR / 文档 / 二维码三套接口CHANGE_LOG.md版本更新日志UmiOCR-data/py_src/Python源码界面QML源码在 UmiOCR-data/qt_res/UmiOCR-data/plugins/离线OCR引擎插件目录PaddleOCR 与 RapidOCR 在这里切换回到开头那份300页的扫描PDF现在可以直接拖进文档识别页出一版可搜索的双层PDF交差。下一步可以试的是拿同一批图分别在 PaddleOCR 和 RapidOCR 引擎下跑一遍对比耗时和准确率挑一个留作默认引擎。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

PrivaZer深度清理指南:清除隐私残留与释放C盘空间 2026/8/31 14:39:58

PrivaZer深度清理指南:清除隐私残留与释放C盘空间

电脑里的隐私残留数据,比大多数人想象的多。删除文件、清空回收站以后,数据并不是立即消失,它可能残留在临时目录、浏览器缓存、缩略图库、日志文件、系统还原点甚至未分配空间中。对于经常外借电脑、准备出售旧硬盘,或者发现C盘爆…

阅读更多 →
主动式AI自动化组织实战:构建工单处理Agent全解析 2026/8/31 14:39:58

主动式AI自动化组织实战:构建工单处理Agent全解析

不少团队把大模型接入企业内部后,发现最常用的场景仍然是“智能问答”“知识库检索”和“辅助写作”,业务系统里大量重复性流程并没有真正被自动化。关键原因在于:多数 AI 应用仍停留在“被动响应”阶段——人提问,模型回答&#…

阅读更多 →
Simulink动力性能仿真结果曲线获取、绘制与分析指南 2026/8/31 14:39:58

Simulink动力性能仿真结果曲线获取、绘制与分析指南

1. 从“模型跑通”到“曲线可用”,动力性能仿真还差这一步 很多同学在 Simulink 里搭建汽车动力性能模型时,会经历一个比较微妙的阶段:模型结构搭好了,参数也填进去了,点下 Run 之后仿真也能正常结束,但面对…

阅读更多 →
水圈模型开发必备:从目录规范到可复现的工程化管理 2026/8/31 14:39:58

水圈模型开发必备:从目录规范到可复现的工程化管理

在模型项目开发中,最让人头疼的不是算法本身跑不通,而是某一天打开共享目录,看到一堆命名随意、状态不明的文件。比如有人把还在调试的水圈模型输出文件命名为 mpx_short_mag ,再在文件名里加一个“开发中”标签。这样的命名在当…

阅读更多 →
AI基础设施技术栈解析:从GPU推理服务到集群运维 2026/8/31 14:39:58

AI基础设施技术栈解析:从GPU推理服务到集群运维

AI基础设施正在成为企业智能化转型中最关键的一类投入。“联想不断向AI基础设施公司靠拢”这类战略表述,放在IT产业里并不意外。个人电脑、服务器、存储、网络设备之外,真正决定一家厂商能否持续服务企业AI需求的能力,正在向算力资源、模型服…

阅读更多 →
Python比价爬虫实战:抓取慢慢买历史价格与实时监控 2026/8/31 14:34:58

Python比价爬虫实战:抓取慢慢买历史价格与实时监控

简介:本资源是一套基于Python开发的慢慢买比价平台历史价格监控爬虫源码,面向电商从业者、价格策略分析人员及Python中级学习者,解决商品价格趋势追踪与竞品动态比价的实际需求。压缩包共22个文件,含2个核心Python脚本&#xff08…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞