新闻详情

新闻详情

首页 / 资讯中心 / 详情

Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF

发布时间:2026/9/6 23:17:16来源:尧图网络
Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF
Umi-OCR 离线OCR使用指南免费识别截图、图片与PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、离线运行的 OCR 软件。它把文字识别整个放在你本地电脑上完成屏幕截图、图片文件、PDF 文档、二维码都能处理不上传、不联网。内置多种语言识别库解压即用。适合经常要从截图里抠文字、要批量转换扫描件、或想把识别能力接到自己脚本里的个人和团队。️ 装好软件跑通第一次识别获取方式二选一。想直接用预编译版下载发行包.7z压缩包或.7z.exe自解压包解压后双击Umi-OCR.exe即可无需安装。想从源码构建则克隆仓库git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR软件首次打开时会按你系统的语言设置自动切换界面语言之后可在“全局设置 → 语言”里手动改支持简中、繁中、英文、日语等。跑通第一次识别走最短路径打开“截图OCR”标签页按默认快捷键CtrlShiftA框选屏幕一块区域。几秒后左侧预览栏显示原图右侧记录栏显示识别出的文字。在记录栏划选文字即可复制或在预览栏用鼠标框选直接复制。除了快捷键截图还能在别处复制一张图片直接粘贴进软件识别。看到结果出现在记录栏说明环境已经跑通。 拿它做什么四类识别任务Umi-OCR v2 由若干标签页组成你按需打开。下面按“你想解决什么问题”来对应功能。屏幕上的文字截图OCR适合从技术文档、聊天记录、报错弹窗里提取文字。左侧预览栏支持鼠标划选复制右侧记录栏可以编辑文字也能多选几条记录一起复制。对代码截图切到“单栏-保留缩进”方案行首空格和缩进会原样保留复制进 IDE 基本不用再调。成堆的图片批量OCR适合一次处理几百张扫描图、截图归档。把文件夹或一批图片拖进来即可支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff没有数量上限。识别结果可保存为txt、jsonl、md、csv(Excel)四种格式任务结束后还能设置自动关机或待机。遇到超长的图片记得在“页面的设置 → 文字识别 → 限制图像边长”里把数值调高避免大图被压缩丢字。整本扫描件文档识别适合把 PDF 扫描件变成能搜索的文字。支持pdf / xps / epub / mobi / fb2 / cbz对扫描件做 OCR或提取已有文本输出双层可搜索 PDF。也能设置忽略区域把每页重复出现的页眉页脚排除掉。码图二维码识别与生成适合从图片里读出二维码、条形码内容或反过来把文本生成码图。识别支持一图多码覆盖QRCode、DataMatrix、PDF417、EAN13等 19 种协议生成时可设置纠错等级等参数。 识别结果不顺眼这样调识别出来的文字顺序乱了、格式不对多半是排版没选对。Umi-OCR 用“排版解析方案”来整理识别结果的顺序和换行按下表选你识别的是什么选哪个方案效果双栏学术论文、报告多栏-按自然段换行默认自动识别多栏按自然段换行代码截图单栏-保留缩进保留行首缩进与行内空格报纸杂志等密集排版多栏-总是换行每句话单独换行普通单栏文本单栏-按自然段换行不区分多栏按段换行要原始输出不做处理直接给引擎原始结果这些方案都自动兼容横排和竖排竖排还需要引擎本身支持。结果里混进不想要的文字比如水印、LOGO、页脚用“忽略区域”在批量页右栏进入忽略区域编辑器按住右键画几个矩形框把干扰区域整个包住。处于框内的整块文本会被丢弃框外内容照常保留。引擎方面Umi-OCR 内置RapidOCR-json和PaddleOCR-json两套离线引擎。日常识别用默认的 RapidOCR 兼容性好追求速度可切到 PaddleOCR在“全局设置 → 切换OCR插件”里换即可。 让脚本和别的系统调用它命令行入口就是主程序umi-ocr --help查看全部说明。常用几条umi-ocr --screenshot唤起截图识别umi-ocr --path D:/img1.png识别指定文件或文件夹结果用--clip复制到剪贴板、用--output result.txt写入文件。命令行依赖软件内置的 HTTP 服务通信默认开启主机选“仅本地”即可过程只在系统本地环回进行。完整参数见 命令行手册。HTTP 接口在“全局设置”里勾选 HTTP 服务后就能用 RESTful 接口调用。默认端口是1224图片识别入口为http://127.0.0.1:1224/api/ocr建议先请求/api/ocr/get_options查一次可传参数语言、排版方案、忽略区域、返回格式等再按需发起识别。文档识别、二维码各有独立接口。注意后端并发能力有限尽量串行调用。详细字段见 HTTP接口手册。更多资料在哪遇到具体问题建议按顺序查这几份材料参数和字段以 HTTP接口手册 和 命令行手册 为准界面功能细节看仓库根目录的 README.md新功能与改动记录见 更新日志。Umi-OCR 把识别能力留在本地从一次截图到成批扫描、再到接口对接都是同一套引擎在跑。先把上面四类任务各跑一遍找到自己最常用的那个标签页剩下的就是调排版和忽略区域这类细活。想深入定制语言库或引擎或是对翻译、插件有兴趣可以翻源码和插件目录或在社区提问交流。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于Spring Boot的自助健身房管理系统的设计与实现 2026/9/6 23:53:21

基于Spring Boot的自助健身房管理系统的设计与实现

摘 要 本毕业设计旨在开发一套基于Spring Boot框架的自助健身房管理系统,解决传统健身房人工依赖重、效率低等痛点。系统采用B/S架构,后端利用Java语言与MySQL数据库实现业务逻辑持久化,前端通过Vue框架与微信小程序提供双向交互&#xff0…

阅读更多 →
(2026|CVPR|安大,可学习正常/异常 token,空间感知交叉注意力)VisualAD:基于 ViT 的语言无关零样本异常检测 2026/9/6 23:53:21

(2026|CVPR|安大,可学习正常/异常 token,空间感知交叉注意力)VisualAD:基于 ViT 的语言无关零样本异常检测

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer 论文地址:https://arxiv.org/abs/2603.07952 项目页面:https://github.com/7HHHHH/VisualAD 学术交流:922230617 目录 1. 引言 3. 方法 3.1 问题设定 3.2…

阅读更多 →
手写ChCore操作系统内核实验:从启动到进程调度的完整实战指南 2026/9/6 23:53:21

手写ChCore操作系统内核实验:从启动到进程调度的完整实战指南

简介:上海交通大学头歌实践教学平台Chcore操作系统实验整理版docx资料,定位为操作系统课程配套学习材料,适合正在完成内存管理、系统调用与缺页异常实验的本科生与自学者。文档以实验二内存管理和实验三系统调用与缺页异常为主线,…

阅读更多 →
国产USB转千兆网卡芯片CH398X-巨型帧(Jumbo Frame)应用 2026/9/6 23:53:21

国产USB转千兆网卡芯片CH398X-巨型帧(Jumbo Frame)应用

CH398X 巨型帧(Jumbo Frame)应用 CH398 是沁恒微电子推出的 USB 3.0 转千兆以太网控制器,内置自研 RISC-V 处理器,集成 USB3.2 Gen1 及 10/100/1000M 自适应以太网 PHY。本文验证其硬件巨型帧功能——最大支持 9KB MTU&#xff0…

阅读更多 →
千万QPS架构演进:从VM到容器的确定性之路 2026/9/6 23:53:21

千万QPS架构演进:从VM到容器的确定性之路

千万 QPS 架构系列讲到第 218 讲,话题落到“容器化:从 VM 到容器”。很多人看到这个题目,第一反应是“这还有什么好讲的,容器不就是比虚拟机更轻的虚拟化吗?”但如果你真的在千万 QPS 的业务场景里做过架构演进&#x…

阅读更多 →
从零搭建Voice Agent:STT-Agent-TTS架构与实战部署 2026/9/6 23:50:21

从零搭建Voice Agent:STT-Agent-TTS架构与实战部署

如果你准备自己动手搭一个能听、能说、能调的语音智能体,这篇内容可以直接收藏。这次我们聚焦的是 Voice Agent 从入门到实战的完整开发链路,核心架构是 STT-Agent-TTS,也就是“语音识别 大模型调度 语音合成”三件套组成的多模态语音智能体…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞