新闻详情

新闻详情

首页 / 资讯中心 / 详情

TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5

发布时间:2026/9/28 20:06:38来源:尧图网络
TeleOCR到底有多强?OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5
TeleOCR到底有多强OmniDocBench等5大基准实测对比PaddleOCR-VL、MinerU与GPT-5【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一个仅约1.2B 参数的开源轻量级文档解析模型视觉-语言模型VLM单个框架就能同时处理数字 PDF 文档和手机拍照的纸质文档。这篇文章将用 OmniDocBench、Wild_OmniDocBench、PureDocBench、Dr.DocBench 挑战赛和 ICDAR2026 Sci-ImageMiner5 大公开基准的实测数据把它与 PaddleOCR-VL、MinerU 以及 GPT-5 系列大模型放在一起对比帮你快速判断它到底值不值得用。 一图速览TeleOCR 是什么在跑分之前先花 30 秒认识一下这个模型项目说明参数规模约 1.2B消费级显卡即可部署开源协议Apache-2.0模型底座基于 Qwen2.5-VL 架构见 config.json 中的Qwen2_5_VLForConditionalGeneration核心卖点数字文档 拍照文档统一解析拍照件无需矫正预处理可解析内容文本、公式、表格、代码、版式布局它和传统 OCR 工具最大的不同是一张弯弯曲曲的手机照片直接丢进去它不需要先做去畸变矫正就能直接输出解析结果这是很多竞品都做不到的。项目介绍详见 README.md模型实现位于 modeling_naviocr.py。 基准一OmniDocBench v1.6 官方榜——1.2B 打赢 235BOmniDocBench 是文档解析领域最权威的公开基准之一同时考核文本、公式、表格和阅读顺序。实测结果如下节选自 README.md 中的实验数据模型参数Overall ↑Text Edit ↓Formula CDM ↑Table TEDS ↑TeleOCR1.2B96.870.02796.3697.05OvisOCR20.8B96.580.02597.5394.76PaddleOCR-VL-1.60.9B96.330.03397.4994.76MinerU2.5-Pro1.2B95.750.03697.4593.42GLM-OCR0.9B95.220.04497.1892.83PaddleOCR-VL0.9B94.110.04095.7090.65Gemini 3 Pro未知92.850.06495.8389.15Qwen3-VL-235B235B89.780.06392.5383.07GPT-5.2未知86.520.11488.0082.95三个关键结论综合分 96.87 登顶超过同为 1.2B 的 MinerU2.5-Pro95.75和 PaddleOCR-VL-1.696.33表格解析是最大杀器Table TEDS 97.05 全场最高PaddleOCR-VL 系列只有 90~95降维打击通用大模型参数只有 GPT-5.2 的几百分之一的 TeleOCR综合分领先 10 分以上。文档解析这件事上专确实能胜大。 基准二Wild_OmniDocBench——真实场景才见真章官方基准里的文档都太干净了。Wild_OmniDocBench 专门收集真实世界里的复杂文档复杂背景、光照不均、排版混乱是更贴近实际使用的考试模型类型Overall ↑Text Edit ↓Table TEDS ↑TeleOCR解耦式 VLM88.530.117389.05PaddleOCR-VL-1.6解耦式 VLM87.360.136985.76MinerU2.5-Pro解耦式 VLM87.330.136285.46OvisOCR2端到端 VLM87.910.12985.13GLM-OCR解耦式 VLM85.080.151481.31在难度拉满的题库里TeleOCR 依然保持第一且文本和表格两项均为全场最佳——差距虽小但五项指标没有一项落后说明它不是靠某一项刷分。 基准三PureDocBench——抗退化能力碾压大模型PureDocBench 把同一份文档分别放在干净、数字退化、真实退化三种条件下考察模型。这正是拍照文档解析的核心考验模型干净 Overall数字退化 Overall真实退化 OverallTeleOCR86.9077.4770.85OvisOCR282.1477.7766.61MinerU2.5-Pro75.8771.7762.56PaddleOCR-VL-1.573.0166.7360.50Gemini-3.1-Pro70.0469.2871.98干净文档TeleOCR 以 86.90 领先第二名 OvisOCR2 约 4.8 分真实退化模糊、光照差、拍摄角度歪斜TeleOCR 70.85 第一连 Gemini-3.1-Pro 这类旗舰通用模型都拿它没办法——退化的纸质扫描件恰恰是通用大模型的软肋。 基准四Dr.DocBench 挑战赛EMNLP 2026在 EMNLP 2026 举办的 Dr.DocBench 文档解析挑战赛中TeleOCR 以原始权重直接参赛模型overall ↑Text edit ↓formula cdm ↑Table teds ↑TeleOCR67.960.19030.0264.97MinerU 2.5 Pro62.260.34020.0467.75OvisOCR259.250.38830.0061.59PaddleOCR-VL 1.655.110.43640.2151.34领先第二名 MinerU 2.5 Pro 约5.7 分PaddleOCR-VL 1.6 则是 12.8 分的大胜。文本识别Text edit 0.1903越低越好优势尤其明显。 基准五ICDAR2026 Sci-ImageMiner——科学图表提取冠军这个赛道考核的是从科学插图中提取隐含表格数据的高难任务论文配图里的曲线、柱状图 → 结构化数据排名队伍RMSTEDS加权总分1TeleOCR17.2366.3941.812VLMinators17.2964.3140.803Ricoh_SRCB16.2361.1238.676Qwen3-VL 8B14.0857.8635.97TeleOCR 以加权总分41.81 夺得冠军领先第二名接近 1 分。这意味着处理科研论文时它不仅能解析正文里的表格还能把图里藏的数据捞出来。 一个模型解析文档的所有内容TeleOCR 把文档解析拆成 5 个可单独调用的能力用不同提示词prompt即可切换任务说明官方示例素材文本识别正文、段落直接转文本assets/text.png公式识别公式图片 → LaTeXassets/formula.png表格识别输出 OTSL 格式可转 HTML 表格assets/table.png代码识别代码截图 → 源码assets/code.png版式分析整页布局定位含畸变文档assets/layout.jpg、assets/layout_distorted.jpg上图是一个典型的多行数学公式解析示例——TeleOCR 能将此类公式图片识别为可渲染的 LaTeX 源码公式 CDM 分数在 OmniDocBench 上高达 96.36。对于畸变的拍照文档TeleOCR 还内置了**多点版式分割分析**能力直接对弯曲、倾斜的页面做布局定位无需专门的矫正模型这也是它 Wild/PureDocBench 抗退化成绩领先的底气所在。 为什么 1.2B 能做到6 项核心技术跑分领先不是运气README.md 中列出了支撑成绩的 6 项关键设计多节点共识投票MCV自动生产高质量伪标签解决标注数据不足的老大难问题几何感知文档建模专为手机拍照文档设计直接理解弯曲、透视畸变曲率引导 Douglas-Peucker 采样CGDP沿文档曲线智能采样保留关键几何信息图像到图像自验证模型自己检查自己自动清洗错误数据渐进式四阶段训练流水线分阶段训练从易到难逐步提升内容-结构解耦学习表格和公式的内容与结构分开学习这正是它 Table TEDS 97.05 的第一名由来。 3 分钟上手安装与首次文档解析部署门槛很低两条命令即可开始。第 1 步安装依赖pip install transformers torch pillow第 2 步加载模型并解析一张图片from PIL import Image from transformers import AutoProcessor, AutoModel import torch processor AutoProcessor.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue) model AutoModel.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16).cuda().eval() # 文本解析 image Image.open(./assets/text.png).convert(RGB) print(infer(image, Please output the text content from the image.))完整的推理与后处理代码含 OTSL 表格转 HTML、公式 LaTeX 规范化可以直接参考 README.md 中的 Quick Start 部分模型分词与推理行为定义在 tokenizer_config.json 和 generation_config.json 中。如果想在本地拉取仓库试用git clone https://gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR✅ 谁适合用 TeleOCR你的场景推荐度理由自建文档数字化流水线⭐⭐⭐⭐⭐开源 Apache-2.01.2B 可私有化部署大量手机拍照的票据/表单解析⭐⭐⭐⭐⭐无需矫正预处理抗退化第一科研论文表格/插图数据提取⭐⭐⭐⭐⭐ICDAR2026 冠军科学图表提取最强消费级显卡本地跑 OCR⭐⭐⭐⭐⭐1.2B 参数显存占用远低于 30B 大模型通用多模态对话⭐它是文档解析专家不是聊天模型❓ 常见疑问快速解答Q11.2B 参数真的够用吗在 5 个基准上TeleOCR 的综合成绩普遍领先参数 2~200 倍的通用 VLM如 Qwen3-VL-235B、InternVL3.5-241B。文档解析是专精赛道小模型反而更优。Q2手机拍的弯歪照片要先矫正吗不用。几何感知建模 多点版式分割让它直接解析畸变文档DocUNet、DIR300 数据集上的可视化结果均验证了这一点。Q3表格和公式的输出格式表格默认输出 OTSL 标记官方提供一键转 HTMLtable的逻辑含合并单元格公式输出 LaTeX自动补$$定界符。 总结5 大基准全部第一OmniDocBench 96.87、Wild 88.53、PureDocBench 86.90、Dr.DocBench 67.96、ICDAR2026 冠军对比结论表格解析胜 PaddleOCR-VL、整体稳超 MinerU 2.5 Pro、碾压 GPT-5 系列与 Gemini 旗舰落地友好1.2B Apache-2.0拍照件免矫正是目前开源文档解析领域最强轻量解。如果你正在搭建文档解析管线或对手机拍照场景的鲁棒性有要求TeleOCR 值得成为你的第一候选。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

菜鸟四步搞定飞牛NAS内网穿透,多节点自带域名访问,方法一 2026/9/28 20:53:09

菜鸟四步搞定飞牛NAS内网穿透,多节点自带域名访问,方法一

菜鸟四步搞定飞牛NAS内网穿透,免费白嫖多节点远程访问,方案一 一、注册穿透面板账号 打开爱工具穿透面板(frps.itool123.cn),注册并登陆 二、创建穿透隧道 进入穿透服务—>节点大厅—>选择服务节点—>创建…

阅读更多 →
Python 数据分析入门 2026/9/28 20:53:09

Python 数据分析入门

1.概述1.1 Python 数据分析优势1.Python 作为当下最为流行的编程语言之一可以独立完成数据分析的各种任务数据分析领域里有海量开源库机器学习 / 深度学习领域最热门的编程语言在爬虫,Web 开发等领域均有应用2.Python 与 Excel,PowerBI,Table…

阅读更多 →
一个新手对c语言的认识 2026/9/28 20:53:09

一个新手对c语言的认识

1.我发现c语言真是一种神奇的东西对于现在的我来讲,它很神秘,我需要一步一步的揭开它2.随着我的深入,我知道了它是一种人与计算机之间交流的工具,我还知道了计算机并不知道什么是十进制,计算机只知道二进制3.而且光用语…

阅读更多 →
小红书改版导致发布失败?如何自己动手更新选择器:XiaohongshuSkills维护实战 2026/9/28 20:53:03

小红书改版导致发布失败?如何自己动手更新选择器:XiaohongshuSkills维护实战

小红书改版导致发布失败?如何自己动手更新选择器:XiaohongshuSkills维护实战 【免费下载链接】XiaohongshuSkills 支持小红书自动发布、自动评论、自动检索的 Skill。支持 OpenClaw、Codex、CC 等 项目地址: https://gitcode.com/gh_mirrors/xi/Xiaoho…

阅读更多 →
嵌入式学习博客:i.MX6ULL ECSPI3 驱动 ADXL345 加速度传感器 2026/9/28 20:53:03

嵌入式学习博客:i.MX6ULL ECSPI3 驱动 ADXL345 加速度传感器

平台:i.MX6ULL 今天学习 SPI,写了 ECSPI3 驱动 ADXL345 三轴加速度传感器,顺便回顾之前学的 IIC、串口 UART,把这三种嵌入式最常用串行总线做横向对比,记录原理、代码和踩坑点。一、硬件信息使用开发板引脚&#xff1a…

阅读更多 →
Kuikly 2026路线图前瞻:AI驱动开发、MCP生态与Compose DSL正式发布全解读 2026/9/28 20:53:02

Kuikly 2026路线图前瞻:AI驱动开发、MCP生态与Compose DSL正式发布全解读

Kuikly 2026路线图前瞻:AI驱动开发、MCP生态与Compose DSL正式发布全解读 【免费下载链接】KuiklyUI 基于KMP技术的高性能、全平台开发框架,具备统一代码库、极致易用性和动态灵活性。 Provide a high-performance, full-platform development framework…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉