新闻详情

新闻详情

首页 / 资讯中心 / 详情

从科学图表中挖出隐藏数据:TeleOCR图表表格提取完整教程

发布时间:2026/9/28 20:42:16来源:尧图网络
从科学图表中挖出隐藏数据:TeleOCR图表表格提取完整教程
从科学图表中挖出隐藏数据TeleOCR图表表格提取完整教程【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCRTeleOCR 是一款轻量级约 1.2B 参数开源文档解析视觉语言模型专为从科学论文与技术文档中提取图表、表格和公式而设计。它支持将论文插图中的隐含数据转化为结构化表格同时覆盖文本识别、公式还原LaTeX、代码提取和版面分析等任务无需复杂前处理让科研数据提取变得简单高效。为什么选择 TeleOCR 做图表表格提取 传统 OCR 工具处理科学论文时常常遇到这些痛点表格结构丢失合并单元格、跨行表格被简单打散公式无法还原数学公式只能识别为乱码或纯文本图表数据不可用论文插图scientific figure里的隐含表格数据无法提取拍摄文档变形手机翻拍的弯曲页面需要额外矫正步骤TeleOCR 通过内容-结构解耦学习技术专门优化了表格与公式解析能力在 OmniDocBench v1.6 基准测试中以96.87 分总成绩位居专项模型第一且对手机拍摄的变形文档同样表现稳健。快速安装与模型初始化安装依赖只需一行pip install transformers torch pillow模型核心文件均位于仓库根目录主要文件包括文件说明modeling_naviocr.py自定义模型架构基于 Qwen2.5-VLconfig.json模型配置28 层 Transformer、1.2B 参数tokenizer.json / vocab.json分词器与词表chat_template.jinja对话提示模板model.safetensors模型权重初始化代码非常简洁from transformers import AutoProcessor, AutoModel import torch processor AutoProcessor.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, use_fastTrue ) model AutoModel.from_pretrained( StarDoc-AI/TeleOCR, trust_remote_codeTrue, torch_dtypetorch.bfloat16, ).cuda().eval()图表表格提取3 步出数据第 1 步准备输入图像将目标图表截图保存为 PNG 或 JPG 文件即可。TeleOCR 直接读取原始图像无需裁剪、矫正或预处理。第 2 步编写提示词并推理针对不同提取任务只需更换 promptfrom PIL import Image # 科学图表 → 隐含表格 image Image.open(./your_figure.png).convert(RGB) prompt This is a scientific figure. Please extract the table implied by this figure. # 普通文档表格 # prompt This is the image of a table. Please output the table in OTSL format. # 数学公式 # prompt Please write out the expression of the formula in the image using LaTeX format. raw_output infer(image, prompt) # infer 函数见 README 完整示例第 3 步转换输出为可用格式表格输出采用OTSLOptimized Table Structure Language格式包含fcel首单元格、lcel跨行、nl换行等特殊标记。通过convert_otsl_to_html()函数可一键转为标准 HTML 表格html_table convert_otsl_to_html(raw_otsl_output) print(html_table) # 输出: tabletrtd.../td/tr/table完整解析逻辑参考 README.md 中的convert_otsl_to_html与post_process函数实现。支持的 5 种提取场景速查场景提示词Prompt输出格式科学图表 → 数据表This is a scientific figure. Please extract the table implied by this figure.OTSL → HTML 表格文档内表格This is the image of a table. Please output the table in OTSL format.OTSL → HTML 表格数学公式还原Please write out the expression of the formula in the image using LaTeX format.LaTeX$$...$$正文文本识别Please output the text content from the image.纯文本页面版面分析Analyze the image layout.结构化区块描述提示词技巧TeleOCR 本质是一个视觉语言模型你可以用自然语言描述任务不必严格限定格式。拍摄文档的变形鲁棒性手机翻拍的论文页面往往存在严重透视变形。TeleOCR 内置几何感知文档建模能力可直接对弯曲文档进行版面解析无需额外调用矫正模型# 变形文档的版面分析 distorted_image Image.open(./captured_page.jpg).convert(RGB) distorted_image distorted_image.resize((1036, 1036), Image.Resampling.BICUBIC) prompt Multi-point Layout Segmentation Analysis. result infer(distorted_image, prompt)实用技巧与注意事项5 个提升提取质量的技巧图像尺寸版面分析任务建议将输入 resize 至1036 × 1036可显著提升精度公式后处理模型输出的 LaTeX 可能带\[\]包裹提取后记得去除外层符号合并单元格OTSL 格式天然支持rowspan/colspan转换后的 HTML 表格结构完整推理参数使用torch.bfloat16do_sampleFalse可获得最稳定的输出多任务复用只需更换 prompt 即可在同一模型上执行不同解析任务无需加载多个模型总结TeleOCR 将读图 → 理解结构 → 输出数据的完整流程压缩为一次推理调用特别适合 批量提取论文中的实验数据表格 将图片中的数学公式转为可编辑的 LaTeX 处理手机翻拍的变形文档 从科学插图scientific figure中恢复隐含数据配合 README.md 中的完整示例代码你可以在10 分钟内搭建起自己的文档解析管线从图表中真正挖出那些隐藏的数据。【免费下载链接】TeleOCR项目地址: https://ai.gitcode.com/hf_mirrors/StarDoc-AI/TeleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI视觉项目初始化:Windows目录结构与工具链实战指南 2026/9/28 21:28:42

AI视觉项目初始化:Windows目录结构与工具链实战指南

1. 这不是一条命令,而是一份AI视觉项目启动的“现场手记”你看到的这行mkdir D:\模块Bcd /d D:\模块Bmkdir 任务一成果 任务二成果 任务三成果 任务四成果,表面看是Windows命令行里一串混乱的mkdir指令,甚至带点语法错误——它根本跑不通。但…

阅读更多 →
S7协议通信实战:从握手到数据读写的深度解析 2026/9/28 21:28:42

S7协议通信实战:从握手到数据读写的深度解析

1. 工控现场为什么要死磕S7协议搞工控的兄弟大多有过这种经历:产线上位机要采一批西门子PLC的数据,拿了个现成的库,连上能读,但偶尔断、偶尔慢、偶尔读回来的浮点数明显不对。翻日志只看到一句“连接超时”,剩下的全靠…

阅读更多 →
手写数字识别系统Python课设:CNN模型训练与部署指南 2026/9/28 21:28:21

手写数字识别系统Python课设:CNN模型训练与部署指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
ARTEMIS 视觉驱动移动端自动化:从架构到实战的完整指南 2026/9/28 21:28:14

ARTEMIS 视觉驱动移动端自动化:从架构到实战的完整指南

移动端自动化这个方向,过去几年一直有个尴尬的瓶颈:脚本能点、能滑、能截图,但一旦界面稍有变化,整套流程就崩了。传统方案靠的是控件树和固定坐标,本质上是在"背答案",而不是"理解题目&quo…

阅读更多 →
FPGA以太网硬件设计:RTL8211F与RGMII接口实战避坑指南 2026/9/28 21:28:14

FPGA以太网硬件设计:RTL8211F与RGMII接口实战避坑指南

1. 为什么RTL8211F在FPGA以太网项目里出镜率这么高搞FPGA以太网通信的兄弟,大概率都绕不开RTL8211F这颗PHY芯片。我第一次用它是在一个图像采集项目里,FPGA端需要把采集到的数据实时传到上位机,千兆带宽是硬指标,选型的时候翻了一…

阅读更多 →
CUDA版本匹配原理:驱动、Toolkit与PyTorch/TensorFlow的ABI兼容性 2026/9/28 21:28:14

CUDA版本匹配原理:驱动、Toolkit与PyTorch/TensorFlow的ABI兼容性

1. 为什么CUDA版本不匹配会直接让PyTorch/TensorFlow“装死”——从GPU驱动到框架ABI的完整断层链你刚配好一台RTX 4060 Laptop GPU的笔记本,兴冲冲跑通了nvidia-smi,显卡状态绿油油,驱动版本显示535.104.05,一切看起来都对。可一…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉