新闻详情

新闻详情

首页 / 资讯中心 / 详情

DeepSeek-OCR-2版式检测怎么用:<|grounding|>与<|det|>坐标边界框渲染实战详解

发布时间:2026/9/26 19:22:44来源:尧图网络
DeepSeek-OCR-2版式检测怎么用:<|grounding|>与<|det|>坐标边界框渲染实战详解
DeepSeek-OCR-2版式检测怎么用|grounding|与|det|坐标边界框渲染实战详解【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是 DeepSeek 开源的视觉因果流Visual Causal FlowOCR 模型。它的核心能力之一是版式检测只需在 prompt 中加一个|grounding|标记模型就会在输出 Markdown 的同时用|det|标签标注每个元素的坐标边界框再经渲染即可在原图上画出检测框、自动裁剪插图。本文带你从零跑通这条流水线。两种模式Free OCR 与版式检测GroundingDeepSeek-OCR-2 提供两种主要 prompt 模式区别就一个词模式Prompt输出内容纯文字提取image\nFree OCR.纯 Markdown 文本版式检测image\n|grounding|Convert the document to markdown.Markdown 布局标注\|det\|坐标块默认配置就是版式检测模式定义在 config.pyPROMPT image\n|grounding|Convert the document to markdown.想关闭版式检测把这行换成Free OCR.即可。|det|坐标标签长什么样开启 grounding 后模型在 Markdown 流中嵌入成对标签结构固定为|ref|image|/ref||det|[[x1, y1, x2, y2], ...]|/det||ref|…|/ref|元素类别标签如image、title等|det|…|/det|坐标列表每个框是[x1, y1, x2, y2]四元组这 5 个特殊 token|ref|、|/ref|、|det|、|/det|、|grounding|在处理器中的定义见 image_process.py。关键点坐标不是像素值而是 0~999 的归一化数值这样无论原图多大模型只需说相对位置。坐标映射与边界框渲染原理渲染逻辑集中在 draw_bounding_boxes()分四步正则提取用模式(\|ref\|(.*?)\|/ref\|\|det\|(.*?)\|/det\|)从输出中捞出所有标注块见 re_match()坐标还原把 0~999 的归一化坐标乘以原图宽高做映射——x1 int(x1 / 999 * image_width)见 run_dpsk_ocr2_image.py画框用 PILImageDraw画矩形title类用 4 像素粗框、其余用 2 像素细框颜色随机区分并在框上方标注类别名裁剪插图image类元素额外裁剪出来存盘并在 Markdown 中替换为![](images/0.jpg)图片引用——这就是最终.mmd文件里能直接嵌入原图插图的原因。单图实战一条命令出框图准备把图片和输出路径改到 config.py 的INPUT_PATH与OUTPUT_PATH然后运行cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm python run_dpsk_ocr2_image.py产出由 run_dpsk_ocr2_image.py 自动生成文件说明result_ori.mmd原始输出保留全部\|det\|标签result.mmd清洗后的 Markdown标签已替换为图片引用result_with_boxes.jpg 渲染了边界框的版式检测效果图images/*.jpg按\|det\|坐标裁剪出的插图打开result_with_boxes.jpg标题是粗框、公式/图片是细框每个框左上角标着类别名——版式检测效果一目了然。PDF 批量实战并发处理整本文档处理 PDF 时run_dpsk_ocr2_pdf.py 先把页面逐页转高清图再并发推理最终输出三份文件xxx_det.mmd带全部 det 坐标的原始版调试利器xxx.mmd合并全书的干净 Markdownxxx_layouts.pdf把每页的边界框渲染图拼成新 PDF 可直接用于版式质检。页面间用\n--- Page Split ---\n分隔方便后续按页切分。常见问题 FAQ❓ 框的位置明显偏移坐标还原依赖原图宽高x / 999 * width。请保持crop_modeTrue的动态分辨率预处理确保送入模型的图和渲染时用的是同一张原图不要用预处理后的缩放图去画框。❓ 输出里没有|det|标签检查 prompt 是否带|grounding|纯文字密集的图可换Free OCR模式版式标注只服务于结构化文档。❓ 想只调视觉 token 数量分辨率策略由 count_tiles() 决定默认(0-6)×768×768 1×1024×1024大图会自动切 2~6 块局部视图加一张全局缩略图。 小结|grounding|打开版式检测开关 →|det|携带 0~999 归一化坐标 → 除以 999 映射回像素 → PIL 画框 裁剪插图。四步链路单图、PDF 两种入口脚本都已封装好改两个路径配置即可上手。【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

UMAP 结果可视化与诊断:umap.plot 完整实战指南 2026/9/26 21:09:48

UMAP 结果可视化与诊断:umap.plot 完整实战指南

机器学习数据可视化 【免费下载链接】umap Uniform Manifold Approximation and Projection 项目地址: https://gitcode.com/gh_mirrors/um/umap 点击查看 免费下载 UMAP(Uniform Manifold Approximation and Projection)最常见的用途之一就…

阅读更多 →
2026期货量化软件选型指南:从回测撮合到实盘细节 2026/9/26 21:09:22

2026期货量化软件选型指南:从回测撮合到实盘细节

每年年初都会有人追着问我同一个问题:2026年了,期货量化软件到底选哪家?这个问题的热闹程度不亚于论坛里任何一张漂亮的资金曲线图,但多数讨论都停留在“谁家指标多”“谁家信号快”的浅层,最终演变成各说各话。我从CT…

阅读更多 →
GameHorizon Suite:多时间尺度评估如何重塑游戏AI Benchmark 2026/9/26 21:09:22

GameHorizon Suite:多时间尺度评估如何重塑游戏AI Benchmark

1. 从"单点评估"到"多时间尺度":GameHorizon Suite 要解决的真问题做游戏 AI 评测的人大概都有过这种体验:一个智能体在开局前 30 秒表现惊艳,走位精准、决策果断,但打到第 5 分钟就开始犯迷糊,资…

阅读更多 →
强化学习驱动的视频生成智能体:奖励设计与训练实战 2026/9/26 21:09:22

强化学习驱动的视频生成智能体:奖励设计与训练实战

1. 视频生成智能体的核心命题拆解1.1 从“单次生成”到“多轮决策”的范式转变VideoGen-Agent 这个标题里最值得琢磨的词其实是 Agent,而不是 Video Generation。过去两年,视频生成模型的能力提升主要沿着一条路径走:更大的数据、更强的时序建…

阅读更多 →
PowerBuilder 9.0.3 LNK2001链接错误的ABI级修复方案 2026/9/26 21:09:22

PowerBuilder 9.0.3 LNK2001链接错误的ABI级修复方案

简介:PB9.0.3 8836补丁包是面向PowerBuilder 9.0.3开发者的官方错误修复更新(EBF14228),专为解决Web Service调用过程中的兼容性缺陷、数据传输异常及性能瓶颈而设计,适用于企业级数据库应用开发中依赖SOAP接口集成的中…

阅读更多 →
告别JVM依赖:node-plantuml-2实现纯Node.js渲染PlantUML 2026/9/26 21:09:22

告别JVM依赖:node-plantuml-2实现纯Node.js渲染PlantUML

把PlantUML画图流程里的Java依赖拿掉,这个念头在我脑子里转了快两年。每次换电脑、配CI、折腾Docker镜像的时候,这个痛点就冒出来一次。直到我试了node-plantuml-2,才意识到原来这件事真的可以做到,而且做得干净利落。这篇就围绕这…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉