新闻详情

新闻详情

首页 / 资讯中心 / 详情

DeepSeek-OCR-2架构深度解析:Visual Causal Flow背后的LM as Vision Encoder

发布时间:2026/9/27 1:24:05来源:尧图网络
DeepSeek-OCR-2架构深度解析:Visual Causal Flow背后的LM as Vision Encoder
DeepSeek-OCR-2架构深度解析Visual Causal Flow背后的LM as Vision Encoder【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是新一代文档 OCR 大模型其核心创新Visual Causal Flow视觉因果流用语言模型LM as Vision Encoder替代传统 CLIP 视觉编码器实现更接近人类阅读方式的视觉编码。本文将用通俗语言带你完整拆解它的架构设计、关键模块与快速上手方法。 一图看懂整体架构先看官方架构图对比第一代 DeepEncoder 与新版本的差异左边的 DeepEncoder一代用CLIP ViT300M做非因果双向注意力编码右边的DeepEncoder V2则换成了LM as Vision EncoderQwen2 500M图像 patch 部分仍走非因果注意力而后面拼接的可学习 querylearnable query走因果注意力形成一条视觉因果流最终只保留 query 的输出作为图像表征。这就是标题中Visual Causal Flow的由来。 三大核心模块Tokenizer、LM编码器、投影器模型主干由三部分串联完成视觉编码在 deepseek_ocr2.py 中一目了然模块实现作用① 视觉 Tokenizer80MSAM ViT-B16× 下采样把图像切成 16×16 的 patch压成低维特征② LM as Vision Encoder500M24 层 Qwen2 Decoder用非因果 因果混合注意力聚合图像信息③ 线性投影器Linear 896→1280把视觉特征对齐到 LLM 的词嵌入维度之后特征送入基于 DeepSeek V2/V3 架构的语言模型支持 MLA生成 Markdown 文本。其中投影器就是一个简单的线性层见 build_linear.py。 核心创新为什么用语言模型当视觉编码器传统做法是CLIP 提特征 → 拼接给 LLM视觉与语言之间存在语义鸿沟。DeepSeek-OCR-2 的思路是让视觉编码阶段就使用语言模型的结构从源头抹平这个鸿沟。关键实现在 qwen2_d2e.py核心机制有三点混合注意力掩码图像 patch token 之间用非因果双向注意力互相可见query token 用因果注意力逐个读完前面的图像信息。可学习 query 做信息压缩按分辨率注入 144 个或 256 个可学习 query见 qwen2_d2e.py#L247-L248最终只输出 query 部分作为整张图像的表征——相当于让模型按阅读顺序读完文档只留下摘要。新阅读顺序query 排列顺序即new reading order模拟人类从左到右、从上到下的阅读习惯这正是Visual Causal Flow的含义——信息沿因果链从图像流转到输出。这种解码器当编码器用Decoder as Encoder的设计让 OCR 结果天然更符合文档阅读顺序。 动态分辨率全局 局部双视图为了同时看清文档全貌和细小文字DeepSeek-OCR-2 采用双视图策略参数在 config.py 中配置全局视图整页图像 padding 到 1024×1024编码为 256 个 token把握版面结构局部视图大图自动按长宽比切分为最多 6 块 768×768 的裁剪块MAX_CROPS6每块编码为 144 个 token保证细节清晰视图分隔符用可学习的view_seperatortoken 区分局部与全局特征见 deepseek_ocr2.py#L442。分块逻辑在 image_process.py 的 count_tiles 中完成根据原图宽高比从候选比例里挑最接近的一个兼顾变形最小与 token 预算。 快速上手两种推理方式方式一vLLM 推理推荐支持并发与流式输出python run_dpsk_ocr2_image.py # 单图流式输出 python run_dpsk_ocr2_pdf.py # PDF并发处理需先在 config.py 中修改INPUT_PATH/OUTPUT_PATH。方式二Transformers 推理python run_dpsk_ocr2.py完整示例见 run_dpsk_ocr2.py核心调用仅一行model.infer(...)并内置NoRepeatNGram解码策略ngram_norepeat.py抑制重复输出。两条常用 Prompt# 文档转 Markdown带版面理解 prompt image\n|grounding|Convert the document to markdown. # 纯自由 OCR无版面约束 prompt image\nFree OCR. 总结DeepSeek-OCR-2 用三个设计亮点重新定义了 OCR 大模型LM as Vision Encoder——语言模型直接编码图像消除视-文语义鸿沟Visual Causal Flow——非因果 因果混合注意力让图像信息沿阅读顺序流动并被 query 压缩动态分辨率双视图——全局看版面、局部看细节token 数量可控。配套论文 DeepSeek_OCR2_paper.pdf 提供了完整的实验数据感兴趣的读者可以深入阅读。【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

嵌入式总线选型指南:UART、I2C、SPI、I2S核心原理与实战对比 2026/9/27 10:27:26

嵌入式总线选型指南:UART、I2C、SPI、I2S核心原理与实战对比

1. 四种总线到底该怎么选:先搞清楚它们各自在解决什么问题嵌入式开发干久了,你会发现一个很有意思的现象:新手最纠结的往往不是算法,而是“这个传感器到底该接哪条总线”。i2c、i2s、spi、uart这四个名字天天在数据手册里晃&#…

阅读更多 →
烧录良率低?92%问题出在信号链路物理层 2026/9/27 10:27:18

烧录良率低?92%问题出在信号链路物理层

1. 烧录失败不是玄学,是信号链路上的“断点”在报警“烧录良率上不去”这句抱怨,我在产线支持、FAE现场和客户实验室里听过不下两百次。它往往出现在小批量转量产、新PCB投产、或者更换烧录器型号后的第三天——工程师盯着烧录日志里反复出现的“Verific…

阅读更多 →
ESP32多模块NVS命名空间隔离实战指南 2026/9/27 10:27:18

ESP32多模块NVS命名空间隔离实战指南

1. 项目概述:为什么小应用共用 Flash 会“串门”?你手头有块 ESP32,跑着温控、OTA 升级、蓝牙配网、Wi-Fi 历史记录四个功能模块——它们都默认往同一块 Flash 里写数据。某天你发现:设备重启后 Wi-Fi 密码丢了,但蓝牙…

阅读更多 →
外贸推广如何做?3个建站避坑指南与注意事项 2026/9/27 10:27:18

外贸推广如何做?3个建站避坑指南与注意事项

外贸推广如何做?3个建站避坑指南与注意事项 域名解析报错,服务器时区不对,后台数据全是乱码。 这就是很多做外贸的朋友在搞独立站时遇到的真实噩梦。 你以为【外贸推广如何做】就是找几个渠道发发广告? 错。地基没打牢,后面全是废棋。…

阅读更多 →
d3dx9_43.dll缺失修复全指南:DirectX 9.0c运行库安装文件常见问题解决方案 2026/9/27 10:27:11

d3dx9_43.dll缺失修复全指南:DirectX 9.0c运行库安装文件常见问题解决方案

在使用电脑系统时经常会出现丢失找不到某些文件的情况,由于很多常用软件都是采用 Microsoft Visual Studio 编写的,所以这类软件的运行需要依赖微软Visual C运行库,比如像 QQ、迅雷、Adobe 软件等等,如果没有安装VC运行库或者安装…

阅读更多 →
嵌入式烧录良率低?从信号完整性到产线环境的全链路排查指南 2026/9/27 10:27:04

嵌入式烧录良率低?从信号完整性到产线环境的全链路排查指南

烧录良率上不去?这问题我太熟了——过去三年,我在深圳、苏州、成都三地的产线跑过二十多个嵌入式项目,从MCU到Wi-Fi SoC,从消费电子到工业网关,几乎每个量产爬坡阶段都卡在“烧录失败率突然升高”这个环节。不是程序写…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉