新闻详情

新闻详情

首页 / 资讯中心 / 详情

DeepSeek-OCR-2 vLLM部署指南:用AsyncLLMEngine构建流式输出OCR推理服务

发布时间:2026/9/28 20:24:57来源:尧图网络
DeepSeek-OCR-2 vLLM部署指南:用AsyncLLMEngine构建流式输出OCR推理服务
DeepSeek-OCR-2 vLLM部署指南用AsyncLLMEngine构建流式输出OCR推理服务【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是 DeepSeek 推出的新一代视觉因果流Visual Causal FlowOCR 大模型支持将文档图片高保真地转换为 Markdown。本文带你用 vLLM 部署 DeepSeek-OCR-2通过AsyncLLMEngine实现逐 token 流式输出并掌握图片流式推理与 PDF 高并发批处理两种服务模式快速搭建你的 OCR 推理服务。项目亮点为什么选择 DeepSeek-OCR-2DeepSeek-OCR-2 的视觉编码器DeepEncoder V2采用LM as Vision Encoder设计——用 Qwen2 语言模型代替传统 CLIP 作为视觉编码器并引入因果可读顺序new reading order让模型像人眼一样按阅读顺序扫描文档。对比 v1 架构可以看到v2 在 non-causal 的 Tokenizer 之后新增了 causal 的 LM 视觉编码层这正是文档理解能力跃升的关键。环境准备一键安装步骤官方推荐环境为CUDA 11.8 PyTorch 2.6.0 vLLM 0.8.5# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 cd DeepSeek-OCR-2/DeepSeek-OCR2-master/DeepSeek-OCR2-vllm # 2. 创建 Python 环境 conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2 # 3. 安装依赖torch cu118 vllm 0.8.5 whl flash-attn pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl # 需提前下载该 whl pip install -r ../../requirements.txt pip install flash-attn2.7.3 --no-build-isolation⚠️ 安装时若提示vllm 0.8.5cu118 requires transformers4.51.1的版本冲突可忽略——vLLM 与 Transformers 双端运行不受影响。核心原理AsyncLLMEngine 如何实现流式输出流式推理的核心在 run_dpsk_ocr2_image.py 的stream_generate函数关键只有三步注册模型将自定义的多模态模型 DeepseekOCR2ForCausalLM 注册到 vLLM 的ModelRegistry构建异步引擎AsyncLLMEngine.from_engine_args(AsyncEngineArgs(...))设置max_model_len8192、gpu_memory_utilization0.75异步迭代增量文本async for request_output in engine.generate(request, sampling_params, request_id): full_text request_output.outputs[0].text new_text full_text[printed_length:] # 只打印新增部分 print(new_text, end, flushTrue) printed_length len(full_text)async for每轮拿到的是累计全文用printed_length切出增量即可实现打字机效果——这是构建 SSE 流式 OCR API 的标准做法。此外还挂载了NoRepeatNGramLogitsProcessor见 process/ngram_norepeat.py通过 n-gram 去重防止长表格输出陷入重复循环并对td、/td加白名单保护 HTML 结构不被误杀。场景一图片流式 OCR推荐入门python run_dpsk_ocr2_image.py运行流程读取INPUT_PATH图片 →DeepseekOCR2Processor动态分块编码见 process/image_process.pyAsyncLLMEngine 逐 token 流式输出 Markdown自动后处理解析|ref|定位框 → 在图上绘制彩色边界框、裁出内嵌图片最终产出 3 样文件result.mmd干净版 Markdown含图片引用result_with_boxes.jpg带布局框标注的可视化图images/从文档中裁剪出的子图动态分辨率默认 (0~6)×768×768 1×1024×1024 分块最大仅 256144 个视觉 token显存占用非常友好。场景二PDF 高并发批处理python run_dpsk_ocr2_pdf.pyPDF 场景改用同步LLM接口 max_num_seqsMAX_CONCURRENCY默认 100 并发配合 64 个预处理的线程池整体速度与 DeepSeek-OCR 持平。流程为PDF 逐页 144 DPI 渲染 → 批量推理 → 合并输出带分页标记的.mmd并用img2pdf回排出布局标注 PDF。关键参数调优清单所有参数集中在 config.py上手必改 3 处参数说明建议MODEL_PATH模型路径填本地权重目录或deepseek-ai/DeepSeek-OCR-2INPUT_PATH/OUTPUT_PATH输入输出目录按你的数据改MAX_CONCURRENCY并发数显存不足时调低如 32PROMPT推理提示词见下方两种模式NUM_WORKERS图像预处理线程CPU 核多可上调两种官方提示词文档转 Markdown带布局image\n|grounding|Convert the document to markdown.纯文字 OCR无布局image\nFree OCR.批量评测基准如 OmniDocBench v1.5则使用 run_dpsk_ocr2_eval_batch.py。常见问题速查显存不够 OOM调低gpu_memory_utilization与MAX_CONCURRENCY或换 24G 以上显存的 GPU输出表格无限重复确认已启用NoRepeatNGramLogitsProcessorPDF 场景可关闭SKIP_REPEAT观察图片方向错乱推理脚本内置 EXIF 转正ImageOps.exif_transpose无需手动处理想用 HuggingFace 直接推理见 DeepSeek-OCR2-hf/run_dpsk_ocr2.py基于flash_attention_2适合快速验证而非高吞吐服务。总结DeepSeek-OCR-2 的 vLLM 部署路径非常清晰AsyncLLMEngine负责单图流式输出、LLM批量接口负责 PDF 高并发二者共享同一套模型注册与动态分辨率编码逻辑。按照本指南 30 分钟内即可跑通首个流式 OCR 请求并在此基础上轻松封装为 HTTP/SSE 推理服务。【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ng-zorro-antd 的 nzAggregate 管道:一行代码完成数组 Sum、Max、Min、Average 聚合计算 2026/9/28 21:11:07

ng-zorro-antd 的 nzAggregate 管道:一行代码完成数组 Sum、Max、Min、Average 聚合计算

UI组件前端 【免费下载链接】ng-zorro-antd Angular UI Component Library based on Ant Design 项目地址: https://gitcode.com/gh_mirrors/ng/ng-zorro-antd 点击查看 免费下载 本文介绍 NG-ZORRO(ng-zorro-antd)通用 Pipes 集合中的 nzAg…

阅读更多 →
EchoMusic Windows 任务栏播放器实现原理:三步搞定只读 UI Automation 几何查询与 DPI 适配 2026/9/28 21:11:07

EchoMusic Windows 任务栏播放器实现原理:三步搞定只读 UI Automation 几何查询与 DPI 适配

EchoMusic Windows 任务栏播放器实现原理:三步搞定只读 UI Automation 几何查询与 DPI 适配 【免费下载链接】EchoMusic 🎉 一个简约的第三方酷狗概念版音乐播放器 项目地址: https://gitcode.com/gh_mirrors/ec/EchoMusic EchoMusic 是一款简约的…

阅读更多 →
2026上课录音一键转文字,同步整理课堂要点,留学上网课再也不怕 2026/9/28 21:11:07

2026上课录音一键转文字,同步整理课堂要点,留学上网课再也不怕

很多在外留学上网课的同学,都有过这样的煎熬时刻。时差打乱作息,顶着困意坐在电脑前听课,外教语速飞快,带着浓重的地方口音,专业术语一个接一个蹦出来。老师一边讲一边翻PPT,刚记下上一句知识点&#xff0c…

阅读更多 →
RAG 从能用到好用,中间差的不是一个模型 2026/9/28 21:11:07

RAG 从能用到好用,中间差的不是一个模型

到这里,RAG 的主线其实已经比较清楚了。资料先被处理成片段,片段被转成向量,存进类似 ChromaDB 这样的向量数据库。 用户提问后,系统先检索资料,再把资料交给大模型回答。听起来是不是已经差不多了? 说实…

阅读更多 →
高光谱影像分类实战:深度融合(2D)2PCA、双通道CNN与SVM 2026/9/28 21:11:01

高光谱影像分类实战:深度融合(2D)2PCA、双通道CNN与SVM

简介:面向毕业设计、课程设计与项目开发的高光谱遥感影像识别与分类的Python实现资源,围绕休斯现象、空谱特征提取与分类器泛化等关键问题展开。针对高光谱影像分类中常见的维度灾难问题,提出基于波段组合的二维双向主成分分析降维方法、双通…

阅读更多 →
Jev是什么?AI编码智能体的概念、接入实践与避坑指南 2026/9/28 21:11:00

Jev是什么?AI编码智能体的概念、接入实践与避坑指南

最近不管是搞AI的群,还是写代码的群,都在传“Jev”。有人问“Jev模型官网在哪”,有人问“Jev密钥怎么申请”,还有人已经默认能在Codex里接入它开始实战了。作为一个经常替团队做技术选型的人,我第一反应不是围观&#…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉