新闻详情

新闻详情

首页 / 资讯中心 / 详情

DeepSeek-V3.1-Base 深度解析:671B 混合推理模型的思考模式、工具调用与本地部署实践

发布时间:2026/10/2 8:11:52来源:尧图网络
DeepSeek-V3.1-Base 深度解析:671B 混合推理模型的思考模式、工具调用与本地部署实践
大模型基础模型人工智能深度学习NLP【免费下载链接】DeepSeek-V3.1-BaseDeepSeek-V3.1 是一款支持思考模式与非思考模式的混合模型项目地址https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V3.1-Base点击查看免费下载导读本文以 DeepSeek-V3.1-Base 仓库DeepSeek-V3.1-Base的 README.md 为主线系统讲解这款 671B 参数混合模型的三大核心技术能力通过切换聊天模板在同一模型上实现思考/非思考双模式、专门优化的工具调用ToolCall与 Agent 能力以及 128K 长上下文的两阶段扩展方法与 UE8M0 FP8 量化格式。文章将结合仓库内的 config.json、modeling_deepseek.py、tokenizer_config.json 与 assets/chat_template.jinja 等源码完整还原官方 Prompt 模板、Python 调用示例与本地运行建议使读者能够直接复现思考模式切换、ToolCall 格式拼装与 Agent 轨迹构建的完整流程。一、模型概述与核心升级点DeepSeek-V3.1 是 DeepSeek 系列的混合推理模型Hybrid Model其最大特点是在同一个模型权重上同时支持思考模式Thinking Mode与思考模式Non-Thinking Mode用户不需要加载两套参数只需改变 Chat Template即可切换两种推理风格。相对前代版本官方在 README.md 中总结了三点改进混合思考模式一个模型通过更换聊天模板同时支持思考与非思考两种模式更智能的工具调用经过后训练post-training优化模型在工具使用与 Agent 任务上的表现显著提升更高思考效率DeepSeek-V3.1-Think 在回答质量上与 DeepSeek-R1-0528 相当但响应速度更快。在训练来源上DeepSeek-V3.1 基于 DeepSeek-V3.1-Base 进行后训练而 Base 模型又是在原始 V3 Base 检查点之上采用两阶段长上下文扩展方法构建的——收集了更多长文档数据并将 32K 扩展阶段训练量提升 10 倍至630B tokens128K 扩展阶段提升 3.3 倍至209B tokens。此外DeepSeek-V3.1 在模型权重与激活activations上统一采用UE8M0 FP8 scale data format以确保与微缩放数据格式microscaling data formats兼容。1.1 模型规格一览官方 Model Downloads 表格给出了两个可下载变体的关键指标本仓库即为其中的DeepSeek-V3.1-Base模型总参数量激活参数量上下文长度下载渠道DeepSeek-V3.1-Base671B37B128KHuggingFace / ModelScopeDeepSeek-V3.1671B37B128KHuggingFace / ModelScope671B 总参数量中每次前向只激活 37B 参数这正是其 MoEMixture-of-Experts架构的直接体现。本仓库的 config.json 提供了与表格对应的架构级佐证n_routed_experts 256路由专家总数、n_shared_experts 1共享专家数、num_experts_per_tok 8每个 token 激活 8 个专家、topk_group 4与n_group 8分组路由hidden_size 7168、num_hidden_layers 61、num_nextn_predict_layers 1而max_position_embeddings 163840与rope_scaling.type yarn则对应 128K 上下文与 YaRN 外推策略。1.2 权重结构与长上下文配置从 model.safetensors.index.json 的weight_map可以看到共 91991 个张量条目路由专家的gate_proj / up_proj / down_proj各有 30332 个与 61 层中每层 256 个路由专家、仅前 3 层为 dense 层first_k_dense_replace 3的结构吻合。此外存在model.layers.61.shared_head.norm.weight与model.layers.61.shared_head.head.weight对应num_nextn_predict_layers 1的Multi-Token Prediction (MTP)头在 modeling_deepseek.py 中以DeepseekV3ForCausalLM之外的附加预测模块实现。config.json中的quantization_config块进一步确认了 README 强调的 UE8M0 FP8 细节quantization_config: { activation_scheme: dynamic, fmt: e4m3, quant_method: fp8, weight_block_size: [128, 128], scale_fmt: ue8m0 }其中scale_fmt: ue8m0即 README 中 UE8M0 缩放格式的配置化体现权重按 128×128 块进行 FP8 量化激活采用动态 e4m3 方案。二、Chat Template一套模板两种模式DeepSeek-V3.1 的聊天模板完整定义在仓库的 tokenizer_config.json 的chat_template字段中其可读版本为 assets/chat_template.jinja。模板暴露了两个关键控制参数thinking布尔值True时在生成前缀末尾追加thinkFalse时追加/thinkadd_generation_prompt布尔值是否在消息序列末尾拼接Assistant与对应的思考开关 token。模板内部使用 Jinja 命名空间ns维护状态机is_first / is_tool / system_prompt / is_first_sp / is_last_user将 system 消息合并为单一system_prompt并逐条处理 user / assistant / tool 三类消息。下表总结了 README 描述的四类 Prompt 形态模式轮次完整前缀格式Non-Thinking首轮begin▁of▁sentence{system prompt}User{query}Assistant/thinkNon-Thinking多轮上下文为各轮拼接前缀为User{query}Assistant/thinkThinking首轮begin▁of▁sentence{system prompt}User{query}AssistantthinkThinking多轮前缀为User{query}Assistantthink2.1 Non-Thinking 模式详解非思考模式下模型直接给出答案。与 DeepSeek V3 相比V3.1 引入了一个额外的/thinktoken——即使是首轮非思考对话也会在Assistant之后显式输出/think这一细节在 README 中被特别强调。多轮场景中历史上下文的组装规则为begin▁of▁sentence{system prompt}User{query}Assistant/think{response}end▁of▁sentence...User{query}Assistant/think{response}end▁of▁sentence将上述上下文与当前轮前缀拼接即可得到正确完整的 Prompt。2.2 Thinking 模式详解思考模式的首轮前缀为begin▁of▁sentence{system prompt}User{query}Assistantthink与 DeepSeek-R1 的思路一致模型先产出隐藏的思考过程位于think与/think之间再输出最终答案。多轮思考模板与非思考多轮模板完全相同——也就是说每一轮上下文中都保留/think但最后一轮的思考 token 会被丢弃模型只从think开始续写。这条规则在 Jinja 模板中体现为处理历史 assistant 消息时先将content中/think之前的部分剥离仅保留其后的答案内容并追加end▁of▁sentence只有对当前轮前缀才按thinking参数决定追加think还是/think。2.3 一个模型同时实现两种模式的原因从工程角度理解同一权重之所以能通过模板切换两种模式是因为思考行为由输入侧的触发 tokenthink与/think驱动而非由参数集区分。模板负责把thinking布尔值翻译成前缀 token模型在推理时仅需延续前缀即可。这也意味着部署方不需要准备两套模型服务只需在同一套服务上按请求传入不同模板参数。三、ToolCall非思考模式下的工具调用协议DeepSeek-V3.1 在非思考模式下原生支持 ToolCall。其完整格式为begin▁of▁sentence{system prompt}\n\n{tool_description}User{query}Assistant/think其中tool_description的结构由 README 明确定义为## Tools You have access to the following tools: ### {tool_name1} Description: {description} Parameters: {json.dumps(parameters)} IMPORTANT: ALWAYS adhere to this exact format for tool use: tool▁calls▁begintool▁call▁begintool_call_nametool▁septool_call_argumentstool▁call▁end{additional_tool_calls}tool▁calls▁end Where: - tool_call_name must be an exact match to one of the available tools - tool_call_arguments must be valid JSON that strictly follows the tools Parameters Schema - For multiple tool calls, chain them directly without separators or spaces3.1 格式要点解析tool_call_name必须是可用工具名中精确匹配的一项tool_call_arguments必须是严格符合工具 Parameters Schema 的合法 JSON多工具调用时多个tool▁call▁begin...tool▁call▁end直接首尾相连不加任何分隔符与空格整体包在tool▁calls▁begin与tool▁calls▁end之间。3.2 模板中的 ToolCall 处理逻辑Jinja 模板对 ToolCall 消息的处理与上述协议一一对应assistant 消息若携带tool_calls字段模板在上一轮 user 消息后先输出Assistant/think保持非思考前缀随后逐个拼接tool▁call▁beginnametool▁separgstool▁call▁end最后统一闭合为tool▁calls▁endend▁of▁sentence工具执行结果消息role 为tool被包装为tool▁output▁begin{content}tool▁output▁end作为下一轮上下文的一部分首条工具调用is_first为 false 时允许在tool_calls之前附带一段自由文本message[content]模型通常用一行说明即将调用什么工具其后继调用则不再重复附带。四、Code-Agent 与 Search-AgentAgent 轨迹范例4.1 Code-Agent代码智能体README 指出模型支持多种代码智能体框架开发者可完全依据上文 ToolCall 格式自行搭建自己的代码 Agent仓库中提供了可直接参考的完整交互轨迹示例 assets/code_agent_trajectory.html。从该 HTML 可见其完整调用链system 提示词将模型设定为 “helpful software engineer assistant”并提供bash工具参数为一个 JSON Schema描述 command 字段模型在多轮交互中反复使用tool▁calls▁begintool▁call▁beginbashtool▁sep{...}tool▁call▁endtool▁calls▁end发起命令执行工具结果以tool▁output▁begin/tool▁output▁end包裹返回整个过程与 README 给出的tool_description模板完全一致可作为自定义代码 Agent 的参照实现。4.2 Search-Agent搜索智能体对于需要访问外部或实时信息的复杂问题DeepSeek-V3.1 支持在思考模式下通过多轮工具调用完成搜索 Agent 任务——模型可利用用户提供的搜索工具。README 提供了两份详细模板assets/search_tool_trajectory.html 与 assets/search_python_tool_trajectory.html。从 assets/search_tool_trajectory.html 的第 36 行开始可以看到一个完整的搜索轨迹样例原始问题为“某全球旗舰店被称为博物馆的品牌2025 年 5 月初与一家中国度假酒店集团联名的宣传片艺术指导是谁”system 提示词注入当前日期The current date is 2025-08-16, Saturday、语言一致性约束必须以用户问题同语言回复、引用格式约束引用网页时必须使用[citation:x]以及search工具的 JSON Schema模型在Assistant/think后输出分析过程然后发起tool▁calls▁begintool▁call▁beginsearchtool▁sep{questions: ...}tool▁call▁endtool▁calls▁end调用工具结果以[webpage 0 begin]...的网页片段块返回并包裹在tool▁output▁begin/tool▁output▁end中模型基于多轮搜索结果逐步推理最终给出带[citation:x]引用的结论并以search▁end收束整个搜索回合。关键观察点搜索 Agent 在思考模式下运行因此每一轮都保留think语境历史回合剥离思考内容但保留/think搜索结果被组织为[webpage N begin] / [webpage N end]的结构化片段方便模型在海量结果中定位证据若同时提供 Python 能力assets/search_python_tool_trajectory.html模型还能在搜索之外执行脚本、组合两种工具完成更深度的信息处理。这两份 HTML 轨迹与 Code-Agent 轨迹共同构成了官方认可的 Agent 构建范式开发者可直接复制其中的 system 提示词、工具描述与消息顺序来驱动自己的 Agent 应用。五、Evaluation官方基准结果README 给出了 DeepSeek V3.1含 NonThinking 与 Thinking 两个变体相对 DeepSeek V3 0324、DeepSeek R1 0528 的官方评测数据摘录如下类别基准指标V3.1-NonThinkingV3 0324V3.1-ThinkingR1 0528GeneralMMLU-Redux (EM)91.890.593.793.4GeneralMMLU-Pro (EM)83.781.284.885.0GeneralGPQA-Diamond (Pass1)74.968.480.181.0GeneralHumanitys Last Exam (Pass1)--15.917.7Search AgentBrowseComp--30.08.9Search AgentBrowseComp_zh--49.235.7Search AgentHLE (Python Search)--29.824.8Search AgentSimpleQA--93.492.3CodeLiveCodeBench (2408-2505) (Pass1)56.443.074.873.3CodeCodeforces-Div1 (Rating)--20911930CodeAider-Polyglot (Acc.)68.455.176.371.6Code AgentSWE Verified (Agent mode)66.045.4-44.6Code AgentSWE-bench Multilingual (Agent mode)54.529.3-30.5Code AgentTerminal-bench (Terminus 1 framework)31.313.3-5.7MathAIME 2024 (Pass1)66.359.493.191.4MathAIME 2025 (Pass1)49.851.388.487.5MathHMMT 2025 (Pass1)33.529.284.279.4需要说明的评测条件README 原注搜索 Agent 使用官方内部搜索框架评测商业搜索 API 网页过滤器 128K 上下文窗口R1-0528 的搜索 Agent 结果则基于预定义工作流评测SWE-bench 使用官方内部代码 Agent 框架评测HLE 使用纯文本子集评测。从数据可读出两条主线一是思考模式整体优于非思考模式尤其在数学、代码、GPQA 等推理密集型任务上二是V3.1 的搜索与代码 Agent 能力相对前代与 R1 均有明显提升如 BrowseComp 30.0 vs 8.9、SWE Verified 66.0 vs 45.4。这些数据与 README“后训练优化显著提升工具使用与 Agent 任务表现”的表述相互印证。六、Usage Example完整的 Python 调用README 提供了可直接运行的transformers调用示例。核心在于通过apply_chat_template的thinking参数控制思考模式。import transformers tokenizer transformers.AutoTokenizer.from_pretrained(deepseek-ai/DeepSeek-V3.1) messages [ {role: system, content: You are a helpful assistant}, {role: user, content: Who are you?}, {role: assistant, content: thinkHmm/thinkI am DeepSeek}, {role: user, content: 11?} ] tokenizer.apply_chat_template(messages, tokenizeFalse, thinkingTrue, add_generation_promptTrue) # begin▁of▁sentenceYou are a helpful assistantUserWho are you?Assistant/thinkI am DeepSeekend▁of▁sentenceUser11?Assistantthink tokenizer.apply_chat_template(messages, tokenizeFalse, thinkingFalse, add_generation_promptTrue) # begin▁of▁sentenceYou are a helpful assistantUserWho are you?Assistant/thinkI am DeepSeekend▁of▁sentenceUser11?Assistant/think6.1 调用要点逐条拆解thinkingTrue在最终生成前缀处追加think模型将从思考 token 开始续写thinkingFalse追加/think模型直接输出答案历史 assistant 消息中的思考内容thinkHmm/think会被模板剥离仅保留I am DeepSeek及其后的end▁of▁sentence与 README“历史回合剥离思考 token、保留/think”的规则一致add_generation_promptTrue是开启生成前缀的必要条件否则模板只输出历史部分。该模板的默认行为当thinking未显式给出时默认为False与特殊键处理均在 assets/chat_template.jinja 首部有明确实现。注意示例中的deepseek-ai/DeepSeek-V3.1为官方在线仓库标识本仓库对应的是其Base检查点DeepSeek-V3.1-Base同样遵循上述模板协议。七、How to Run Locally本地运行与使用建议README 明确说明DeepSeek-V3.1 的模型结构与 DeepSeek-V3 相同因此本地运行方式可直接参考 DeepSeek-V3 仓库的说明。对本仓库DeepSeek-V3.1-Base而言模型权重以 163 个.safetensors分片的形式存放model-00001-of-000163.safetensors 至 model-00163-of-000163.safetensors配套 model.safetensors.index.json 索引文件配合transformers仓库内transformers_version标注为 4.44.2即可加载from transformers import AutoTokenizer, AutoModelForCausalLM model AutoModelForCausalLM.from_pretrained(./, torch_dtypeauto, device_mapauto)7.1 两条关键使用建议务必遵守README 给出了两条硬性要求它们直接关系到推理精度与正确性mlp.gate.e_score_correction_bias参数必须用 FP32 精度加载与计算。从源码 modeling_deepseek.py 可见当topk_method noaux_tc时MoEGate会注册一个形状为(n_routed_experts,)的e_score_correction_bias偏置参数即 256 个数值。在 forward 中的 noaux_tc 分支该偏置被逐 token 加到 sigmoid 门控分数上以修正专家选择scores_for_choice scores.view(bsz * seq_len, -1) self.e_score_correction_bias.unsqueeze(0)。同时源码在门控打分处强制将hidden_states与weight转换为torch.float32参与计算——这从实现侧印证了 README 要求该偏置保持 FP32 的意图任何低精度化都可能导致专家路由偏差进而影响整体生成质量。确保 FP8 模型权重与激活采用 UE8M0 scale format。如前文所述这一要求在 config.json 的quantization_configscale_fmt: ue8m0与 README 的 DeepGEMM 指引中均有体现。UE8M0 属于微缩放格式microscaling data formats家族其缩放因子以 8 位无符号指数E8M0形式存放配套的块级缩放weight_block_size: [128, 128]与动态激活量化activation_scheme: dynamic共同保证权重/激活的低精度表示在数值尺度上对齐。此外generation_config.json 提供了推荐的采样默认值do_sample: true、temperature: 0.6、top_p: 0.95加载模型后可沿用这些超参获得与官方一致的生成行为。八、仓库源码速览模型结构的印证为了让读者对上述内容有源码级把握这里补充本仓库关键文件的速览modeling_deepseek.py约 1848 行的完整 Transformers 实现核心类包括DeepseekV3ModelDecoder 主干、DeepseekV3ForCausalLM生成入口含lm_head、DeepseekV3ForSequenceClassification序列分类头、MoEGate分组专家路由门控实现noaux_tctop-k 选择与 sigmoid 打分、DeepseekV3MoE路由 共享专家混合模块、DeepseekV3AttentionMLA 注意力支持 FlashAttention 2 加速见is_flash_attn_2_available相关导入与_flash_attention_forward以及 YaRN 旋转位置编码相关函数configuration_deepseek.pyDeepseekV3Config配置类其__init__签名完整罗列了上文涉及的全部超参n_routed_experts、n_group、topk_group、num_experts_per_tok、routed_scaling_factor、scoring_funcsigmoid、topk_methodnoaux_tc等与 config.json 一一对应tokenizer_config.json 与 assets/chat_template.jinja聊天模板的压缩版与可读版LlamaTokenizerFast分词器特殊 token 为begin▁of▁sentenceBOS、end▁of▁sentenceEOS/PADassets/code_agent_trajectory.html、assets/search_tool_trajectory.html、assets/search_python_tool_trajectory.html三份 Agent 完整轨迹样例是构建 Code-Agent 与 Search-Agent 的最佳参考。九、总结DeepSeek-V3.1-Base 仓库呈现了一整套“混合推理 工具调用”的完整技术栈模式切换think//think两个 token thinking模板参数实现单一权重上的双模式推理工具协议tool▁calls▁begin...tool▁calls▁end包裹、tool▁sep分隔名称与 JSON 参数的标准化 ToolCall 格式支持多工具并行调用Agent 范式以思考模式承载 Search-Agent、以非思考模式承载 Code-Agent两份官方轨迹 HTML 即为可复用的模板精度纪律FP32 的e_score_correction_bias与 UE8M0 FP8 量化格式共同保障 671B 模型在低精度推理下的数值正确性。无论你是要接入 ToolCall 协议、搭建搜索/代码 Agent还是部署 128K 长上下文推理服务都可以从本仓库的模板与源码出发快速完成方案落地。赞分享大模型基础模型人工智能深度学习NLP【免费下载链接】DeepSeek-V3.1-BaseDeepSeek-V3.1 是一款支持思考模式与非思考模式的混合模型项目地址https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V3.1-Base点击查看免费下载相关推荐DeepSeek-V3.1-Base大模型发布混合模式架构革新工具调用能力全面升级DeepSeek V3.1 Base大模型发布混合模式架构革新工具调用能力全面升级 模型概述与核心突破 DeepSeek V3.1 Base作为DeepSe大模型基础模型人工智能深度学习NLP上一篇如何构建高效多平台直播弹幕采集系统开源工具BarrageGrab的完整实战指南下一篇ctf-wiki 格式化字符串漏洞原理全解析从 printf 参数解析到内存泄露与任意写创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Python机器学习课程设计:旅游业发展预测实验报告(Pearson+Lasso+灰色预测+SVR) 2026/10/2 8:56:43

Python机器学习课程设计:旅游业发展预测实验报告(Pearson+Lasso+灰色预测+SVR)

简介:这份资源是一份面向高校学生与机器学习初学者的课程设计实验报告,主题为运用Python预测我国旅游业发展,适合作为课程作业参考、数据分析入门练手或相关课题的写作模板。压缩包内共1个docx文档,约264KB,内容围绕20…

阅读更多 →
新能源汽车销售数据时空特征分析与趋势预测:从粒度对齐到模型选型 2026/10/2 8:56:43

新能源汽车销售数据时空特征分析与趋势预测:从粒度对齐到模型选型

简介:新能源汽车销售数据时空特征分析与趋势预测完整代码数据集,面向数据分析初学者、新能源汽车研究人员以及需要市场研判的从业者,用于学习从数据处理到销量预测的完整Python方案。资源基于Python完成数据探索、缺失值处理、标准化、特征工…

阅读更多 →
FACT:用细粒度跨变量卷积建模动态变量交互,替代注意力机制 2026/10/2 8:56:43

FACT:用细粒度跨变量卷积建模动态变量交互,替代注意力机制

FACT:用细粒度跨变量卷积建模动态变量交互——我为什么放弃了注意力机制多变量时间序列预测里,最让人头疼的问题从来不是“预测算法准不准”,而是“变量之间那层剪不断理还乱的关系到底怎么建模”。温度会影响用电量,交通拥堵会影…

阅读更多 →
Jev 深度解析:TypeSafe AI 接入方案与本地部署实战指南 2026/10/2 8:56:43

Jev 深度解析:TypeSafe AI 接入方案与本地部署实战指南

1. Jev 到底是什么:从热搜词里还原它的真实面貌最近一段时间,不管你是刷技术社区、翻聊天群,还是看短视频评论区,"Jev"这个词出现的频率高得有点离谱。有人把它和 Claude Code 放在一起聊,有人问"Jev 模…

阅读更多 →
Fortify Heap Inspection漏洞解析:从String到char[]的内存安全实践 2026/10/2 8:56:36

Fortify Heap Inspection漏洞解析:从String到char[]的内存安全实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
codex 安装配置与实战避坑指南:从环境准备到高效编码 2026/10/2 8:56:36

codex 安装配置与实战避坑指南:从环境准备到高效编码

1. 从“装完就吃灰”说起:codex 到底适合谁我大概是从去年下半年开始把 codex 当成主力工具来用的,中间经历过装不上、连不通、模型报错、配置被忽略、登录卡死、沙盒起不来这一整套流程。身边不少朋友看我天天在用,也去下了个安装包&#xf…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉