新闻详情

新闻详情

首页 / 资讯中心 / 详情

Nex-N2.5-Pro 开源部署与使用指南:SGLang Docker 启动、思维模式控制与工具调用实战

发布时间:2026/9/29 16:10:27来源:尧图网络
Nex-N2.5-Pro 开源部署与使用指南:SGLang Docker 启动、思维模式控制与工具调用实战
大模型基础模型多模态AI Agent计算机视觉【免费下载链接】Nex-N2.5-Pro项目地址https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-Pro点击查看免费下载本文基于 Nex-N2.5 模型家族官方发布说明与开源仓库系统讲解以Nex-N2.5-Pro为代表的 Agentic 模型如何通过定制 SGLang 镜像完成本地/多卡部署、如何配置采样参数与思维模式、如何开启函数调用与推理解析并结合仓库内的 config.json、chat_template.jinja 等文件深入解析底层实现。读完本文你将能够独立完成 Nex-N2.5 三档模型的 Docker 启动、OpenAI 兼容接口调用以及面向电脑操控 网页浏览 视觉反馈自校正的长程 Agent 任务的工程配置。一、Nex-N2.5 是什么面向真实环境长程任务的 Agentic 模型家族Nex-N2.5 是 Nex-AGI 推出的下一代 Agentic 模型家族定位是为真实世界环境中的长程任务long-horizon tasks而构建。官方发布口径中这一代模型强化了持续行动 通过视觉反馈自我校正的能力——模型可以直接操作电脑与浏览器也能自主执行并测试程序。在这个体系里视觉不再只是一个输入模态而是 Agent感知环境、验证结果、推进任务的关键接口。Nex-N2.5 共分三个尺寸档位本仓库镜像对应其中的Pro档档位定位Nex-N2.5-mini轻量档延续 Nex-N2 的多模态基础聚焦 computer use、web browsing 与视觉 grounding 的 Agent 能力适合单卡/双卡部署Nex-N2.5-Pro主力档本仓库同样基于 Nex-N2 的多模态基础做定向增强平衡性能与部署成本Nex-N2.5-Max旗舰档构建于 1.6 万亿参数的纯文本 Mixture-of-ExpertsMoE基座之上是首次在万亿参数规模完成系统化后训练的产物在训练维度官方还强调这一代扩大了 Agent 训练环境、任务类型与生产力场景的范围并在更大模型中积累了 Agentic 能力训练的实际经验。模型权重将以开源形式发布同时提供托管在线服务。二、开源仓库组成与权重获取本仓库是Nex-N2.5-Pro的开源镜像根目录下包含推理与部署所需的全部配置文件文件作用config.json模型架构与量化配置qwen3_5_moechat_template.jinja官方 Chat 模板内置思维模式、工具调用、图文/视频占位处理tokenizer_config.json分词器配置Qwen2Tokenizermodel_max_length262144tokenizer.json分词器词表文件processor_config.json多模态 ProcessorQwen3VLProcessor图像 视频预处理preprocessor_config.json图像预处理器参数model-00001-of-00122.safetensors~model-00122-of-00122.safetensors122 个权重分片model.safetensors.index.json权重分片索引经 Git LFS 管理figures/Nex-N2.5-Benchmark-white.png官方 Benchmark 总览图需要特别说明的是仓库中的*.safetensors权重文件以Git LFS 指针形式存储本地文件仅 100 余字节内容为version https://git-lfs.github.com/spec/v1头部因此通过git clone拉取仓库后还需执行git lfs pull才能将真实权重下载到本地。获取权重后即可按下文方式部署。三、架构速览从 config.json 看 Nex-N2.5-Pro 的实现尽管 README 聚焦使用层面但仓库内的 config.json 提供了充分的架构证据能帮助我们理解部署参数为何如此设置。3.1 模型基座与总体结构架构Qwen3_5MoeForConditionalGenerationmodel_type为qwen3_5_moe精度默认bfloat16dtype: bfloat16上下文长度max_position_embeddings: 262144与 tokenizer_config.json 中的model_max_length: 262144一致——这也是部署命令中--context-length 262144的由来词表vocab_size: 248320eos_token_id: 248044。3.2 混合注意力线性注意力 全注意力text_config.layer_types列出的 60 层中绝大多数为linear_attention并每隔 4 层插入一层full_attentionfull_attention_interval: 4。这种线性注意力与全注意力混合的布局是长上下文场景下控制 KV 开销的关键——线性注意力层不随序列长度线性增长缓存全注意力层则保留关键位置的精确检索能力。配套参数包括linear_key_head_dim: 128、linear_num_key_heads: 16linear_value_head_dim: 128、linear_num_value_heads: 64linear_conv_kernel_dim: 4、mamba_ssm_dtype: float32head_dim: 256、num_attention_heads: 32、num_key_value_heads: 2这也解释了 README 部署命令中--mamba-scheduler-strategy extra_buffer这一调度参数的存在意义。3.3 MoE 配置num_experts: 512num_experts_per_tok: 10每 token 激活 10 个专家shared_expert_intermediate_size: 1024、moe_intermediate_size: 1024router_aux_loss_coef: 0.001output_router_logits: false。大专家数 稀疏激活是万亿参数 MoE 的典型形态部署时通过--ep-size专家并行与--moe-a2a-backend deepep等参数进行并行化。3.4 FP8 块量化quantization_config采用compressed-tensorsquant_method: compressed-tensors状态compressed配置了名为FP8_BLOCK的量化组权重8 bit、strategy: block、block_structure: [128, 128]、对称、observer: memoryless_minmax输入激活8 bit、strategy: group、group_size: 128、动态量化dynamic: true。同时通过ignore规则排除了一部分敏感层re:.*visual.*、re:.*embed_tokens.*、re:.*lm_head.*、re:.*mlp\.gate$、re:.*linear_attn\.conv1d$等保证视觉塔、词嵌入与门控路由保持更高精度。3.5 多模态视觉塔vision_config表明其视觉编码器延续 Qwen3VL 风格patch 16、temporal patch 2、27 层深度、hidden_size: 1152、out_hidden_size: 4096对齐语言侧 hidden size、spatial_merge_size: 2并支持视频输入temporal_patch_size: 2。语言侧同时存在image_token_id: 248056、video_token_id: 248057与vision_start/end_token_id与 processor_config.json 中Qwen3VLProcessor的图像/视频双路预处理视频默认fps: 2、max_frames: 768、min_frames: 4构成完整的多模态链路。四、性能表现官方评测概览官方在 coding、agentic workflows、computer use、multimodal understanding 四类场景下对mini / Pro / Max三档模型进行了评测。以下为 README 公布的完整结果加粗为各基准最佳成绩含并列—表示数据不可用。4.1 文本基准Text BenchmarksBenchmarkNex-N2.5-miniNex-N2.5-ProNex-N2.5-MaxClaude Opus 5GPT-5.6 SolKimi-K3GLM-5.3DeepSeek-V4-Pro-0813Qwen3.8-MaxCODINGTerminal-Bench 2.173.482.786.189.188.888.388.287.986.6SWE-Bench Pro43.861.265.779.264.663.364.655.467.7DeepSWE v1.136.155.865.673.772.767.566.962.869.3AGENTICAutomationBench v1.0.632.344.250.250.345.846.748.243.239.8Toolathlon Verified54.668.574.776.574.976.573.074.172.5GDPval-AA v2144616281713183117111675176315801717Job Bench28.541.453.665.745.452.958.254.153.4BrowseComp83.489.792.690.890.491.2———4.2 多模态基准Multimodal BenchmarksBenchmarkNex-N2.5-miniNex-N2.5-ProMiniMax-M3Claude Opus 5GPT-5.6 SolKimi-K3GLM-5.3-FlashDeepSeek-V4-Flash-VisionQwen3.8-MaxOSWorld-Verified71.282.275.283.483.284.862.376.786.1OSWorld-230.556.422.368.362.758.3——46.7WebTest48.652.8——54.0———52.3WebArena-Verified63.467.6——69.771.6—62.366.8OSWorld-G82.987.4—76.877.779.683.359.484.9Vision2Web52.968.259.0—79.8———75.1SWE-MM25.538.2—59.440.237.320.639.239.2OmniDoc89.792.291.6—92.9———92.1评测方法脚注官方口径分数来源凡有公开来源的分数取自官方 Benchmark 榜单及模型厂商最新评测报告包括 Kimi-K3、Qwen3.8-Max、GLM-5.3、HY4 报告无公开来源的结果由官方自评获得。采样参数官方评测统一使用temperature 0.7、top_p 0.95、top_k 40。评测框架Coding 类任务使用 NexAU 框架评测。DeepSeek-V4-Pro评测使用 DeepSeek-V4-Pro-0813 版本。AutomationBench使用 Public 版本。BrowseComp当 token 用量超过模型上下文窗口的 60% 时采用 Summary context-compaction 策略。Vision2Web报告的是 Frontend、Webpage、Website 三个类别的平均分使用 Gemini-3.5-Flash 作为 VLM 裁判、GLM-5V-Turbo (Claude Code) 作为 GUI Agent。Computer-use / browser-use 基准OSWorld、WebTest、WebArena使用官方 NexCUA 评测框架grounding 坐标归一化到 0–1000 尺度NexCUA 项目即将开源。WebTestBench以oracle mode评测仅用 ground-truth 清单评估缺陷检测能力不包含清单生成环节。记法加粗为最佳成绩含并列—表示数据不可用。五、Docker 部署基于定制 SGLang 的一键启动官方提供预构建 Docker 镜像nexagi/sglang:v0.5.18-nex-patch其中预装了经过定制修改的sglang分支可直接承载 Nex-N2.5 全系模型。启动命令的核心是python3 -m sglang.launch_server加一系列模型相关参数。5.1 Nex-N2.5-Pro单节点 8 × H100docker run --gpus all --shm-size 32g --ipchost \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 8 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-Pro/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer要点说明--gpus all --shm-size 32g --ipchost暴露全部 GPU、放大共享内存并共享主机 IPC 命名空间是 SGLang 多卡推理的常规要求-v /path/to/your/model:/model将权重目录挂载进容器--model-path /model指向容器内路径--tp 88 卡张量并行--reasoning-parser qwen3将模型的思考轨迹与最终回答分离详见下文--tool-call-parser qwen3_coder开启函数调用解析--chat-template指定本仓库根目录下的 chat_template.jinja--mamba-scheduler-strategy extra_buffer为线性注意力/Mamba 风格层预留额外缓冲这是混合注意力模型特有的调度参数。5.2 Nex-N2.5-mini单节点 2 × H100docker run --gpus all --shm-size 32g --ipchost \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 2 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-mini/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer5.3 Nex-N2.5-Max多节点 16 × H200Max 档需2 个节点共 16 块 H200且每个节点上运行同一条命令通过环境变量区分角色node-rank主节点填0另一节点填1node0-ip主节点 IP其余节点必须可达。docker run --gpus all --shm-size 32g --network host \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /path/to/your/model \ --trust-remote-code \ --host 0.0.0.0 \ --port 8000 \ --nnodes 2 \ --node-rank ${NODE_RANK} \ --dist-init-addr ${MASTER_ADDR}:5000 \ --tp 16 \ --pp-size 1 \ --dp 1 \ --ep-size 16 \ --attention-backend dsv4 \ --kv-cache-dtype fp8_e4m3 \ --page-size 256 \ --moe-a2a-backend deepep \ --moe-runner-backend deep_gemm \ --moe-dense-tp-size 1 \ --deepep-mode auto \ --context-length 262144 \ --mem-fraction-static 0.84 \ --chunked-prefill-size 8192 \ --enable-mixed-chunk \ --disable-overlap-schedule \ --max-running-requests 64 \ --cuda-graph-max-bs-decode 64 \ --cuda-graph-backend-decode full \ --cuda-graph-backend-prefill disabled \ --chat-template /path/to/nex-n2.5-max/chat_template.jinja \ --reasoning-parser deepseek-r1 \ --tool-call-parser qwen3_coder5.4 Max 档关键参数解读参数取值作用--nnodes 2 --node-rank ${NODE_RANK}2 / 0 或 1双节点并行每节点按 rank 分工--dist-init-addr ${MASTER_ADDR}:5000主节点 IP:端口分布式初始化地址--tp 16 --pp-size 1 --dp 1 --ep-size 1616/1/1/16张量并行 16、不做流水与数据并行、专家并行 16契合 512 专家 × 每 token 10 专家激活的 MoE 结构--attention-backend dsv4dsv4指定注意力后端实现--kv-cache-dtype fp8_e4m3fp8_e4m3KV 缓存使用 FP8显著降低长上下文显存占用--page-size 256256分页缓存页大小--moe-a2a-backend deepep --moe-runner-backend deep_gemmdeepep / deep_gemmMoE All-to-All 通信与算子后端配合--deepep-mode auto--moe-dense-tp-size 11稠密专家部分的张量并行度--context-length 262144262144与模型max_position_embeddings对齐--mem-fraction-static 0.840.84预分配显存比例--chunked-prefill-size 8192 --enable-mixed-chunk8192分块 Prefill 与混合分块降低长序列首字延迟--disable-overlap-schedule—关闭调度重叠配合 deep_gemm 后端--max-running-requests 6464最大并发请求数--cuda-graph-max-bs-decode 6464Decode 阶段 CUDA Graph 最大 batch--cuda-graph-backend-decode fullfullDecode 全量 CUDA Graph--cuda-graph-backend-prefill disableddisabledPrefill 阶段不启用 CUDA Graph--trust-remote-code—信任远端代码加载含自定义代码的模型六、推荐采样参数为获得最佳生成质量官方推荐的采样参数为temperature0.7top_p0.95top_k40这也与官方评测所用的采样设置一致见上文脚注 2可作为接入服务时的默认值。七、思维模式控制reasoning_effortNex-N2.5 通过请求中的reasoning_effort字段控制思考行为共有三种模式reasoning_effort模式行为noneNon-thinking不输出思考轨迹直接回答medium默认Adaptive thinking让模型自行决定是否思考以及思考多少highThinking回答前总是先思考以自适应思考为例在 OpenAI 兼容的 Chat Completions 请求中这样设置served-model-name替换为你的服务暴露的模型名{ model: served-model-name, messages: [ {role: user, content: Explain how binary search works.} ], reasoning_effort: medium }模板层实现佐证查看仓库内的 chat_template.jinja 末尾add_generation_prompt分支约 L143–L153可以看到reasoning_effort如何被消费未定义或为none时输出think\n\n/think\n\n空思考块等价于关闭思考为high时输出think\n强制开启思考轨迹其余情况含默认输出think交由模型自适应决定是否继续思考。需要注意的是Nex-N2.5 的 Chat 模板直接消费reasoning_effort而诸如enable_thinking、thinking_mode这类字段需要在网关层做语义翻译后才能生效。八、函数调用Function CallingNex 系列模型具备完善的函数调用能力。启动服务时加入--tool-call-parser qwen3_coder即可启用python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coderchat_template.jinja 中对工具调用有完整的内建支持可从模板代码中看到三个关键机制工具注入当请求携带tools列表时模板自动构造# Tools系统消息将每个工具的 JSON Schematool | tojson以tools.../tools形式注入约 L45–L53调用格式约束模板向模型声明严格的 XML 调用格式——外层tool_call/tool_call嵌套function函数名/function参数以parameter参数名值/parameter逐条给出并要求必要参数必须填写、可在调用前给出自然语言推理、但调用后不得再补充说明约 L53多轮工具结果回填模板会从消息尾部反向扫描用户消息识别被tool_response.../tool_response包裹的工具返回内容并在渲染时将连续的tool角色消息合并进同一段user消息从而支撑多步工具调用循环约 L67–L80、L127–L138。此外模板对多模态内容也有处理图片与视频分别以|vision_start||image_pad||vision_end|、|vision_start||video_pad||vision_end|占位符注入约 L8–L29并支持Picture N:/Video N:编号提示同时会显式拒绝系统消息中包含图片/视频raise_exception(System message cannot contain images.)。九、推理解析器Reasoning Parser当模型输出思考轨迹reasoning trace时需要通过 SGLang 的 reasoning parser 将思考内容与最终回答分离Nex-N2.5-mini 与 Nex-N2.5-Pro--reasoning-parser qwen3Nex-N2.5-Max--reasoning-parser deepseek-r1上面的部署命令已包含正确的 parser 与--tool-call-parser qwen3_coder。Parser 负责从流式输出中剥离think.../think之间的推理内容而是否思考、思考多深则由上一节的reasoning_effort决定。两者配合即可获得思考轨迹与工具调用均可解析的结构化输出。十、接入与验证建议部署完成后可通过 OpenAI 兼容接口向http://host:port/v1/chat/completions发起请求model字段填写服务暴露的served-model-name可用GET /v1/models查询。一个完整的调用建议将temperature、top_p、top_k设为官方推荐值0.7 / 0.95 / 40按任务类型设置reasoning_effort日常问答用默认medium追求稳定思考用high低延迟场景用none涉及工具/浏览器/电脑操作时确保服务启动命令带--tool-call-parser qwen3_coder长上下文场景确认服务侧--context-length与模型 262144 对齐并关注官方 BrowseComp 评测中提到的token 用量超过上下文 60% 时启用摘要压缩这一实践。注意事项本仓库为只读开源镜像部署前请确认已通过git lfs pull获取完整权重--chat-template指向的是各模型对应的 chat_template.jinja本文仓库根目录即 Pro 版模板。若需对照更多实现细节可在仓库中继续查阅 config.json、tokenizer_config.json、processor_config.json 与 preprocessor_config.json。赞分享大模型基础模型多模态AI Agent计算机视觉【免费下载链接】Nex-N2.5-Pro项目地址https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-Pro点击查看免费下载相关推荐Nex-N2.5-mini本地部署完整教程DockerSGLang一键启动2张H100就够了Nex N2.5 mini本地部署完整教程DockerSGLang一键启动2张H100就够了 Nex N2.5 mini 是 Nex AGI 开源的新一代Self-LLM 实战使用 SGLang 部署 MiniCPM5-1B——OpenAI 兼容接口、思考/非思考双模式与原生工具调用Self LLM 实战使用 SGLang 部署 MiniCPM5 1B——OpenAI 兼容接口、思考/非思考双模式与原生工具调用 本篇指南聚焦于在 Linu大模型人工智能教程本地部署微调Nex-N2.5-mini chat_template.jinja逐行精讲154行完整解析工具调用XML格式、多步工具链与思考块Nex N2.5 mini chat_template.jinja逐行精讲154行完整解析工具调用XML格式、多步工具链与思考块 这篇文章对开源多模态智能体模创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

ADS1220+STM32实现PT100高精度测温方案详解 2026/9/29 17:07:28

ADS1220+STM32实现PT100高精度测温方案详解

去年做一套工业循环水温度采集,客户验收标准很直接:0~120℃范围内显示偏差不能超过0.2℃。刚开始我用PT100加一片24位ADC,再配一个自制的恒流源,板子画完调了一周,室温下稳定的时候看着还挺准,可温度一上去…

阅读更多 →
Uvicorn入门到实战:Python异步ASGI服务器的核心原理与部署优化 2026/9/29 17:07:28

Uvicorn入门到实战:Python异步ASGI服务器的核心原理与部署优化

我以前刚接触Python异步Web开发的时候,最头疼的一件事就是:代码写好了,却不知道该拿什么去跑它。Flask时代有Werkzeug自带的开发服务器,Django有runserver,可一旦切到FastAPI、Starlette这类异步框架,很多人…

阅读更多 →
Elasticsearch 8.x RESTful API 核心操作与避坑指南 2026/9/29 17:07:28

Elasticsearch 8.x RESTful API 核心操作与避坑指南

我做 Elasticsearch 相关项目也有七八年了,从 1.x 一路用到 8.x。这几年被问得最多的问题,几乎都是同一个:网上找的"Elasticsearch 基本操作"教程,照着敲PUT /index/type/id,怎么在 8.x 里直接报错&#xff…

阅读更多 →
Java String比较:==与equals的区别及字符串常量池原理 2026/9/29 17:07:28

Java String比较:==与equals的区别及字符串常量池原理

先讲个我上个月帮同事排查的真实bug。测试环境一切正常,部署到生产之后突然冒出一批"登录失败"的工单,查日志发现是账号密码校验环节直接返回了"用户名或密码错误"。代码本身并不复杂:if (user.getPassword() "123…

阅读更多 →
Python调用淘宝商品评论API完整实践:从选型到签名实现 2026/9/29 17:07:15

Python调用淘宝商品评论API完整实践:从选型到签名实现

拿到一批商品评论数据能干什么,做过电商的人心里都有数:分析买家对产品的真实反馈、总结高频差评关键词、盯竞品的最新口碑,甚至反推竞品最近在包装、物流上有没有什么变化。数据量一旦上去,这些都是能做出来的。但真正动手去拿淘…

阅读更多 →
Modbus RTU与RS-485区别详解:从物理层到应用层的通信调试实战 2026/9/29 17:07:15

Modbus RTU与RS-485区别详解:从物理层到应用层的通信调试实战

写了不少年代码、接了不少次线,我发现一个特别有意思的现象:很多刚接触工控或者物联网的人会把Modbus RTU和RS-485当成两种可以二选一的东西。有人问“我该用Modbus RTU还是RS-485?”,有人直接说“我用的是RS-485协议”。每逢这种…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉