新闻详情

新闻详情

首页 / 资讯中心 / 详情

扩散语言模型Mercury 2.5跑出每秒1107个token:速度这条路线值得关注

发布时间:2026/9/26 7:04:09来源:尧图网络
扩散语言模型Mercury 2.5跑出每秒1107个token:速度这条路线值得关注
据报道Inception Labs 在 9 月 8 日发布了 Mercury 2.5官方给出的吞吐是每秒 1107 个 token跑在市面上常见的 NVIDIA GPU 上上下文长度 260KAPI 报价约每百万输入 token 0.20 美元、每百万输出 token 0.75 美元。它走的不是主流那条路——不是自回归Autoregressive而是扩散语言模型dLLMdiffusion LLM。简单说就是大模型生成文本这件事多了一个不那么逐字念的方案。一、技术上到底变在哪先把两条路线讲清楚自回归路线从左到右一个 token 一个 token 往后生成每一步都依赖前一步的结果本质是串行。速度受限于解码步数、显存带宽优化到极致的一批模型大概也就每秒 200 token 上下。扩散语言模型dLLM从一整段带噪声 / 被掩码的序列出发通过迭代去噪把整句话逐步细化出来。它一次可以细化多个位置天然可以并行所以吞吐能拉得很高。公开资料里Inception 上一代 Mercury 2 已经做到约每秒 1009 token。据 Inception 官方博客Mercury 2.5 相比 Mercury 2 在智能程度上有约 40% 的提升对标的是成本优化型的前沿模型这一类官方点名的参照包括 GPT-5.6 Luna 低配档、Gemini 3.5 Flash-Lite、Claude Haiku 4.5。同时发布的还有 Mercury Voice官方称首 token 延迟低于 170 毫秒面向语音 Agent和 Mercury Router用一个 dLLM 来理解请求、再路由到最合适的模型。这里有个容易被标题盖过的点速度不等于质量。据钛媒体等报道有第三方评测显示 Mercury 2.5 在知识类基准上的准确率偏低、排名靠后。这其实符合扩散路线当前的特征——它的强项在延迟和吞吐弱项在需要精确事实、需要复杂多步推理的场景。首发选每秒多少个 token这个数字而不是某个榜单多少分本身就说明厂商很清楚自己的差异化在哪。二、什么变了什么没变变了的是延迟和吞吐这条线第一次有了独立的架构路线。过去想快基本只能靠堆算力、堆优化现在多了一种换生成方式的选择语音 Agent、实时补全、请求路由这类对首 token 延迟极敏感的场景多了一个可选项。没变的是评测体系仍然以准确率、推理能力为主价格仍然是竞争的主战场企业选型最终看的是单位任务成本而不是 token 单价。扩散模型不会因为快就把自回归模型替掉——至少在知识准确率的问题解决之前不会。三、对普通开发者的实际影响值得关注但没必要立刻搬家。可以先按场景对号入座适合它的场景代码填充 / 补全官方最初就是拿 Mercury Coder 切入编码场景的高并发、低延迟的后台批处理比如分类、抽取、打标作为路由层判断请求该走哪个模型语音类 Agent对首 token 延迟有硬要求不适合它的场景需要高事实准确率的知识问答、数字计算、严谨摘要复杂多步推理、需要长链条思考的任务对输出稳定性要求极高的对外业务成本账要这么算单价低 ≠ 总成本低。真实成本是总成本 ≈ token 用量 × 单价 纠错/重试成本 接入与维护成本如果一个模型答案不够准你需要加一层校验、加一次重试、加一个人工兜底那便宜一半很容易被吃掉。这一点在选型时经常被忽略。四、想试的话怎么上手据官方说明Mercury 模型可以通过 Inception API、Baseten、OpenRouter 三个渠道调用并提供了 1 亿免费 token 用来试。OpenRouter 走的是 OpenAI 兼容接口接入成本很低fromopenaiimportOpenAI clientOpenAI(base_urlhttps://openrouter.ai/api/v1,api_keyYOUR_KEY,)respclient.chat.completions.create(# 具体型号以 OpenRouter 模型页为准Mercury 2.5 上线后替换对应 idmodelinception/mercury-2,messages[{role:user,content:用一个例子解释扩散语言模型和自回归的区别}],)print(resp.choices[0].message.content) 几个坑提醒一下1.**先确认型号和版本号**。新模型上线节奏很快id和价格都以平台模型页为准别照着博客里的旧id直接上生产。2.2.**把它放在延迟敏感的位置别拿它替换主推理模型**。让快的干快的让准的干准的。3.3.**一定要做输出校验**尤其是数字、事实、法律条款这类错一个字就出事的内容。4.4.**先小流量灰度**用自己业务的真实请求跑一批对照别只看官方 demo。 速度这条线确实值得盯但 token/s 从来不是唯一指标。你的业务更怕等得久还是更怕答得错——想清楚这个选型答案基本就出来了。你怎么看评论区聊聊。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

全国矢量地图shp数据实战:坐标系检查、属性清洗与转换避坑指南 2026/9/26 8:40:35

全国矢量地图shp数据实战:坐标系检查、属性清洗与转换避坑指南

简介:全国矢量地图shp格式压缩包,面向GIS学习者、规划师、测绘地信从业者,提供可直接使用的全国基础地理底图。包内共85个文件,以28套shp、shx、dbf三件套为主,附带一个xml元数据文件;其中shp保存点、线、面…

阅读更多 →
MCU开发链路全解析:编译、烧录与仿真自动化实践 2026/9/26 8:40:35

MCU开发链路全解析:编译、烧录与仿真自动化实践

1. 从零搞懂MCU开发链路:编译、烧录、仿真到底在干什么很多人第一次接触嵌入式,拿到一块开发板和一根下载器,脑子里其实是一团浆糊:我写的代码怎么就从电脑里的一个.c文件,变成了板子上跑起来的机器指令?中…

阅读更多 →
鸿蒙NEXT原生IM长连接移植:ArkTS重写MobileIMSDK客户端全复盘 2026/9/26 8:40:35

鸿蒙NEXT原生IM长连接移植:ArkTS重写MobileIMSDK客户端全复盘

从 2018 年第一次给 App 接入 MobileIMSDK 开始,这个开源 IM 框架就一直在我的项目列表里占着位置:Android 端用 Java、iOS 端用 OC,服务端用 JavaSE,一套协议栈跨三端跑。到了 2024 年底,鸿蒙NEXT 全面铺开&#xff0…

阅读更多 →
金融系统架构设计与核心模块实操:从需求拆解到高可用保障 2026/9/26 8:40:35

金融系统架构设计与核心模块实操:从需求拆解到高可用保障

1. 金融服务的核心领域拆解与需求定位1.1 从“financial-services”这个标题能读出什么“financial-services”这个词看起来很大,涵盖面极广。但落到实际项目里,它通常指向一个具体的系统或产品方向——要么是面向个人用户的理财、支付、记账工具&#x…

阅读更多 →
AI自主造实物全链路拆解:从Computer Use到3D打印的工程实践 2026/9/26 8:40:35

AI自主造实物全链路拆解:从Computer Use到3D打印的工程实践

1. 从"AI画图"到"AI造物":这条链路到底卡在哪大多数人第一次听到"AI自主造实物"这个概念,脑子里浮现的画面大概是:对着电脑说一句话,旁边的机械臂就开始咔咔干活,最后递给你一个成品。这…

阅读更多 →
业务开发,M3U8 播放器错误提示文案怎么写更合理 2026/9/26 8:40:28

业务开发,M3U8 播放器错误提示文案怎么写更合理

一、很多项目播放器报错文案写的很糟糕 很多网页 M3U8 播放器,遇到播放失败,直接把 hls.js 原始英文报错展示给普通用户,比如 “MANIFEST_LOAD_ERROR”“FRAG_DECRYPT_ERROR”。普通业务用户根本看不懂这些技术名词,用户看到之后…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉