新闻详情

新闻详情

首页 / 资讯中心 / 详情

一周之内开源模型换了榜首:MiMo-V2.6-Pro 登顶、GLM-5.3-Flash 调用量第一,AI 进入「价格战 + 端侧」双线

发布时间:2026/9/26 8:29:48来源:尧图网络
一周之内开源模型换了榜首:MiMo-V2.6-Pro 登顶、GLM-5.3-Flash 调用量第一,AI 进入「价格战 + 端侧」双线
一周之内开源模型换了榜首这份榜单变动对做应用的人意味着什么先把本周三个事实摆在前面都可查原始来源1.小米 MiMo-V2.6-Pro 登上开放权重open-weights模型第一。据 VentureBeat、TNW 等报道这是一次公开直播的强化学习训练跑出来的模型开放权重榜上超过此前的开源领头者2.智谱 GLM-5.3-Flash 单日调用量增长超过七成位列平台调用量第一并引来马斯克的公开点赞澎湃、新浪财经均有报道3.闭源旗舰在同一天开始降价提质据 AI 行业日报汇总OpenAI 推出轻量化旗舰并称 Token 价格减半、Anthropic 新旗舰推理成本较前代下降约 40%注意这一条来自行业汇总稿官方口径请以各家公告为准。单看每一条都是新闻放在一起看它们指向同一件事模型的成本曲线在往下走而且这次是开源侧领跑。## 一、小米这次公开炼丹真正值得注意的不是分数三个细节值得单独拎出来-训练成本是有数的。关于这次强化学习训练的算力投入不同来源口径不一致有报道写262 万美元也有汇总稿写350 万美元。这种同一个项目两个价很常见——算的是纯算力租用、还是含人力与数据结论差一截。写文章时我把区间都留着而不是挑一个更好看的数字。-过程是公开的。训练过程直播意味着方法可复现的成分比发布一个权重更多。对中小团队来说能抄的往往不是权重而是训练流程与数据配比。-榜单分层要看清楚。开放权重榜Open-Weights Index 之类测的是开放权重模型之间的相对位置不等于在你自己的任务上就能打赢闭源旗舰。榜单是筛子不是判决书。## 二、调用量第一比榜单第一更接近钱智谱这条的要害在调用量单日增长七成、平台上排第一说明有大量真实业务在跑而不是只有评测分。一个模型被大规模调用通常意味着三件事同时成立够便宜、够稳、够好接。对开发者这里有个反直觉的结论跟进被大量调用的模型往往比跟进分数最高的模型更划算——因为生态SDK、工具链、踩坑帖、供应商支持是跟着调用量走的出问题时你能搜到答案。## 三、别忽略第三条线端侧同一周的另一个信号是端侧有厂商发布的新一代移动芯片宣称可原生运行 300 亿参数级别的 MoE 模型并配了常驻的小模型做本地感知来源同为行业汇总具体指标以厂商发布为准。这条线的意义不在手机跑大模型这个口号而在于任务分层- 常驻的、隐私敏感的、要求毫秒响应的判断 → 放端侧- 需要长上下文、复杂推理的 → 走云端- 中间的胶水层意图解析、格式转换、简单工具调用→ 能用小模型就别用大模型。把这三层分开成本往往比换一个更便宜的模型降得更多。## 四、这一周做应用的人可以立刻做的三件事1把贵任务和便宜任务分开记账。拿一周的真实日志按调用点统计 Token 消耗通常会发现 60%~80% 的花费集中在少数几个长上下文 多轮的调用点上。把这些点单独拎出来优化缓存、截断、改成小模型比整体换模型风险小得多。2把提示缓存prompt cache真正用起来。多家都在强调缓存命中时的输入费用折扣汇总稿里提到最高可到九成减免。很多团队接了缓存 API 却没用上原因通常是提示词前缀每次都在变时间戳、随机 ID 混在系统提示里——把不变的部分放前面、变化的部分挪到最后命中率会立刻不一样。3给换模型准备一条自己的小评测。不要用公开榜单决定选型。攒 30~50 条你自己的真实请求含边界失败案例写成一个能一键复跑的脚本记录准确率、平均延迟、单次成本。以后每次换模型跑它一遍——这是团队里最便宜的防跟风机制。## 五、一点冷静的话这一周的新闻密度很高但噪音也高训练成本口径不一、榜单维度不同、“某某登顶往往指某个特定榜单的特定指标。写这篇文章时我尽量把不确定的部分标出来因为对读者真正有用的不是谁第一”而是**“这周之后我的成本结构可以怎么改”**。模型会一直换榜首。能留下来的是你自己那套评测、记账和分层的方法。—### 来源- VentureBeatXiaomi’s MiMo-V2.6-Pro debuts as the top open weights model- The Next WebXiaomi’s MiMo-V2.6 tops the open-weight rankings- Mixed-NewsMiMo-V2.6-Pro tops open models after a $2.62m RL run- OrcaRouterMiMo-V2.6-Pro 在 Open-Weights Index 上得分 46- 澎湃新闻智谱 GLM-5.3-Flash 当日调用量增超七成位列第一- 新浪财经智谱榜单登顶马斯克点赞- CSDN《2026年9月23日AI行业日报》闭源降价、算力基建、端侧芯片等汇总文中已标注为汇总口径 说明本文为公开信息二次整理涉及第三方汇总的数字已标注来源与口径差异不构成任何投资建议。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Atlas 300V 24G推理卡部署YOLOv5实战指南:从零到OM模型 2026/9/26 9:17:09

Atlas 300V 24G推理卡部署YOLOv5实战指南:从零到OM模型

手里拿到一块 Atlas 300V 24G 的时候,我第一反应跟大多数人一样:这玩意儿到底算不算“运算加速卡”?能不能直接拿来跑 YOLO?搜索框里敲过“atlas 部署 yolo”的人应该都有这种疑惑——明明名字里带个“Atlas”,参数表上…

阅读更多 →
Atlas 300V 24G推理加速卡部署YOLO:从硬件选型到性能调优全攻略 2026/9/26 9:17:09

Atlas 300V 24G推理加速卡部署YOLO:从硬件选型到性能调优全攻略

1. Atlas 300V 24G到底是什么 1.1 先别急着跑模型,硬件定位得先搞清楚 前阵子群里有人甩了个问题:“atlas 300v 24g 是运算加速卡吗?看名字像显卡但又不完全是显卡,能不能直接插上去跑YOLO?” 这个问题问得很典型。A…

阅读更多 →
Atlas 300V 24G推理加速卡部署YOLO:完整实操与踩坑总结 2026/9/26 9:17:08

Atlas 300V 24G推理加速卡部署YOLO:完整实操与踩坑总结

最近后台一直有人问我一个特别具体的问题:"Atlas 300V 24G 是运算加速卡吗"、"Atlas 上能不能部署 YOLO"。说实话,这俩问题问的人太多了,而且我发现不少人对昇腾这个生态还是存在一些误解,总把它跟普通 GPU 卡…

阅读更多 →
AI 驱动的数据库自适应限流熔断:基于动态令牌桶与系统压力反馈 2026/9/26 9:17:08

AI 驱动的数据库自适应限流熔断:基于动态令牌桶与系统压力反馈

AI 驱动的数据库自适应限流熔断:基于动态令牌桶与系统压力反馈在大促极端流量洪峰或突发网络爬虫黑产攻击下,数据库面临的最致命威胁往往是**“算力瞬间被打满引发雪崩(System Collapse)”**。 在传统的限流方案中,架构…

阅读更多 →
Maven安装配置实战指南:JDK、镜像、环境变量一次配通 2026/9/26 9:17:08

Maven安装配置实战指南:JDK、镜像、环境变量一次配通

1. 这不是“又一篇Maven教程”,而是你真正能配通、配稳、配明白的实战手册我带过二十多个Java项目团队,从初创小公司到银行核心系统,每年至少重装、重配、重排查三十次以上的Maven环境——不是因为不会,而是因为90%的人根本没搞懂…

阅读更多 →
Xberg C 绑定批量提取容错指南:用 extract_batch 处理全部 URI 缺失的场景 2026/9/26 9:17:01

Xberg C 绑定批量提取容错指南:用 extract_batch 处理全部 URI 缺失的场景

后端AI 应用NLP 【免费下载链接】xberg Polyglot document intelligence with a Rust core: extract text, metadata, images, tables, and structured data from 106 formats across 140 file extensions, plus code intelligence for 371 languages. Fifteen bindings, with …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉