新闻详情

新闻详情

首页 / 资讯中心 / 详情

9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降

发布时间:2026/9/29 1:35:47来源:尧图网络
9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降
9月的这波大模型更新如果只看榜单分数会觉得又是熟悉的发布周套路。但把几个国产开源模型放在一起看会看到一个更实在的变化总参数越做越大每次推理真正激活的参数却越来越小与此同时API 的单位成本在往下走缓存命中的价格甚至被砍到了原来的四分之一。对开发者来说这比某模型又刷新了某个基准有用得多。一、这波更新到底改了什么先摆几条有据可查的事实数据均来自公开报道与厂商文档仅供了解趋势智谱 GLM-5.3-FlashGLM-5 系列首个原生多模态模型总参数量约 320B采用 MoE 架构每次推理激活约 18B权重以 MIT 许可证在 Hugging Face 开源API 同步开放。据报道它在正式揭面前曾以匿名代号在 OpenRouter 上冲上过调用量榜首。阿里 Qwen3.8-Flash-Next被官方描述为下一代架构的预览版本据第三方报道约为 125B 总参数、6B 激活主打稀疏注意力、门控残差一类的效率改进第三方盘点给出的 API 价格约为每百万 token 输入 1 元、输出 3 元。Anthropic9 月发布新模型时把提示缓存读取的价格下调了约 75%从此前每百万 token 1 美元降到 0.25 美元标准输入价未变缓存读取价单独下调。把这三条放在一起方向就很清楚了竞争的主战场正在从谁的参数大、谁的分高转向谁能让单位任务更便宜、更快、更稳。二、技术本质MoE 把大和贵解耦了过去大家默认一条公式参数越大 → 能力越强 → 推理越贵。MoE混合专家把这个链条拆开了。MoE 的核心思路是模型里塞很多专家子网络但每次 token 只路由到其中少数几个。于是总参数量决定模型的知识容量存得下多少东西激活参数量决定每次推理的计算量跑一次要花多少钱。320B 总参数、18B 激活意味着知识面按大模型来配账单按小模型来结。这解释了两个现象为什么小激活参数的模型也能打。6B 激活对上一个 300 多 B 的模型单看计算量是小一个数量级但因为专家库够大、训练数据够多实际表现并不差。这里的关键不在参数多少而在路由策略和专家利用率做得好不好。为什么成本能压下来。推理成本大致正比于激活参数数量和输出 token 数量。激活参数一降单位成本自然跟着降再叠加缓存降价长对话、长文档这类场景的实际开销掉得更快。没变的是什么一是碎片化。不同厂商的许可证并不统一——同样是开源MIT 和自定义社区许可在商用、二次分发上的限制差别很大。二是开源这两个字的含金量在缩水不少厂商只放权重、不放训练细节甚至放出的是上一代版本。三是评测分数依然不能直接换算成你业务里的效果。三、对开发者意味着什么以及几个真实的坑第一选型要算单位任务成本不是单 token 价格。单价低的模型如果为了想清楚问题而输出一堆思考过程总账可能反而更贵。据公开报道就有新模型在把缓存价格砍掉 75% 的同时因为输出 token 变多单个复杂任务的总成本反而比上一代高了约 20%。所以看价目表时要同时盯住三个量输入价、输出价、以及平均输出 token 数。下面这段代码可以拿来粗算一个场景的单位成本价格换成你自己拿到的价目表即可defcost_per_task(input_tokens,output_tokens,cached_tokens,price_in,price_out,price_cached):price_* 单位元 / 百万 tokencached_tokens 为命中缓存的部分non_cachedmax(input_tokens-cached_tokens,0)return(non_cached/1e6*price_incached_tokens/1e6*price_cachedoutput_tokens/1e6*price_out)# 同一个任务两个模型的对比数字为示意请替换为实际价目表acost_per_task(8000,1500,6000,price_in5,price_out25,price_cached0.25)bcost_per_task(8000,3000,6000,price_in1,price_out3,price_cached0.1)print(fA 模型单任务约{a:.4f}元B 模型单任务约{b:.4f}元)第二有缓存就用缓存但要理解缓存的语义。缓存省钱的前提是前缀稳定系统提示词、工具定义、长文档这些基本不变的部分放在前面把变化的部分放后面。反过来如果你每次都把不同的用户输入塞在最前面缓存基本命中不了。另外注意缓存的有效期——某些服务在调整 TTL 后实际命中率会明显下降省的钱就没那么多了。第三看清许可证再动手。想私有化部署、想封装成产品对外提供服务的一定先确认许可证MIT 类通常宽松但社区许可往往要求提供 MaaS 或编程助手类产品需另行申请商业许可。这一步踩坑后面很难补救。第四本地跑得动才是真便宜。一个 27B 左右的模型 4-bit 量化后大约 19GB能在 24GB 内存的机器上跑起来。对数据敏感、调用量稳定的场景本地部署省下的不只是 API 费还有合规风险。四、收个尾这波更新里最值得记住的不是某个模型的名字而是那条持续了几年的成本曲线能力在涨单位成本在掉。对开发者来说这既是机会也是负担——可选项多了选错的代价也分散在每一天的账单里。与其追榜单不如拿自己真实的几个任务跑一遍算算单位成本、看看稳定性、确认许可证。你现在项目里主力用的是哪个模型有没有因为输出 token 变多被账单反杀的经历评论区聊聊。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

全国统一大市场背景下,公共资源交易规则统一化建设路径 2026/9/29 21:54:52

全国统一大市场背景下,公共资源交易规则统一化建设路径

在全国统一大市场建设的战略布局中,公共资源交易市场是不可或缺的核心板块。工程招投标、政府采购、土地矿业权出让、国有产权交易等公共资源交易活动,连接着政府、市场主体与社会公众,是要素流动、资源配置、公平竞争的关键载体。 但长期以来…

阅读更多 →
如何用llama.cpp部署Spark-X2.5-4B-GGUF:从CLI聊天到OpenAI兼容API的完整指南 2026/9/29 21:54:52

如何用llama.cpp部署Spark-X2.5-4B-GGUF:从CLI聊天到OpenAI兼容API的完整指南

如何用llama.cpp部署Spark-X2.5-4B-GGUF:从CLI聊天到OpenAI兼容API的完整指南 【免费下载链接】Spark-X2.5-4B-GGUF 项目地址: https://ai.gitcode.com/SparkLLM/Spark-X2.5-4B-GGUF 本文介绍如何用 llama.cpp 部署 Spark-X2.5-4B-GGUF:一条命令…

阅读更多 →
HarmonyOS真机调试从入门到精通:环境搭建、连接调试与常见坑 2026/9/29 21:54:38

HarmonyOS真机调试从入门到精通:环境搭建、连接调试与常见坑

1. 准备工作:真机调试前的环境搭建1.1 为什么一定要用真机调试鸿蒙开发到了中后期,模拟器基本就不够用了。模拟器在CPU指令集、传感器调用、网络协议栈、渲染管线上都做了虚拟化处理,很多问题在模拟器里根本复现不出来。就拿最典型的场景来说…

阅读更多 →
景观水净化循环设备应用场景与落地方案 2026/9/29 21:54:31

景观水净化循环设备应用场景与落地方案

很多负责物业设施或景观维护的朋友都有过这样的头疼经历:明明刚换过水的人工湖,没过半个月就泛起绿藻,水面浑浊发臭;商业广场的喷泉因为水质问题频繁堵塞喷头,维修成本居高不下。尤其是在气温升高或雨季来临时&#xf…

阅读更多 →
飞凌嵌入式ElfBoard-Python版本说明 2026/9/29 21:54:31

飞凌嵌入式ElfBoard-Python版本说明

Python的版本号通常由三部分组成:主版本号(major)、次版本号(minor)和修订版本号(patch)。例如,Python 3.8.10中的3是主版本号,8是次版本号,10是修订版本号。…

阅读更多 →
第十二章 分式和分式方程 2026/9/29 21:54:30

第十二章 分式和分式方程

一、前置知识点1、分式VS 分数 ,分式VS 整式2、整式中的单项式VS多项式二、知识点1、分式基本概念2、分式的基本性质备注:同时改变两处位置的符号,分式的值不变3、约分与最简分式4、最简公分母与通分5、分式的放缩问题

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉