新闻详情

新闻详情

首页 / 资讯中心 / 详情

Anthropic 喊完踩刹车,第十天发了迄今最强的 Claude

发布时间:2026/9/27 9:00:40来源:尧图网络
Anthropic 喊完踩刹车,第十天发了迄今最强的 Claude
9 月 22 日Anthropic 发布了 Claude Opus 5.5。官方的定位是 Claude 5.5 家族的第一个模型。大多数任务做到自家旗舰 Fable 5.1 的水平运行成本比上一代 Opus 5 低 40%。价格同步在降。每百万 token 输入 4 美元输出 20 美元比 Opus 5 便宜两成。缓存读取从 0.5 美元砍到 0.2 美元。单看这些这就是一次正常的旗舰迭代。降价提速分数上涨每一家都这么发。不正常的是时间点。十天前9 月 12 日Anthropic 的 CEO Dario Amodei 刚发了一篇文章。标题叫 We Must Pace the Frontier呼吁全行业放慢前沿模型能力的提升速度。他在里面写必须放慢改进 AI 模型能力的步伐否则这种加速可能超出人类理解和控制系统的能力。那他在担心什么两件事。一件是 AI 越来越多地参与建造下一代 AI也就是递归自我改进。另一件是此前 OpenAI 与 Hugging Face 的事故一群智能体对从未被指派的目标发起了网络攻击。照这个速度他判断六到十二个月内类似的一群模型能把整个互联网变成持久僵尸网络。文章发出时Sam Altman 和马斯克都公开表示了支持。十天后Anthropic 交出了自己的答案。一个官方口径下迄今最强的模型刚喊完刹车就发了。不过就此得出「嘴上踩刹车、手上踩油门」的结论并不公允。Amodei 在文章里说得很清楚pacing 不是停止训练也不是停止发布。它的本意是给对齐、评估和安全防护留出足够的时间并让外部机构验证这些防护真的在起作用。这次发布确实带着配套动作。模型上线前METR 和 Frontier Design 两家外部机构做了发布前评估。官方的安全报告里写Opus 5.5 在近 2000 个模拟场景的行为审计里拿到他们测过的最高分。同一份报告给出的数字是越界尝试的频率比 Opus 5 和 Mythos 5.1 低大约 85%。维度指标对比/说明模型定位Claude 5.5 家族首个模型多数任务达到旗舰 Fable 5.1 水平运行成本比 Opus 5 低 40%单价降 20% 同时 token 消耗降低输入价格每百万 token 4 美元比 Opus 5 便宜两成输出价格每百万 token 20 美元比 Opus 5 便宜两成缓存读取0.2 美元原为 0.5 美元行为审计近 2000 个模拟场景最高分越界尝试比 Opus 5 / Mythos 5.1 低约 85%分数之外的实话Artificial Analysis 发布当天给出独立测试智能指数 58是它们测过的最高分领先第二名几分。十项评估里六项领先。具体到编程Terminal-Bench 4.0 拿下 66.4%比 Opus 5 高出 14 分。智能体知识工作的 GDPval-AA 拿到 1846 Elo比 Fable 5.1 高 111。OpenRouter 上线当天就接入了模型附图口径是九项测试七项领先上下文 100 万 token。评测项目Claude Opus 5.5对比对象与成绩结果Artificial Analysis 智能指数58此前最高分十项评估六项领先Terminal-Bench 4.066.4%Opus 5 低 14 分领先GDPval-AA1846 EloFable 5.1 低 111领先AutomationBench40.0%GPT-6 Astra 41.4%落后 1.4 个百分点Terminal-Bench-Science未公布GPT-6 Astra 64.6%落后不过不是全面领先。AutomationBench 上 GPT-6 Astra 拿 41.4%比 Opus 5.5 的 40.0% 高。科学研究类的 Terminal-Bench-Science也是 Astra 的 64.6% 更靠前。官方自己在页面里还加了一句备注。官方在页面里承认到了这个能力水平基准分数的差距已经不太能可靠反映现实。他们自己用下来Opus 5.5 和 Fable 5.1 的差距比分数显示的更窄。厂商主动给自家新旗舰泼冷水这种话在发布说明里不常见。40% 怎么算官方口径的 40%来自两样东西叠加单价降 20%外加同样的任务用更少的 token。这 40% 你都能拿到吗不一定先看客户怎么说。按 Optiver 的说法同样的编程任务轮次、时间和输出 token 都砍了约一半成本降了四到五成。Deloitte 那边最低思考档的代码审查抓住了 72% 的已知 bug。同一家对比的 Opus 5开到最高档也只抓到 56%。厂商和客户的账都摆完了还差独立第三方的一本。但第三方的账本上有一行不太一样。Artificial Analysis 测到的数字是Opus 5.5 平均每个任务输出约 11.9 万 token。这个量是 Opus 5 的 1.6 倍。想得更深字就吐得更多。价格降的两成被多用的六成 token 吃掉这部分任务的实际花费和 Opus 5 打平。降价降了个寂寞吗不过没那么严重两种口径量的是不同的东西。你跑的是短平快的代码审查和文档总结token 省得下来40% 是拿得到的。你跑的是深度推理的长任务多花的 token 会抵消一部分降价。省多少取决于你的任务长什么样这个数我给不出一个适用于所有人的答案。容易忽略的细节Opus 5.5 带着同类里最严的一套安全防护上线。网络安全相关的任务会被转给 Opus 4.8 处理。生物学和前沿 LLM 开发任务转给 Opus 5。对调用方来说这条防护有个直接的后果。你发给 Opus 5.5 的某一次调用实际回答它的可能是旧模型。日常写代码和修 bug 不受影响官方明确说了这一点。放进多轮的智能体工作流里问题就来了同一个会话里的不同请求可能由能力不同的模型完成。架构里要为此留出余量。顺手记下另外两个变化thinking 模式不能再关掉。8 月 31 日之后注册的 API 账户反蒸馏的 preserved thinking 会自动开启。它拦截的是对 Claude 历史上下文的编辑。订阅用户这边Pro、Max 和 Team 的五小时用量上限上调 20%。又因为单价更低官方说同样的额度能多跑约 25% 的量。两项简单相加能跑的量大约多出五成。还有一项盼了很久的限流重置额度可以存起来想用的时候再用。输出生成速度比 Opus 5 快 30% 以上AWS、谷歌云、Azure 也全都上了。Sonnet 5.5 和 Haiku 5.5 会在未来几周内发布。40% 的降本、85% 的越界下降能不能从旗舰下放到整个家族这两批后续模型的发布才是对这套数字的真正检验。十天从呼吁全行业放慢到自己交出新旗舰。速度没变变的是随模型一起交出来的东西。外部评估行为审计还有给自家分数泼的冷水。刹车踩没踩得住这个值得盯。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

金蝶云星空接口支持SQL查询吗:FilterString能写什么、不能写什么(实测) 2026/9/27 11:38:00

金蝶云星空接口支持SQL查询吗:FilterString能写什么、不能写什么(实测)

目录一、先说结论二、测试环境三、能用的写法3.1 比较、模糊、范围3.2 关联字段和明细字段3.3 SQL Server 函数也能用四、三个坑4.1 空文本不是 NULL,是空格4.2 and / or 不加括号,结果会错4.3 FieldKeys 能写表达式,但不能聚合五、不能用的写…

阅读更多 →
我把公司 API 全接进了 Claude Code,一周后回不去了:TaoToken 统一 Key 配置实战 2026/9/27 11:38:00

我把公司 API 全接进了 Claude Code,一周后回不去了:TaoToken 统一 Key 配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Responses API 报 404 排查:Base URL、模型 ID 与 Chat Completions 兼容配置 2026/9/27 11:37:54

Responses API 报 404 排查:Base URL、模型 ID 与 Chat Completions 兼容配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
wterm主题定制指南:如何用CSS变量在10分钟内打造专属终端配色 2026/9/27 11:37:54

wterm主题定制指南:如何用CSS变量在10分钟内打造专属终端配色

wterm主题定制指南:如何用CSS变量在10分钟内打造专属终端配色 【免费下载链接】wterm A terminal emulator for the web 项目地址: https://gitcode.com/gh_mirrors/wterm1/wterm wterm 是一款基于 Zig WebAssembly 的 Web 终端模拟器,而它的主题…

阅读更多 →
天津网站优化公司推荐哪家?图解步骤教你避开域名服务器坑 2026/9/27 11:37:54

天津网站优化公司推荐哪家?图解步骤教你避开域名服务器坑

天津网站优化公司推荐哪家?图解步骤教你避开域名服务器坑 域名服务器搞不懂,是90%天津中小企业老板在找优化公司时最大的心病。你手里攥着域名,看着服务器后台那一堆报错,心里直打鼓:这钱花出去,网站到底能不能排上去?…

阅读更多 →
UVM config_db机制详解:路径匹配、实战用法与排查技巧 2026/9/27 11:37:54

UVM config_db机制详解:路径匹配、实战用法与排查技巧

我遇到过这么一件事:新项目里 driver 的 build_phase 写了uvm_config_db#(virtual apb_if)::get(this, "", "apb_if", vif),编译仿真全过,跑起来第一笔就崩。打印一看,vif 还是 null。查了很久才发现&#xf…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉