新闻详情

新闻详情

首页 / 资讯中心 / 详情

Sonnet 5.5 发布:打工人的新旗舰,性能逼近Opus 5.5,价格只要一半

发布时间:2026/10/1 18:13:48来源:尧图网络
Sonnet 5.5 发布:打工人的新旗舰,性能逼近Opus 5.5,价格只要一半
Claude Sonnet 5.5 终于发了前不久发的 Claude Opus 5.5 毫无疑问是我最想用的模型各方面都是最优的但问题是太贵了。且非常的不经用才发几天我就把它一周额度蹬完了后面一直靠着 Codex 在苦撑所以我急需那款性价比更高的。今天它终于来了先看看价格它是 Opus 5.5 的一半也是目前 Claude 5 系里面最便宜的。当然更便宜的 Haiku 官方透露也会在几星期之内发布。![▲ 图AA 榜单的模型指数与价格除了价格减半它跟上一代 Sonnet 5 的价格其实是一样的。但是官方称做同一件事情它能少花 30% 的 TOKEN生成的速度也会快 30%。所以这真的可谓是加量不加价。而且还有点啊就是 Sonnet 5.5 其实对标的是 GPT-6 Sol所以它们的价格也是完全一样的。从第三方 AA 的数据来看Sonnet 5.5 在各个推理级别都是碾压 GPT 6 Sol 的我画了一个斩杀线可以看到不管 GPT 6 Sol 也好还是 Kimi K3、Opus 5甚至是 Claude Fable 5.1都在它的斩杀范围之内。](https://i-blog.csdnimg.cn/direct/0e3b25b6724c4b9a80a58712e02f6c93.png)![▲ 图AA 指数与费用散点图图上我选的是 Max 档我对比过其他档也类似只有 Medium 是 Sonnet 5.5 和 GPT 6 Sol 是接近的这么看用 Sonnet 5.5 起码得从 High 起步才能拉开差距。性价比之外具体的能力到底怎么样我还没深度测试先看看官方介绍01 性能直逼 Claude 旗舰 Opus 5.5每次发布都会有一堆的 benchmark 值这次当然也不例外了。我们还是从这个表格开始吧。](https://i-blog.csdnimg.cn/direct/be71a7d0826c415f8c95b0e698f7528f.png)![▲ 图官方基准测试对比表从官方列出这个表格来看啊只要瞄一眼你就会发现Sonnet 5.5 这几个关键指标基本上都已经接近 Opus 5.5 了甚至在 Terminal Bench 方面它比这个旗舰的 5.5 还要厉害。Terminal-Bench 4.0 看模型能否在命令行里完成多步骤任务官方注明 Opus 用的是 Xhigh 档的最高成绩。CursorBench 4.0 测真实编码任务Sonnet 5.5 拿到 55.5%接近 Opus 5.5 的 57.8%。编码能力的提升是它接手 Claude Code 日常工作的主要依据。知识工作方面这里用了我们常用的那个指标 GDPval-AA这个指标测试涵盖 44 个职业和 9 个主要行业主要用来评估模型在实际任务中的表现。这一项 Sonnet 5.5 只比 Opus 5.5 低 2 分而隔壁 OpenAI GPT 6 Sol 是什么级别呢它竟然低了近 20%所以 Sonnet 5.5 基本上已经是天花板级别的了。自从 GPT 6 Astra 出来之后呢我会大量使用到电脑操控。那在这项里Sonnet 5.5 的提升非常明显它提升了有 40%已经和 Opus 5.5 持平了。也就是说在电脑操控方面Sonnet 5.5 也是非常能打。第三方的 Artificial Analysis 智能指数可以看到它的各档都非常强。Max 档已经超过了 GPT 6 Astra它的 High 档呢也接近 GPT 6 Sol 的 Max 档。所以还是前面我说的这个如果要用 Sonnet 的 5.5看来至少得从 High 档起步。](https://i-blog.csdnimg.cn/direct/cc47d05de2c24ade884dbcc976fd1d67.png)![▲ 图AA 智能指数各推理档位官方的资料里面给了很详细的各个指标在每个档的表现大家可以去看一下。比如我下面这个图就是 Terminal Bench 在它的各个档位下的表现。可以很明显的看到换一个档位它的性能提升是非常明显的。不管从 Medium 到 High还是 High 到 X High这种提升效果会比 Opus 5.5 还要更夸张。Opus 5.5 实际上来讲到了 High 之后后面的两个档好像就没什么太大变化了。不过这里要注意的是这个参数它对比的 GPT 5.6不是 6-Sol。](https://i-blog.csdnimg.cn/direct/f52815c82df5415e984d82f5ba87aea3.png)![▲ 图Terminal-Bench 4.0 成本对比另一项参数就是知识工作里面呢看来很明显Sonnet 5.5 是碾压 GPT 6 Sol它的 Med 甚至就已经是 GPT-6 Sol 的天花板看来它是打工人的新旗舰。](https://i-blog.csdnimg.cn/direct/75d4ddd174384ea7ba093f49a7183db7.png)![▲ 图AA-Briefcase 成本对比我们可以根据自己的需要来调整推理的级别这样来取得一个最佳的性价比。在 Claude Code 和 Claude APP 里面呢它的默认推理级别都是 Medium。更低的推理级别就意味着响应速度更快使用的 Token 也更少适合日常的工作。那在更高的设置下面Claude 的推理时间就更长检查也会更彻底。02 Sonnet 5.5 是来接日常工作的Anthropic 给两个模型分的工很清楚。Opus 5.5 处理需要长时间判断、边界模糊的复杂工作Sonnet 5.5 更适合范围已经说清楚的日常任务修 bug、改代码以及做文档、幻灯片、表格。官方还特别强调了它的界面设计能力。这个定位很好理解就是目标、任务都很清楚了在执行方面 Sonnet 5.5 最适合不过了。比如项目里已经确定要改什么让模型定位问题、修改文件、检查结果或者材料已经齐了让它整理成一份可以继续编辑的文档。这样的工作不需要每一步都调用最贵的模型。任务目标本身还不清楚、需要在几个方案之间持续权衡时再交给 Opus 5.5 更合适。03 参考资料01AnthropicClaude Sonnet 5.5 发布说明https://www.anthropic.com/claude-sonnet-5-5](https://i-blog.csdnimg.cn/direct/ede6e5f56dc24e948d2e74bbab651167.png)
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Spring Boot+Vue智慧农场系统:从IoT接入到溯源全栈实战 2026/10/1 18:49:10

Spring Boot+Vue智慧农场系统:从IoT接入到溯源全栈实战

1. 项目背景与系统边界:农田智慧化之后,软件究竟要管哪些事做这个智慧农场系统之前,我其实有过一段纠结:市面上叫"智慧农业平台""数字农场管理系统"的东西太多了,功能往大了写能写出几十个模块——…

阅读更多 →
C语言编译与链接:从gcc命令到目标文件、静态库与动态库的完整解析 2026/10/1 18:49:10

C语言编译与链接:从gcc命令到目标文件、静态库与动态库的完整解析

1. 在C语言这里,编译和链接为什么天生是"两件事"1.1 从一段最简单的代码说起很多刚接触C语言的朋友都经历过这样一个阶段:跟着视频或教材写了几行代码,点击IDE里的"运行"按钮,程序跑起来了,然后就…

阅读更多 →
程序员接单平台怎么选?2026六大渠道优劣对比与避坑指南 2026/10/1 18:49:10

程序员接单平台怎么选?2026六大渠道优劣对比与避坑指南

1. 2026 年接单行情:为什么今年一定要认真挑平台 接单这件事,我做的时间说不上非常长,但足够把坑都踩一遍。2019 年我开始在业余时间接外包,当时的心态很简单,在公司写了一年业务代码,觉得自己技术还行&…

阅读更多 →
Spring MVC拦截器从原理到实战:三个方法、一条执行链,轻松治理横切逻辑 2026/10/1 18:49:10

Spring MVC拦截器从原理到实战:三个方法、一条执行链,轻松治理横切逻辑

做Java后端的人,几乎都绕不开拦截器。我印象最深的一次是刚接手一个老项目,接口里全是重复的登录校验、参数校验、操作日志,每个Controller开头都贴着同一段模板代码。后来靠Spring MVC拦截器把所有横切逻辑抽出来,代码干净了不说…

阅读更多 →
工作窃取线程池:打破ThreadPoolExecutor任务不均的利器 2026/10/1 18:49:10

工作窃取线程池:打破ThreadPoolExecutor任务不均的利器

“线程池出问题的时候,十个工程师里有九个去调核心线程数和队列长度,很少有人会怀疑任务分发模型本身出了问题。”这句话我在给团队做性能排查时说过很多次。大多数人对线程池的理解都停留在ThreadPoolExecutor BlockingQueue这个经典模型上&#xff0c…

阅读更多 →
高效集成测试计划制定指南:从策略设计到落地实践 2026/10/1 18:49:03

高效集成测试计划制定指南:从策略设计到落地实践

1. 集成测试计划到底在解决什么问题先说句实话:干了这么多年测试,见过太多项目在集成测试阶段翻车,而且翻车方式高度一致——要么单测做完就往上怼,怼到哪爆到哪;要么事到临头才想起要安排环境、要协调数据、要理顺版本…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉