新闻详情

新闻详情

首页 / 资讯中心 / 详情

Qwen3 Max以84.51分居首:2026-09-30 Smoke快测数据简报

发布时间:2026/10/1 10:57:16来源:尧图网络
Qwen3 Max以84.51分居首:2026-09-30 Smoke快测数据简报
2026-09-30 赢政指数 Smoke 快测覆盖 10 个模型Qwen3 Max 以 84.51 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为 0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1Qwen3 Max84.519472.9pass#2Claude Sonnet 4.679.419757.9pass#3Claude Opus 4.777.857285pass#4GPT-o376.867282.8pass#5Gemini 3.1 Pro73.1755.395pass#6GPT-5.570.77269.1pass#7豆包 Pro70.527268.7pass#8Grok 468.816375.9pass#9Gemini 2.5 Pro63.915080.9pass#10DeepSeek V4 Pro57.122100pass数据解读今日主榜前三中Qwen3 Max以代码执行94与材料约束72.9的搭配取得84.51Claude Sonnet 4.6则依靠代码执行97的高位在材料约束57.9下达到79.41Claude Opus 4.7通过材料约束85在代码执行72的结构下获得77.85显示头部模型在两项维度的强弱互补各有侧重。Gemini 3.1 Pro以材料约束95支撑主榜73.17而DeepSeek V4 Pro材料约束100但代码执行仅22反映出不同模型在 Smoke 测试中的即时表现差异。Gemini 2.5 Pro主榜上升22.7、代码执行上升25、材料约束上升19.9Claude Sonnet 4.6主榜上升13.1、代码执行上升10、材料约束上升16.9GPT-5.5主榜下降9.5、代码执行下降28、材料约束上升13.1这些同口径变化需结合小样本特性看待。Claude Opus 4.7代码执行暴跌28、GPT-o3代码执行暴跌21.8、豆包 Pro代码执行暴跌24.9、Grok 4代码执行暴跌31.5均可能源于题目抽样波动或单日状态起伏GLM-4.6因API故障数据不完整已进入补跑本期不参与排名。Smoke快测为每日小样本单日信号以上分数结构与异动均需后续同口径run复核确认避免对模型真实能力做出超出今日数据的推断。主要变化Gemini 2.5 Pro主榜上升22.7分代码执行25分材料约束19.9分Gemini 3.1 Pro主榜上升18.2分代码执行5.3分材料约束34分Claude Sonnet 4.6主榜上升13.1分代码执行10分材料约束16.9分DeepSeek V4 Pro主榜上升11.4分材料约束29分诚信warn→passGPT-5.5主榜下降9.5分代码执行-28分材料约束13.1分需要关注的信号Claude Opus 4.7代码执行暴跌 -28 分GPT-o3代码执行暴跌 -21.8 分GPT-5.5主榜暴跌 -9.5 分豆包 Pro代码执行暴跌 -24.9 分Grok 4代码执行暴跌 -31.5 分GLM-4.6数据不完整缺 execution,judgment 维度API 故障/超时已进入自动补跑本期不参与排名读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。数据来源赢政指数 (YZ Index) | Run #345本文首发于赢政天下获取更多深度技术内容与资源欢迎访问官网。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

托管Agent服务解析:Harness Runtime与Action Gateway架构实践 2026/10/1 11:42:17

托管Agent服务解析:Harness Runtime与Action Gateway架构实践

1. 从一条上线公告说起:托管 Agent 服务到底解决了什么DigitalOcean 把托管 Agent 服务正式推上台面,配套的是 Harness Runtime 和 Action Gateway 这两个核心组件。消息本身不长,但如果你正在做 agent 相关的开发,应该能嗅到这件…

阅读更多 →
无人机集群任务分配:多旅行商问题与仿生群智算法实战 2026/10/1 11:42:11

无人机集群任务分配:多旅行商问题与仿生群智算法实战

简介:本资源面向计算机、人工智能、自动化等专业的在校学生与算法学习者,提供一套基于仿生群智算法求解无人机任务分配(多旅行商问题)的完整Python实现,适合用作课程设计、毕业设计或群体智能大作业的参考方案。压缩包…

阅读更多 →
LLM Agent记忆系统实战:从遗忘到精准召回 2026/10/1 11:42:11

LLM Agent记忆系统实战:从遗忘到精准召回

1. 从“hindsight”说起:为什么我们需要给Agent装上记忆“hindsight”这个词本身很有意思,字面意思是“事后的洞察力”,也就是我们常说的“后见之明”。放在LLM Agent的语境里,它指向一个非常具体且棘手的问题:Agent如…

阅读更多 →
从零手搓AI工程:拆解黑盒,掌握底层原理与实战 2026/10/1 11:42:11

从零手搓AI工程:拆解黑盒,掌握底层原理与实战

1. 从零手搓AI工程:为什么我不建议你直接调包很多人一听到“AI工程”这四个字,第一反应就是打开某个云平台,调一个现成的大模型接口,写几行胶水代码,然后对外宣称自己做了个AI应用。我承认,这条路确实能在半…

阅读更多 →
单卡RTX 3090实战:从零预训练到领域适配的LLM全流程 2026/10/1 11:42:04

单卡RTX 3090实战:从零预训练到领域适配的LLM全流程

个人开发者想完整跑一遍 LLM 从预训练到领域适配的全流程,最大的障碍从来不是算法本身,而是算力预算和工程细节的失控。我用一张 RTX 3090(24GB 显存)从零训练了一个小型 GPT-2 级别的模型,再把它适配到垂直领域任务上…

阅读更多 →
Kuboard v3:面向Kubernetes生产运维的轻量级图形化管理平台 2026/10/1 11:42:04

Kuboard v3:面向Kubernetes生产运维的轻量级图形化管理平台

简介:本资源是一套面向Kubernetes初学者与运维工程师的Kuboard v3图形化管理平台实战部署资料包,聚焦于解决k8s集群缺乏直观可视化操作界面的痛点,适用于Linux环境下的容器云平台日常管理与教学演示场景。压缩包共含3个核心文件:1…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉