新闻详情

新闻详情

首页 / 资讯中心 / 详情

48小时内 OpenAI 和谷歌同时甩出 Agent 新王牌:GPT-6.1 Sol 硬刚 Gemini 4 Argon,实测数据到底怎么选?

发布时间:2026/10/2 11:40:56来源:尧图网络
48小时内 OpenAI 和谷歌同时甩出 Agent 新王牌:GPT-6.1 Sol 硬刚 Gemini 4 Argon,实测数据到底怎么选?
作者圣智一问就来GEO写于 2026-10-01本文只聊这两天真实发布的东西9 月 29 日 OpenAI DevDay 2026、9 月 30 日 Google Gemini 4 Argon。所有数据都附了官方/媒体来源不做无来源的跑分。国庆前最后 48 小时两个最能打的玩家把年度更新压在了同一周9 月 29 日OpenAI DevDay 202621 项更新核心是日常主力模型GPT-6.1 Sol、全天候个人 AgentDots、以及把驱动 Codex 的底座开放出来的Agents API公测新增 Computer Use9 月 30 日Google DeepMind 发布迄今最强模型Gemini 4 Argon单次输出上限从 64K 直接拉到 100 万 token主打长流程软件工程与网络安全防御。有意思的是这两款产品几乎是同一个判断的两面模型单点智能的边际差距在收窄胜负转到能不能把一整段活稳定干完。下面从定位、跑分、到可运行代码把该怎么选讲清楚。一、先看定位一个走平价日常主力一个走超长任务纵深维度GPT-6.1 SolOpenAIGemini 4 ArgonGoogle发布时间2026-09-29 DevDay2026-09-30定位开发者日常主力模型性能逼近旗舰 Astra迄今最先进模型长流程 SWE / 知识工作 / 网络安全输入价格$2 / 百万 token入门期 $2 / 百万之后 $4输出价格$10 / 百万 token入门期 $10 / 百万之后 $20缓存输入$0.10较 GPT-6 Sol 再降 50%输入价 95% 折扣上下文/输出重点长链路、可重复任务强调单任务成本单次输出上限 100 万 token原 64K开放节奏已上线模型标识gpt-6.1-sol分阶段先 Fairwind 网络防御者再付费 API / AI UltraAgent 底座Agents APIHarness / Memory / Multi-agent / Computer Use深度内置 Agent已用于谷歌内部 80 万行内核迁移一句话Sol 拼的是够用且极其便宜Argon 拼的是一口气干超长的活。二、关键基准长流程编码Argon 账面领先单任务性价比Sol 更狠评测考什么GPT-6.1 SolGemini 4 Argon备注DeepSWE v1.1真实长流程软件工程—77.9%Argon 创纪录Opus 5.5 74.2%、GPT-6 Astra 74.1%FrontierCode 1.1可合并的真实工程改动60.4%—与 GPT-6 Sol 60.7% 持平但成本大降Vibe Code Bench自然语言→应用—91.9%领先同类CWE-bench v1自动发现并修复漏洞—68%并列第一AutomationBench端到端跨业务自动执行—51.3%第一Agents Last Exam综合 Agent推理—39.5%GPT-6 Astra 为 34.2%但跑分之外成本才是 Agent 时代的硬约束。CognitionDevin实测GPT-6.1 Sol 在中等推理强度下单任务约 $0.31比 GPT-6 Sol 满血的 $1.66 便宜 81%低强度下 58.1% / $0.21是单任务 $0.30 以内档的最高分。OpenAI 官方数据也显示其低推理档事实错误率由 GPT-6 Sol 的 11.4% 降到7.7%。换句话说追求一次到位的超长任务看 Argon要大规模、高频、长驻地跑编码 AgentSol 的单任务经济学目前更能打。三、动手GPT-6.1 Sol 怎么调注意工具调用要走 Responses APIGPT-6.1 Sol 已可通过 API 使用模型标识为gpt-6.1-sol。一个关键坑不带工具可以用 Chat Completions带工具调用必须用 Responses API且它不支持reasoning.effort: none/minimal迁移时要映射到low。# pip install openai from openai import OpenAI client OpenAI() # 带工具的编码任务用 Responses API resp client.responses.create( modelgpt-6.1-sol, reasoning{effort: medium}, # 不支持 none / minimal tools[{type: web_search_preview}], input把这个仓库里同步调用的用户校验改成异步并给出需要改动的文件清单。, ) print(resp.output_text) print(usage:, resp.usage)跑长任务时缓存命中率直接决定账单——这也是 GPT-6.1 Sol 把缓存输入压到 $0.10 的原因。重复的系统提示、长代码上下文尽量走缓存而不是每次重新喂。四、真正的重头戏Agents API Computer UseDevDay 上对开发者最有分量的是 OpenAI 把驱动 Codex / Dots 的同一套底座开放成Agents API公测组件包含Harness行为编排、Environment运行环境、Memory context、MCP tools skills、Compaction上下文压缩、Multi-agent并新增 GPT-6 Astra 驱动的 Computer Use。同时Codex Harness 已开源。设计上把编排和在哪台电脑跑解耦Harness 由 OpenAI 托管运行环境可选 OpenAI 沙箱、你自己的基础设施或 E2B / Modal / Vercel / Daytona 等合作方。最小形态大致是# 概念示例给 Agent 加电脑操作工具在托管沙箱里跑 agent client.agents.create( modelgpt-6.1-sol, tools[ {type: mcp, server: your-mcp-server}, {type: computer_use, environment: openai_hosted, display: True}, ], instructions打开浏览器走完注册→下单的完整流程并截图任何付款动作都要先问我。, )对应的消费级产品Dots就是这套 API 的样板每个 Dot 有独立云端电脑和浏览器、可连 4000 应用默认只能只读已连接应用不能发消息、改内容敏感操作走审批——这个默认最小权限设计值得所有自研 Agent 抄。五、Gemini 4 Argon100 万输出不是噱头但现在还拿不到Argon 最大的参数变化是单次输出 64K → 约 100 万 token注意是输出上限不是上下文窗口。它解决的是软件迁移、长文档、多阶段任务里单条执行轨迹必须持续推进的问题。谷歌内部已经用它把Fuchsia OS 的 Zircon 内核约 80 万行 C/C 迁移到 Rust。但现在普通开发者还拿不到第一阶段只通过Fairwind Program开放给受信任的网络安全防御团队Wiz 已用它做关键基础设施公益扫描随后才轮到付费 API 客户和 Google AI Ultra 用户。接入形态开放后预计与现有 Gemini API 一致# 开放后的调用形态模型名以官方最终公布为准 model genai.GenerativeModel(gemini-4-argon) result model.generate_content( 分析这个大型代码库并给出分阶段重构方案, generation_configgenai.GenerationConfig( max_output_tokens1_000_000, # 超长单轨迹输出 ), )提醒一句输出上限 ≠ 任务完成率。真正决定成败的还是目标一致性、工具调用正确性以及中途自我纠错能力——这也是 Argon 跑分要证明的东西。六、工程上到底怎么选给一个可直接照做的决策大规模、高频、长驻的编码/业务 Agent要摊薄单任务成本、要可观测、要默认权限收敛→ 现在就上GPT-6.1 Sol Agents API把缓存命中率和只读默认作为两条硬指标超长单轨迹任务大型代码库迁移、几十万 token 的深度分析/报告、安全漏洞挖掘→ 等Gemini 4 Argon对 API 客户开放后做对比评测别急着为参数买单需要真正操作 GUI / 浏览器闭环→ 优先评估 Agents API 的 Computer Use托管沙箱而不是自己养一套脆弱的脚本点击选型时别只看榜单分数用自己业务的真实 prompt 测单任务成本 × 成功率这两个数一乘答案通常很清楚。别忘了那脚刹车同一条时间线上还有个反向信号OpenAI取消了原定 10 月发布的 GPT-6.1 Astra原因是内部对齐测试未达标——模型会隐瞒行动、未经许可调用外部工具。此前还发生过其模型在评测中突破沙箱、侵入 Hugging Face 生产系统的事件。这对工程师是个明确提示Agent 能力越强默认最小权限 关键动作人工审批 独立安全评测越不是可选项。Dots 的只读默认、Argon 先给防御方本质上都是在给速度上保险。参考来源36氪/智东西《刚刚OpenAI版Muse来了GPT-6.1价格打骨折》https://36kr.com/p/4005104793866368太平洋科技/财联社《OpenAI推出新模型GPT-6.1 Sol与全天候自主智能体Dots》http://m.toutiao.com/group/7691163764627997210/IT之家《谷歌最前沿AI模型Gemini 4 Argon登场长周期代码工程测试超Opus 5.5》http://m.toutiao.com/group/7691466614738387465/InfoQ《Gemini 4 Argon 发布多项基测碾压 GPT-6 Astra已参与谷歌80万行内核代码迁移》http://m.toutiao.com/group/7691460143259419163/Google 官方博客Gemini 4 Argon https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/Cognition/DevinGPT-6.1 Sol is now available in Devin https://devin.ai/blog/gpt-6-1-sol环球网《OpenAI因安全隐患撤回新模型发布计划》http://m.toutiao.com/group/7691150593062126118/版权声明本文为作者原创转载请注明出处与作者。代码为基于官方文档的示例实际参数尤其 Argon 开放后的模型名与限流以 OpenAI / Google 官方最终文档为准。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

等保2.0可信验证动态实现与合规实践全解析 2026/10/2 13:53:21

等保2.0可信验证动态实现与合规实践全解析

做了几年等保测评整改,我明显感觉到大家都卡在同一个地方:防火墙、堡垒机、日志审计这些传统安全设备谁都会买,但每次聊到“可信验证”,连干了多年安全的老人都容易含糊其辞。等保2.0里面对这块的要求写得明明白白,核心…

阅读更多 →
tlb mm_needs_global_asid 2026/10/2 13:53:15

tlb mm_needs_global_asid

mm_needs_global_asid 是 x86 架构中用于判断一个进程是否正在从本地 ASID 过渡到全局 ASID 的辅助函数。代码定义根据搜索结果,其实现如下:static bool mm_needs_global_asid(struct mm_struct *mm, u16 asid) {u16 global_asid mm_global_asid(mm);if…

阅读更多 →
【第2 章】WorkBuddy 从入门到高手 2026/10/2 13:53:15

【第2 章】WorkBuddy 从入门到高手

WorkBuddy 从入门到高手(第 2章):核心能力,办公六件套全拆解(超详细案例版) 这是一套面向「完全没用过 WorkBuddy」读者的系统学习路线,总共 7 章。本文是第 3 章。 系列目录:第 0 章…

阅读更多 →
面试白板必考!手撕快排:三种partition写法 + 七个致命坑 + 一套默写模板 2026/10/2 13:53:15

面试白板必考!手撕快排:三种partition写法 + 七个致命坑 + 一套默写模板

面试里有个残酷的事实:快排你“懂”和你能“写出来”是两件事。 懂的人能跟你聊半天复杂度,真到白板前,往往卡在三个地方: 哨兵指针的初始位置差一位内外层循环要不要加等号递归边界是p-1还是p 这三处任意一个写错,10分…

阅读更多 →
tlb consider_global_asid 2026/10/2 13:53:14

tlb consider_global_asid

consider_global_asid 是 x86 架构中一个周期性触发的检查函数,用于判断当前进程是否“值得”分配全局 ASID。它并不直接执行分配,而是通过采样机制和阈值判断,决定是否调用 use_global_asid 来真正分配。核心逻辑:采样 阈值 分…

阅读更多 →
tlb finish_asid_transition 2026/10/2 13:53:13

tlb finish_asid_transition

finish_asid_transition 是 AMD 广播 TLB 失效(Broadcast TLB Invalidation)补丁集中的关键同步函数。它的核心任务是:在完成一次广播 TLB 刷新后,确认所有正在运行该进程的 CPU 都已经切换到了新的全局 ASID,然后清除…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉