新闻详情

新闻详情

首页 / 资讯中心 / 详情

RSI 洞察:Agentic Coding 与 RSI 或许是研发下一代模型和 AI Infra 系统优化的版本答案

发布时间:2026/9/26 12:50:53来源:尧图网络
RSI 洞察:Agentic Coding 与 RSI 或许是研发下一代模型和 AI Infra 系统优化的版本答案
CSDN叶庭云https://yetingyun.blog.csdn.net/文章目录RSI 究竟是什么关键洞察大模型越来越会执行难的是自己找到正确目标最难的不是变强是证明自己变强了把擂台搭好AI 的进步才经得起检验Intelligence 归模型厂商Expertise 归创业公司下一代 RSI要在真实环境里学得更快、更安全RSI 究竟是什么RSIRecursive Self-Improvement近期热度较高相关表述还包括自进化Self-Evolving、自改进Self-Improving等。该领域仍处于快速发展期尚未形成统一技术范式。不同工作的自改进、优化对象和实现路径差异较大包括更新模型参数、上下文管理、记忆系统、演化 Skill / Prompt以及修改工具链、控制流程和 Harness 代码。因此RSI 难以用单一方法或技术路线直接简述。GitHub Awesome RSI 仓系统整理递归自我改进RSI领域的方法、系统与评测涵盖模型参数、Harness、上下文、记忆、Skill 等方向并提供分类检索与引用图谱便于快速了解和跟踪领域进展。https://github.com/Prism-Shadow/awesome-rsi近两个月100 余篇 RSI 相关论文集中预发表于 arXiv多篇独立综述分别梳理了千余篇文献。推荐阅读如下 6 篇综述论文Self-Improvements in Modern Agentic Systems: A SurveyThe Last AI Built by Humans: Toward Genuine Recursive Self-ImprovementTowards AI That Improves Itself: A Survey of Recursive Self-ImprovementRecursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research LoopsAI4AI Survey: From Long-Horizon Agents to Recursive Self-Improvement — Definitions, Reliable Horizons, and Open ProblemsThe Path to Recursive Self-Improving Agents: Foundation, Framework, and Future DirectionsICLR 2026 也首次举办 RSI 专题研讨会。尽管某些媒体将其称为 “AI 奇点前夜”RSI 不算是全新概念实际已有近 40 年研究历史重要奠基者之一是 LSTM 之父、瑞士人工智能实验室 IDSIA 主任 Jürgen Schmidhuber。Schmidhuber 于 2026 年 9 月梳理了 RSI 的技术演进1987 年提出具体的递归自我改进算法1992 年研究基于梯度下降的神经网络 RSI1994 年扩展至可自修改策略的强化学习1997 年引入人工好奇心和内在动机2002 年提出面向课程学习Curriculum LearningCL的渐近最优 RSI2003 年提出 “哥德尔机”构建数学上最优的 RSI 框架。这一研究脉络比当前大众认知早。https://x.com/SchmidhuberAI/status/2100347054127976637https://github.com/selfimproving-agent/awesome-Self-Improving-Agents其源头可追溯至 Schmidhuber 1987 年的博士论文当时已将 “元学习Meta-Learning” 和 “自指Self-Reference” 列为核心问题。1991 年他与团队提出了类似后来 ChatGPT “预测与训练” 的思想20 世纪 90 年代中期又开发出可修改自身权重更新算法的自指神经网络2003 年的哥德尔机则进一步形成数学上严格、完全自指、自我改进并追求最优效率的问题求解框架。RSI 为何到 2026 年才成为热点核心原因是大模型能力提升使过去的理论设想具备了工程验证条件。综述《Self-Improvements in Modern Agentic Systems: A Survey》系统梳理了 RSI 从理论基础到现代智能体和进化方法的发展。当前“有界自我优化” 已较常见例如智能体自行调整 Prompt / Skill、工具调用逻辑或工作流代码但 “开放端 RSI”即自主修改核心学习算法或系统架构以优化 AI 自身仍未彻底解决。关键约束在于验证机制。可靠性由高到低大致分为四层形式化验证即用数学证明改动有效执行反馈即实际运行后验证结果训练得到的评判模型模型自我评估。现有系统主要依赖执行反馈和评判模型。形式化验证最可靠但计算成本极高这也是哥德尔机 “理论上最优、实践中难以运行” 的主要原因。这段历史对当前 RSI 热潮有三点启示一是RSI 并非突然出现的 “奇点前兆”而是延续近 40 年的研究方向2026 年的升温主要源于大模型和 Agent 提供了新的工程验证工具二是理论最优与工程可用之间长期存在张力当前系统普遍以牺牲部分理论完备性换取可落地性三是验证方式决定改进的可靠性和成本越接近形式化证明可靠性越高、成本也越高越依赖模型自评成本越低、风险越大。2026 年 9 月发布的另一篇综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》进一步将 RSI 定义为一个闭环系统自主识别弱点、提出并验证改动、保留有效改动再由改进后的系统推动下一轮改进。其核心问题是系统究竟只是在提升任务表现还是已经能够提升 “自我改进能力” 本身这也是 Schmidhuber 自 1987 年以来持续研究的问题。因此RSI 并非一个面向未来的新概念而是一条延续近 40 年的研究主线。Schmidhuber 的贡献不仅在于提出理论框架更在于持续以数学证明和实验验证约束讨论。回看这段历史有助于更准确地区分 2026 年 RSI 热潮中哪些属于实质性进展哪些只是旧思想在新技术条件下的重新实现。因此不是所有 “自我改进” 都叫 RSI。智能也不只是模型而是一套完整系统。从 RL 向 RSI 过渡中间需要形成 “自我改进闭环”既包括模型权重更新也包括外围系统的协同改进。仅让模型生成数据再用这些数据训练增强自身本质上仍是强化学习。模型用当前策略产生的合成数据继续训练自己尚不足以构成真正的 RSI。RSI 与传统 RL 的关键区别在于 AI 是否开始自主设计 “如何提升自己”。传统 RL 中训练目标、流程和方法主要由人类专家设定模型负责产生训练数据如果模型已经能自主设计整套训练流程就超出了普通 RL 的范畴。但二者并非完全割裂。用自生成数据训练自己可以视为 RSI 的早期形态。更完整的 RSI 必然是系统工程模型不仅要更新自身还要管理与人和环境的交互涉及调度、上下文管理等外围系统进一步优化底层训练效率还需要理解 CUDA / CANN 等硬件、指令集和原生算子优化。因此RSI 最终是模型与整套系统的共同演进。如果提炼 RSI 的共性主要有三点AI 自主发现提升目标自主寻找合理实现路径通过长期、持续的迭代或递归不断逼近目标遵守规则和约束不 Hacking。这里的 “长程” 不只是长时间推理而是学习与推理持续交替、相互促进的过程。从形式上看RSI 是在给定 Environment 和 Verifier 的条件下持续迭代系统中的可变部分以获得更高的 Verifier 得分。当前实践大致可分三层第一层是 AutoResearch修改外部 Artifacts工作产物。例如在代码仓库中修改训练代码或优化数据 Pipeline以降低 Loss。第二层是改进模型训练修改模型权重并通过合成数据、学习算法优化、自建 Infra Agent 等方式定向训练优化下一代模型。第三层是普适意义上的 RSI模型直接优化自身系统中只保留模型自身、环境和 Verifier。RSI 的现实意义还在于模型训练的边际收益正在下降进一步提升越来越依赖 AI 自主探索。当前真正稀缺的不是简单数据或人工标注能力而是高价值、高质量的 Corner Case 数据少见、极端、边界性强但对模型能力提升很有价值的数据。从这个角度看RSI 也是 Post-Training 的重要方向之一。从系统结构看最内层是模型参数和架构其外是 Code、Memory、Skill、Workflow再外是文件、工作区等环境。自我改进可以由内向外递归展开能改内部变量就改内部内部受限就继续向外寻找可优化环节直到解决问题。RSI 其实也是科研领域长期追求的方向近来开始出现落地迹象一个重要原因是代码智能体出现能力拐点。RSI 要解决的核心问题是让 AI 自动化训练、优化下一代 AI其中关键一步是让代码智能体能够把 AI 的想法真正实现并持续迭代架构、数据集和学习算法。代码智能体具备越强的工程能力后RSI 更容易落地。面对当前研究现状我最不理解的是 “专门做 RSI Model” 这一说法。RSI 能力本身已在上游基模训练中内化。所谓 RSI Model本质上只是承载自动化训练任务的模型单独强调 “方法是 RSI” 意义有限。RSI 过程中Agent 的行为可形式化为 In-Context BFS / DFS路径选择与回溯不再主要依赖代码逻辑而由 LLM 通过 In-Context Learning 原生完成。系统上限主要取决于两类能力一是 Long Context决定长程回溯的能力和准确性二是 Path Selection决定 Cost 和 Efficiency。后者本质上可理解为 World Model Value Model类似 PPO 叠加 World Model而这些能力本身已包含在基模的训练目标中。但真实部署中也有反例模型往往仍需进入具体场景训练。这里不是指一般的垂域定制而是某种训练算法得到的 RSI 模型进入真实环境后能够以更高斜率提升 Reward。所以从这个视角出发我不太相信专门为 RSI 做预训练或从头训练模型但相信面向千行百业的垂域 RSI。我更大的疑问在于 RSI 的定义正在宽泛化。这个概念出现后很多过去并不称为 RSI 的工作如 AutoResearch、Loop Engineering甚至 Auto-MLEMachine Learning Engineering自动化机器学习工程也被纳入 RSI。这样反而模糊了边界。定义的价值应是降低沟通和理解成本而不是增加新的概念负担。关键洞察Agentic Coding 与 RSI 或许是研发下一代模型和 AI Infra 系统优化的版本答案。关键不在于实现自我迭代而在于验证迭代是否足够有效。要让 AI 知道什么值得改什么真的有效以及什么应该记住。RSI 已成为 AI 领域的热点议题。OpenAI、Anthropic、xAI、谷歌以及智谱、DeepSeek、字节 Seed 等头部模型厂商均在探索让前沿 AI 真正参与下一代 AI 研发其他创业公司也围绕相关产品、开发环境和评测体系展开布局。RSI 不等同于 RLReinforcement Learning强化学习。模型利用自身生成的数据强化训练自身只是 RSI 的早期形态能够自主设计完整训练流程才算真正超越 RL 范畴。RSI 并非单一模型能力问题而是一项系统工程需要打通调度、上下文管理、Prompt / Skill / Workflow 自动优化、硬件优化、测试验证闭环等关键环节。当前模型执行能力较强但难点在于自主定义评估标准和可靠优化目标要避免 Reward Hacking。相比解决问题发现和精准定义正确的问题 / 任务更难。Benchmark 刷榜背后存在经济激励和人性因素公开 Benchmark 能持续有效三五个月已属不易。现实环境无法无限试错。一次误删邮件可能导致被毙掉Agent 需要以更少反馈积累经验提升自主学习、真正达成目标能力。真正的关键不在于 AI 是否参与改进而在于系统是否具备 “持续改进自身改进能力” 的能力。为厘清这一边界可将 RSIRecursive Self-Improvement递归自我改进拆解为四项标准并按难度递进1. 持久改进改进结果能够沉淀到参数、记忆、上下文、Skill、工具、Harness 或训练流程中而非一次输出后消失。达到这一点才可称为自我改进本文指输出、记忆、参数或 Harness 能力的改进。2. 自主闭环系统可在限定范围内发现问题、提出修改、执行实验、评估效果并采纳更优版本。新版本可继续参与下一轮改进即形成有界 RSI。3. 递归增益“点火” Ignition新版本不仅任务表现更优还具备更强的改进能力。跨过这一阶段改进能力本身才开始产生复利效应即进入递归自我加速。4. 稳健与可控改进效果需在固定资源、隐藏评测和新任务中持续有效同时避免评估污染、复杂度失控、对齐退化和不可审计等问题。四项标准全部满足才接近开放式 RSI。目前前两项已有迹象出现第三项尚缺乏充分公开证据第四项仍待解决。有界闭环的出现并不意味着递归自我加速已经启动。只有当递归反馈带来的增益能够抵消研究难度上升、迭代周期延长等阻力改进才可能进入自我增强阶段。接下来讲讲近期一些业界代表性工作。字节跳动 Seed联合 TokenWave 发布Self-Developing Agents项目并同步发布 3 篇论文。项目提出 “From Half-Loop to Closed-Loop RSI”即推动递归自我改进RSI从半闭环走向真正闭环距离真正的 “自主进化”实际还有很长一段路。项目主页https://self-developing-agents.github.io/研究团队认为当前不少 RSI 系统虽已形成 “执行任务 → 获取反馈 → 自我修改 → 再次执行” 的循环但仍依赖人类这一 “Golden Verifier”由人预先设定优化目标、评价标准和验证器模型只是在既定方向上持续优化并不能自主决定进化方向因此仍属于 Half-Loop。真正的 Closed-Loop RSI需要补上 “自主确定优化方向” 这一环。项目并未宣称已实现 RSI而是进一步将当前 Self-Improvement 尚未形成真正闭环的原因拆解为三个具体问题。Aspire用于检验智能体能否根据模糊目标自主决定学习内容包含 6 项能力目标、520 项封闭专家评测、支持权重和运行框架Harness更新的最小交互环境以及 48 组匹配的 “模糊目标 — 明确任务” 运行结果及可审计轨迹。模糊目标首先消耗的不是算力是判断力。S³Gym研究智能体能否将经验转化为更优的后续决策围绕 7 项可验证游戏分别评估自测、自判和自我改进能力并比较原始历史上下文学习、摘要记忆和参数训练三种方式实验涵盖 7 个完整上下文级模型以及 Qwen3-8B 的 20 个训练检查点。经验并不会自己长进下一次决策。HarnessDevHarnessDev 评估模型能否构建可运行的智能体框架并根据后续执行反馈持续迭代评测以 Held-Out Tasks 检验框架本身而非仅看任务输出。能跑通的 Harness不等于理解了真实机制。Anthropic 发布长文披露内部 RSI 落地方法论https://www.anthropic.com/institute/measuring-pace-of-ai-development围绕 AI 参与下一代 AI 研发程度、研发自动化水平及 3 万个 AI Agents 监督体系展开。其核心并非让模型自主变强而是推动 AI 研发从人工驱动工程转向可规模化、可验证、可治理的机器研发闭环通过“生成—执行—评估—反馈—改进”流程让 Agent 承担更多执行工作人类聚焦方向定义、评价标准和风险治理。未来 RSI 的关键瓶颈不再是算力或代码生成而是高可信评估能力和研究判断的机器化水平评估质量决定演进上限监督体系决定大规模扩展的安全性。刚完成 V4.1 主算子DeepSeek 资深工程师刘胜与却因一篇个人博客引发 AI Infra 圈热议帖子原文链接如下我不得不把才华埋葬在昨天对《我不得不把才华埋葬在昨天》的补充说明其核心并非 “算子工程师失业”而是 AI Infra 生产模式正在重构算子开发将由专家手工编写、逐点优化转向 Agent 驱动的自动生成、搜索、评测与迭代工程师价值将更多聚焦于架构设计、软硬协同、约束定义、性能判断和系统决策。更深层的启示是代码生成能力普及并不意味着系统工程能力普及。缺乏对硬件、编译、运行时和系统原理的理解AI 可能只是更快制造技术债。未来竞争将从 “打造更强算子” 转向 “构建开放、可验证、硬件感知的 Agentic AI Infra 闭环”以领先下一代计算软件栈。MiniTriton 由 Kimi K3 驱动的智能体开发。其价值不在于比 Torch / Triton 更快而在于将 AI 算子到硬件指令间复杂、强硬件耦合的编译链路简化为一套可理解、可扩展、可由 AI 重构的最小闭环用 Tile DSL分块领域语言统一算子表达以 MLIR 和通用编译优化承接优化与底层映射并将 FlashAttention、KDA 等算法保留在 DSL 层避免固化进编译器。https://github.com/MoonshotAI/minitriton对昇腾的启示是生态建设可从 “持续堆算子” 进一步转向 “建立硬件无关的 Tile 编程抽象并做好面向昇腾的高质量编译映射”系统降低算子开发、迁移和新模型适配成本让 AI 更深入参与系统软件生成与优化。面壁智能推出 ForgeTrain据其披露这是全球首个完全由 AI 编写的生产级大模型预训练框架性能超过英伟达 Megatron在华为昇腾上预训练 MiniCPM5-1B相较昇腾现有框架提速约 10%。基于此面壁智能进一步提出新的软件编程范式Forge Engineering锻造工程。ForgeTrain 的核心价值不在于 “AI 会写框架”而在于提升长期制约 AI 算力生态的软硬件协同适配效率。传统 Megatron 类通用框架依赖人工维护统一抽象需要持续适配模型结构、并行策略、算子、通信及芯片架构容易产生抽象损耗、适配滞后和专家人力瓶颈。ForgeTrain 则通过验证框架Harness定义正确性、性能和稳定性边界由智能体Agent自动完成 “生成 → 运行 → 诊断 → 优化 → 回归” 闭环将框架开发从人工维护通用软件转向面向 “模型 × 硬件 × 任务” 自动生成优化实现。对昇腾而言这一路径有望将 CUDA 生态长期积累的软件经验壁垒转化为可机器搜索、自动迭代的软件工程问题从而缩短新模型适配周期、提升算力利用率并降低对稀缺底层专家的线性依赖。其本质是改变 AI 基础软件的生产方式未来竞争不仅在于框架能力更在于能否持续、低成本地为特定 AI 芯片自动生成并定向高效优化软件栈。上海 AI Lab 联合复旦大学推出 Atria Dawn 预览版探索让智能体参与大模型训练推动人机协作向递归自我改进RSI演进。该模型面向科研与工程工作流发布次日即位列 Hugging Face 日榜第二。其重点不是提升智能体单次任务能力而是将真实研发中的行动持续转化为可验证、可训练、可复用的模型能力。核心突破是建立可验证经验流水线将任务、环境状态、工具调用、产物、外部验证和失败恢复纳入后训练闭环使模型从真实执行结果中获取高质量监督信号并通过轨迹筛选、失败诊断和再训练持续沉淀能力。Atria Dawn 推动智能体人工智能训练从 “学习答案” 转向 “在复杂系统中行动、验证、纠错并完成长程目标”使 AI 从任务级助手向项目级研发执行体演进但目标、验收标准和最终决策仍主要由人掌握。对昇腾生态而言下一阶段竞争将从算力和模型适配上移至可执行环境、工具链、验证器、轨迹数据与训练闭环的一体化基础设施。阶跃星辰联合提出 Φ-Bench前沿 AI 基础设施基准用于评估大模型自主优化自身基础设施的能力。其重点并非 “能否编写 Kernel”而是模型能否像基础设施工程师一样在真实大型代码库和工作负载中完成系统理解、瓶颈定位、实验设计、跨层修改、性能验证和迭代优化的完整闭环。Φ-Bench 将评测从单算子优化拓展至长周期开发和端到端系统优化系统衡量模型对算子、编译器、运行时及系统协同优化的工程能力为 AI 基础设施智能体及基础设施层 RSI 提供可量化的能力标尺。Z.ai 发布《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》称将模型从新硬件跑通升级为稳定、高性能的生产级推理服务是复杂的系统工程。智谱为 GLM-5.3-Flash 从零搭建生产级推理系统运行于 10 万余张国产 AI 加速卡集群目前已承载其全部生产推理。这项工作的核心并非 “让模型自己写几个 Kernel”也未实现完整的 RSI而是降低异构 AI 芯片推理优化对顶尖专家的高度依赖解决反馈稀疏、定位链路长、迭代成本高等问题。目前目标设定、反馈环境和高风险变更仍由人工负责。关键突破是将工程师的 “性能直觉” 转化为覆盖正确性、系统行为和性能的密集反馈信号使智能体形成 “读代码—提假设—改算子或运行时—实验验证—跟踪定位—性能回归” 的真实优化闭环。其实际验证的是AI 可以参与优化承载 AI 自身运行的系统软件。对昇腾而言未来竞争不仅在算力和算子数量更在于能否将芯片、算子、编译器、运行时、通信和推理框架构造成机器可理解、可诊断、可实验、可持续优化的开放系统。这是国产 AI 基础软件规模降本、快速适配并逼近硬件性能上限提高在 Agentic AI 时代下竞争力的关键。预计未来RSIRecursive Self-Improvement将在更多场景和任务中落地成果更多、效果更好。下面分享几点其他思考。大模型越来越会执行难的是自己找到正确目标近几个月Oriol Vinyals、Jeff Dean 创立 Discovery LoopJerry Tworek 创办 Core AutomationOpenAI 的 Benjamin 成立 MirandaoRSI 创业明显升温。但相比融资热度我更关注实际落地。不少成果因涉及企业内部项目尚未公开。已知案例中Gemini 3.8 Flash 的核心后训练流程由模型自主探索形成GLM-5.3驱动 Infra 智能体在 10 万张国产卡集群上从零搭建并优化服务性能提升 3 倍初显 RSI开始优化承载自身的推理系统说明 RSI 已从远期设想开始走向现实。谷歌联合创始人 Sergey Brin 已要求 DeepMind 加快 Gemini 研发并重点推动 RSI这暗示这已成为谷歌核心战略之一其他头部实验室也普遍重点布局。RSI 是否真正形成自我迭代优化可看两个信号一是业务上数据、模型规模、交付需求和客户量持续增长但团队人力无需同比扩张二是技术上系统能否形成稳定的自改进优化闭环。当前主要短板是模型执行能力已很强即使需求模糊也能完成任务但仍难自主定义合理评估标准、找到符合要求的实现路径、正确优化目标这并非难以突破的底层问题甚至可能在下一个季度取得进展。「模型担任研究员」是 RSI 的关键环节。核心问题是模型能否独立完成科研闭环是否存在难以突破的本质瓶颈还是通过积累足够多、高质量的科研思维链和实验数据就能涌现智能自主提出方案、设计实验、排查问题并完成研究。目前看不存在根本性硬障碍。科研本质上很大程度依赖经验积累并非不可习得的特殊能力。当前主要短板是想法的多样性和创新性不足但更像能力提升问题而非物理性瓶颈。AI 研究员落地的关键之一是沉淀大规模实验经验包括哪些方案有效、哪些会失败并逐步转化为模型的科研能力。已有科研数据和完整实验轨迹价值很高真正的难点不是数据获取而是如何从海量原始数据中提炼高价值信息这将是未来的重要挑战。在搜索空间明确时模型执行和探索能力较强可以批量开展对照、消融实验并寻找更优方案。更难的是定义合理、适当约束的搜索空间尤其是面对未知领域时如何提出新的探索方向。这与当前模型想法多样性不足本质上是同一问题。科研场景也能补充代码训练难以覆盖的能力。科研虽然离不开代码和实验实现但还要求像优秀博士那样的自主学习、保持好奇心、开展文献调研、阅读论文、复现实验并原创提出新想法。这些能力泛化仍有较大提升空间。最难的不是变强是证明自己变强了RSI 最难的不是实现自我改进而是证明改进真实有效。根本矛盾在于模型 “既当运动员又当裁判员”既生成答案又评价答案容易成自己骗自己开放性任务尤其缺乏客观标准。如果基准评测集也由 AI 持续修改评测结果还能否证明模型能力真正提升本身就是问题。类似问题早已有研究早期多称为 “自我博弈”一个 AI 出题另一个 AI 答题。典型风险是奖励投机并陷入局部最优例如持续出简单题让答题方始终答对或持续出过难题让其始终答错。因此真正困难的是客观衡量模型是否进步。这也说明相比解决问题定义和验证问题往往更难。Long-Horizon Task 面临类似挑战。目前长周期任务多依赖多智能体协作单智能体的关键问题是如何在执行过程中获得及时、有效的反馈。其核心瓶颈是反馈链条过长。这一方向已成为研究热点。开源社区已有多项尝试包括阿里巴巴 DreamX Team 的LongHorizon-Harness、Google DeepMind 的Amplio以及综述《Towards Long-Horizon Agents: A Survey》。主流方向是构建过程奖励模型、Harness 和 Agent Loop但规模化应用仍然困难。目前主要有两条路径一是基于明确规则设计过程奖励例如以代码测试用例通过率作为反馈但容易陷入局部最优二是让大模型直接充当过程奖励模型但规模扩大后容易出现 Reward Hacking即模型钻奖励规则的漏洞。因此潜在突破口有两个一是研究过程奖励置于完整上下文后产生的连锁影响二是增强模型的自我反思能力。方向已经明确但目前仍没有公认的标准答案。Verification 的定义和思考RSI 需要 Verification → Verification 从任务正确性走向能力提升 → Rubric评估标准是中间态 → 最终回归环境与经济价值 → 中短期人机协同长期 Verifier 简化、环境复杂化。Verifier 是 RSI 持续演进的关键约束。RSI 的前提是明确目标并围绕目标持续自我改进因此系统必须能够判断 “自己做得怎么样”这正是 Verification 的核心作用。当前 Verifier / Grader 受到重视主要因为 RL 正从数学等自带明确验证机制形式化验证的领域走向缺乏天然 Verifier 的复杂场景。现阶段Verifier 主要评估任务完成情况及 Task Trace例如判断模型写游戏、解数学题的过程和结果是否正确。从 RSI 视角看这仍属于 Task-Level Verification目标是完成任务Verifier 判断完成得如何。进一步看评价目标可以从 “任务是否做好” 提升到 “能力是否变强”。例如不只判断一张账单是否填对而是判断模型如何成为更好的会计。此时 Verification 进入 Meta-Level识别模型的能力缺口并据此持续改进。这本质上是Meta-Cognition能够审视自身思考、发现不足并完成自我提升。因此Reflection 很重要而 Reflection 的核心是从复杂环境中有效提取和利用 Evidence 与反馈信号。当前 Rubric 设计困难本质上也与环境有关任务越复杂评价维度越多Rubric 越复杂而且 Rubric 与任务是否真正对齐也难以验证专业领域 Benchmark 尤其如此。但复杂 Rubric 更可能只是中间形态。Coding 是一个典型对照环境相对明确、目标一致最终可以直接用性能、效果衡量例如加速比、测试通过率。当 Benchmark 开始评估人类也无法完成的任务时最终评价标准可能不再是 “是否符合人的 Rubric”而是实际产生了多少经济价值。从这个角度看以人的视角设计环境、题目和 Rubric都可能只是过渡方案。如果进一步采用端到端评价可以直接让 Agent 在环境中持续运行只衡量最终净价值此时 Rubric 本身甚至可以消失问题则转化为如何构建可信、且不易被 Hacking 的环境。例如炒股直接进入真实市场成本高、难回测因此关键是建立足够真实且难以被利用的 Mock 环境。因此长期看复杂 Rubric 可能逐步简化Verification 的核心会进一步回归环境和最终价值。至于 Verification 是否会完全由 AI 接管短期内并不现实。现阶段仍应根据实际需求设计验证机制尤其要保证任务执行的 Pass 判定可靠。AI 可以承担部分验证但为了稳定质量仍需要 Human-In-The-Loop。原因主要有两点一是AI 验证的准确率尚难充分保证二是部分场景中人工成本反而低于 AI。例如 ApprenticeBench 的 Human Evaluation 中就出现了人工评估成本更低的情况。因此中短期仍需要人类专家和工具共同参与验证长期看Verifier 本身可能趋于简单但其所依赖的真实环境会越来越复杂。多家国内模型厂商认为除代码、数学外金融、法律、医疗等生产力场景的输出质量难以自动化核验仍依赖人工筛选。评估本身并非根本瓶颈真正难点是如何在非标业务中建立闭环让模型实现自我评测目前行业尚无成熟方案。既有方案多依赖奖励模型面临与过程奖励模型相同的问题规模扩大后模型容易 “钻空子”。更可行的方向是深入垂直行业先理解现实中人类如何设计奖励机制、判断结果优劣。代码场景之所以率先跑通一个重要原因是 AI 从业者本身熟悉编程也熟悉这一领域的评价标准。把擂台搭好AI 的进步才经得起检验近期谷雨NeoCognition 的联合创始人在 RSI 和 AI Agent 领域非常活跃的青年科学家和孟繁青Evolvent AI 联合创始人孟繁青分别推出受业界关注的 RSI BenchmarkApprenticeBench 和 RSIBench-Data。ApprenticeBench强调真实生产环境与元学习能力。谷雨ApprenticeBench 有两个核心出发点。一是生产真实性。关注 Benchmark 结果能否真实反映 AI 距离进入人类工作岗位还有多远因此重点追求 Ecological Validity。为此Benchmark尽量还原真实工作环境使用真实软件加入企业历史数据、Mentor Feedback 等真实上下文并邀请行业专家参与任务设计和验证。二是元学习能力。ApprenticeBench 不重点考察模型掌握了多少特定知识而是考察其能否快速学习新知识。正如 François Chollet 所说智能进化的关键不在于 “会什么”而在于 “如何学会”。RSIBench-Data为 AI for AI 建立服务化环境。孟繁青ApprenticeBench 更侧重深入真实行业场景构建严谨的 Environment、Task 和 Verifier。RSIBench-Data 则主要面向 AI for AI即让 AI 通过调整权重或相关机制持续提升特定 Benchmark 表现因此不需要大量行业调研和人工出题。RSIBench-Data 目前仍是 Preview。与传统 Post-Training Benchmark 不同认为 AI for AI 更合理的基础设施形态是Everything as a ServiceEval、Training、Rollout 等能力均部署为远程服务Agent 只需调用接口无需本地搭建完整环境。这样有三点价值物理隔离降低部分 Reward Hacking 风险支持异步调用便于 Agent 自主并行执行提高效率优化算力使用让 Agent 将 FLOPs 集中投入最需要的环节。系统还可开放数据、Harness、算法等修改接口。核心不是设计一套传统题库而是搭建一个适合 AI for AI 的 RSI 环境让模型自主开展各类 RSI 任务。Evaluator 和 Benchmark Infra 仍是核心基础设施。无论评测还是训练Infra 都十分重要。周煊赫上海交通大学助理教授Theseus Labs 创始人团队年初与阿里、飞书合作推出 Workspace Bench用于评测企业级 AI 的生产能力。Evaluator 同样关键方向和竞争机制很重要但前提是先把 “擂台” 搭好。目前主要有几类探索对齐人类常识中的偏序关系出现反常排序时进行修正对 Agentic Workflow 的 Trace 开展过程评测面向 RSI在 Reasoning、Exploration、Planning 之外继续识别关键能力探索由 AI 自动合成 Benchmark但高质量 Benchmark 目前仍离不开大量人类专家参与。Workspace Bench 发布后最高分数已升至约 80接近人类水平也反映出公开 Benchmark 容易被迅速 “刷高”。这背后是当前 Evaluation 的共性难题智能难量化、Benchmark 易被 Hacking、Verification 难设计。Hacking既是工程问题也是数据和生态问题。Hacking 可分为后验和先验。后验检测相对直接可以读取模型轨迹再由 Agent 判断是否存在 Hacking但检测 Agent 本身也可能被 Hacking因此并非根本解决方案。先验防范更难。只要系统联网就始终存在被利用的可能工程上往往只能 Case By Case 处理。最终防 Hacking 很大程度上会转化为数据问题尽量保证测试数据无法从公开网络获取。Benchmark Hacking 不完全是技术问题也涉及经济激励和行业生态。公开 Benchmark 后数据供应商可能快速生成同分布训练数据出售事实上会削弱 Benchmark 的评测价值。因此一个公开 Benchmark 能保持三五个月有效已经很不容易。ApprenticeBench 此次未公开数据也有这方面考虑。对刷榜可从两方面应对一是设计基于真实规则、但规则全新的任务使既有作弊方式失效二是持续更新 Benchmark。Verification复杂环境下可复现性和绝对分数均面临挑战。Verification 主要有两个难点第一可复现性下降。复杂 Agent 环境不再像数学题那样与环境无关硬件型号、Windows / Linux、内存、CPU、GPU、NPU 等差异都可能影响结果不同物理平台间天然存在偏差。第二绝对分数意义有限。将每道题归一化为 0~1再汇总成总分往往缺乏明确的物理含义因此绝对分数本身不宜被过度解读。对此团队提出了基于Ladder的评估方法不同 Layer 配置不同参考答案Artifacts每到一个新平台先运行参考答案再据此判断模型所处 Layer从而一定程度上降低环境差异带来的不可复现问题。智能本身高度复杂很难被单一指标准确量化。找到真正有效的 Evaluation也是当前认真训练模型的团队普遍面对的难题。环境反馈并非真正稀疏关键在于如何提取。所谓 “环境信号稀疏” 未必准确。很多真实任务并非没有反馈而是反馈没有集中发生在一次交互中。例如处理邮件等日常任务时用户后续的阅读、回复、修改和持续使用本身都会形成大量反馈信号。真正有价值的信号往往不只存在于用户对单次交互的直接评价中而分布在长期、自然的使用行为里。这些信号可能成为更真实、更丰富的 AI 反馈来源。Intelligence 归模型厂商Expertise 归创业公司核心逻辑投什么 → RSI 本质 → 应用落地抓手 → 创业路径 → 厂商边界投资 RSI首先要判断投的是 Neo Lab新生代实验室还是 Application。如果投 Neo Lab核心问题是AI for AI 的 Base Model 和 Infra如何与成熟模型厂商竞争如果投 RSI Application无论是 ToB 的 FDE还是 ToC 的个性化数据飞轮核心是否都是一套 Environment 与 Verification Co-Design 的 Self-Improving Harness进一步看RSI Startup 与模型厂商的边界在哪里哪些能力模型厂商具备天然优势哪些环节 Startup 能形成差异化RSI 虽涵盖多个层级本质都可抽象为 “在给定真实环境中持续探索和改进测试验证优化闭环”。对模型厂商目标是提升基座模型智能水平因此会构造各类 Agent Environment / Task环境更多体现为 Benchmark对下游应用关键则是提供更丰富的真实环境、上下文以及测试 — 验证 — 反馈优化闭环。大厂也难以完全覆盖好千行百业因此需要一套可复制的落地范式核心是两点一是 “数据的环境”即识别不同场景、不同阶段中真正有助于增强 Agent 的数据、知识并建设相应的数据系统二是 “对真实环境的理解”。现实环境往往复杂杂乱即使最强模型进入杂乱环境找文件、处理任务等能力也会明显下降。因此如何理解环境并让模型基于环境协同规划、执行是应用落地的关键。创业公司大致有两条路径一是服务模型厂商如提供数据或 ApprenticeBench 等 Eval Service二是与模型厂商互补尽量避免直接竞争其核心能力否则容易被下一代模型进步直接 “吃掉”。边界上可泛化的 Intelligence 更适合由模型厂商持续提升Startup 更适合解决如何把 Intelligence 转化为 Expertise。模型厂商提供 “聪明的人”创业公司则把 “聪明的人” 定向训练成特定场景下的 “合格员工”。下一代 RSI要在真实环境里学得更快、更安全面向 Agent 重构底层 Infra。当前 Infra 主要为人设计未来可能转向 Agent-Native。比如集群任务调度过去由多人提交任务排序未必反映任务真实重要性如果集群由 Agent 运营就可以按任务实际重要性动态排序。类似过去围绕人设计的机制都可能出现更适合 Agent 的新范式。持续学习的新范式。真实环境与现有训练环境最大的差异在数据既没有现成、规范的 Input-Output Pairs 或 Traces也无法像 Sandbox、Simulator 一样通过 RL 大量 Rollout。比如 Agent 发错一封邮件得罪合作方可能没有第二次试错机会即真实世界是 Non-Grindable 的因此需要更 Sample-Efficient 的少样本学习方式并能泛化。目前一种方案是外挂 Memory Notes但存在两点不足缺少严格的优化算法且表达能力和 Compression Rate 有限。参数更新则相反表达力和压缩智能更强但 Sample Efficiency 较低。两个研究方向一是更先进的 LLM 非参数学习二是将非参数知识进一步压入参数形成闭环。前者目前主要依赖 Memory Notes后者较多借鉴 OPSDOn-Policy Self-Distillation等思路两者仍有较大提升空间。另外可能的外部变量是 Test-Time TrainingTTT。要把模型厂提供的 “聪明人” 训练成专业员工如果 TTT 能直接完成这一步前面谷雨团队的研究工作的定位可能受到冲击。但目前 TTT 主要停留在 Data 或 Task Distribution 层面的泛化对公司内部精细知识的处理能力仍有限。RSI 最终仍要落到模型能力提升。当前模型还需补齐五方面能力环境感知理解自身权限和可用资源支持流式、低成本、多模态输入并能利用甚至改造环境。探索能力主动探索环境和可用信息。关键信息感知基于部分不完备数据主动找到其余关键事实。在线 / 持续学习突破全量离线训练模式以更轻量、小样本的方式持续学习降低远高于推理的训练成本。安全与边界感知模型需理解自身能力和权限边界避免越界或为达目的采取不可控行为才能承接更高权限。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

五十万Agent项目上线即失败:目标错位与伪智能体的致命陷阱 2026/9/26 14:24:09

五十万Agent项目上线即失败:目标错位与伪智能体的致命陷阱

1. 五十万的Agent为何一周就凉:先还原一下现场先别急着笑客户"人傻钱多"。这个案例我盯了很久,因为它不是个例,而是过去一年里我看到的最典型的失败样本之一。客户是一家做供应链金融的中型公司,不是互联网大厂&#xf…

阅读更多 →
AI编程实战经验:从工具选型到代码质量把控的完整指南 2026/9/26 14:24:09

AI编程实战经验:从工具选型到代码质量把控的完整指南

先把话放前头:这篇文章不对任何具体的AI代码工具做"神化"宣传,也不劝你从一个工具全家桶跳进另一个全家桶。我就是一个业余时间写代码、靠AI工具把想法落地成实际项目的人。过去一年多,我用AI完成了几个web应用、一套小红书选题抓取…

阅读更多 →
电力AI大赛数据挖掘管道:从原始表到可复现提交的完整路径 2026/9/26 14:24:09

电力AI大赛数据挖掘管道:从原始表到可复现提交的完整路径

简介:这份资源围绕大航杯“智造扬中”电力AI大赛,提供一套完整的数据挖掘管道搭建示例,面向计算机、人工智能、自动化等相关专业的在校学生、教师及企业员工,也适合作为毕业设计、课程设计或项目立项的参考案例。压缩包共32个文件…

阅读更多 →
链串替换算法详解:从PTA题目到数据结构实战 2026/9/26 14:23:57

链串替换算法详解:从PTA题目到数据结构实战

1. 题目场景与链串的选型思考1.1 PTA这道题在考什么拼题A(PTA)平台上“串的算法设计”系列题,向来是数据结构课程里字符串这一章的“分水岭”。前面几题做顺序串的定位、求子串,基本属于把数组下标玩明白就能过;到了第…

阅读更多 →
WDDM 3.1神经渲染注入原理与实践 2026/9/26 14:23:57

WDDM 3.1神经渲染注入原理与实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
MA_SRUKF-PHD-SLAM:多模型自适应与概率假设密度融合的激光SLAM方法 2026/9/26 14:23:57

MA_SRUKF-PHD-SLAM:多模型自适应与概率假设密度融合的激光SLAM方法

简介:这份资源围绕平方根无迹卡尔曼滤波(SRUKF)在概率假设密度(PHD)SLAM中的应用展开,面向机器人自主导航、自动驾驶与多目标跟踪方向的学习者和研究者,帮助理解如何在非线性、多目标环境下同时…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉