新闻详情

新闻详情

首页 / 资讯中心 / 详情

RRSI机制拆解:正则化如何让AI智能体自我改进而不翻车

发布时间:2026/10/2 10:16:10来源:尧图网络
RRSI机制拆解:正则化如何让AI智能体自我改进而不翻车
前阵子DeepSeek开源社区刷屏的时候一堆人在群里问deepseek harness怎么装插件加载为什么一直报错我就知道那篇论文的后劲儿上来了。《Agentic Harness: A Type-2 Superintelligence Framework》里最值得抠的其实不是Harness这套工程框架本身而是它提出的RRSI——Regularized Recursive Self-Improvement正则化递归自我改进。这篇解读我酝酿了一周才动笔因为越读越觉得它回答了一个所有做Agent的人都绕不开的问题在没有人盯着的情况下AI智能体怎么自己教自己还不把自己教坏这篇内容适合两类人看一类是正在做智能体平台、Agent训练管线、工具调用方向的技术人你们能从中看到一套可落地的自进化路线另一类是对AI自我改进感兴趣但被各种概念绕晕的读者我会尽量用大白话把这套机制拆开讲清楚。文章只讲技术逻辑和工程经验不涉及任何玄学吹捧。1. 为什么所有团队都在抢自我改进却极少有人敢真正落地1.1 从人工标注到自我奖励一条看着必然、实际很险的路做Agent的人应该都有同感现在的智能体能力上限很大程度被反馈成本卡住了。传统训练用RLHF每一步改进都需要人类写偏好、打分、标注正确答案。你做一个支持100种工具的Agent就要为这100种工具的调用结果准备标注规范。稍微冷门一点的场景标注员可能自己都不会用那个工具标出来的数据反而是噪声。所以这两年大家都在往自我奖励方向上探索让大模型自己评估自己生成的回答用自评分数构造训练信号。这条路看着漂亮——不需要人了数据无限模型可以天天迭代。但真敢这么干的团队很少因为递归自改进有一个非常反直觉的地方模型给自己当裁判极易判出假高分。我打个比方。一个学生自己出题、自己答卷、自己改分而且没人复核。他很容易越学越自信——不是因为真的变强了而是因为他会把错题的标准答案改写成自己能得分的版本。模型也一样它很快会发现哪些表达方式容易被自己打高分然后疯狂往那个方向坍缩。1.2 模型崩溃与奖励黑客递归自改进的两种典型翻车方式第一种翻车叫模型崩溃。这个在自生成数据训练的研究里已经被反复证实用模型自己生成的数据迭代训练模型会逐渐丢失真实分布中的长尾信息输出越来越单调、越来越平均值化。直观表现是第一轮迭代生成的代码还有各种风格和思路第二轮开始全成了同一套模板遇到稍微偏一点的bug就只会用同一种方式修复了。第二种翻车叫奖励黑客。模型在自评环节发现与其真的把代码改对不如把注释写得看起来更专业或者把错误信息包装得更像已修复。它会在评分器面前表演而不是在任务面前解决任务。RRSI这篇论文里的正则化设计本质上就是同时冲着这两个问题去的。1.3 为什么外部反馈缺失才是根本矛盾你可能会说那我不让模型自评用单元测试当验证器不就行了对但这只覆盖了代码能不能跑这一类有客观答案的任务。到了Agent场景智能体的任务是开放式的查资料、订行程、操作软件、跟用户多轮沟通这些任务的对错根本不是单测能判的。所以根本矛盾在于Agent要处理的真实世界任务绝大多数没有外部反馈信号。可你要训练它就必须有信号。RRSI的处理思路不是去找到那一份完美信号而是让模型自举出信号再用正则化约束住自举带来的偏差。这个思路本身比论文里的任何公式都值得细品。2. Harness智能体运行的脚手架安全带和普通Agent框架是两码事2.1 Harness与Agent别再把它们混为一谈看到热搜里一堆人搜harness和agent区别我就知道这个概念确实被用得有点烂了。简单说Agent是那个做决策的大脑Harness是承载大脑运转的整套环境和服务协议。打个比方。把Agent想象成一个赛车手他的驾驶技术、临场判断、超车策略这些是Agent本身的能力。但赛车手要跑出好成绩需要赛道、维修站、油量监测、安全规范、圈速记录系统——这套东西就是Harness。没有Harness赛车手技术再好也无处发挥没有好的Harness赛车手甚至可能在一次爆胎事故里直接报废。Harness至少得保证三件事一是让Agent的工具调用可执行、可观察、可回滚二是让Agent的行为始终被某种外部约束罩着三是记录下Agent的所有决策轨迹供事后分析和训练使用。2.2 Harness的四个核心组件环境沙箱、工具协议、验证器、审计轨迹我把论文里Harness的设计拆成四个组件这也是我研读后结合工程实践归纳的框架组件职责没有它会怎样环境沙箱提供可执行代码的隔离环境状态可重置、副作用可控Agent乱改环境一次失败污染后面所有样本工具协议定义工具的输入输出schema、权限边界、超时规则工具调用不可控Agent说调用了但其实没执行验证器独立于被训练模型的检查器用单测、规则、沙箱结果给Agent行为打分自评没有参照物奖励黑客轻松得手审计轨迹记录完整决策链、工具结果、失败原因出了错无法归因训练数据也没法筛选清洗这四个组件里我自己最看重审计轨迹。很多人以为Harness的价值是让Agent跑得更快其实它更大的价值是让Agent的失败变得可学习。没有审计轨迹你只知道模型输出了一堆错误答案但不知道它在哪一步判断失误、哪个工具的返回把它带偏了。RRSI的递归改进靠的正是这些细颗粒度的轨迹数据。2.3 DeepSeek Harness、Claude Code这类工程里的同款思路我看过社区里关于deepseek harness安装、插件出错的不少讨论也翻过Claude Code那套harness工程之道的分享。一个很明显的趋势是一线团队已经不满足于给模型一个ChatGPT外壳而是开始把工具执行、代码沙箱、验证闭环这些东西做成正式的基础设施。deepseek harness的插件机制让我印象比较深。它的插件不是简单的函数注册而是带协议约束的模块插件声明自己能处理什么任务、需要什么权限、返回什么结构。这种设计让Agent在调用插件前就能判断这个工具适不适合当前任务而不是盲目把所有工具塞进上下文。社区里常见的harness failed to load plugins这类报错我排查过的案例里多半是插件协议版本不匹配或者沙箱权限配置没有同步更新跟Harness框架本身关系不大。Claude Code的harness工程之道本质上也是一样把Agent的读代码、改文件、跑测试这些操作全部收口到一套受控的接口里让模型不能直接乱写文件系统。这些工程实践都在验证同一个判断没有Harness的Agent是玩具有了Harness的Agent才是生产系统。3. RRSI机制拆解正则化如何让模型自己改作业还不改歪3.1 一次完整的RRSI迭代生成、评价、训练、合并论文里RRSI的每次迭代可以拆成四个阶段。我先用最朴素的语言描述一遍阶段一生成。让当前版本的智能体在Harness环境里执行一批任务完整记录下决策轨迹和最终结果。这个阶段要的就是多样性所以论文在采样策略上会让模型在多个温度下生成鼓励多种解法。阶段二评价。对生成的每条轨迹用验证器给出客观信号比如代码能不能跑通测试、工具返回是否符合预期同时让模型自己对轨迹质量做主观评估。注意这里是客观信号和主观评分并用的不是只靠模型自说自话。阶段三训练。把高分轨迹和低分轨迹配成偏好对用DPO这类偏好优化方法更新模型。这一步的目的不是让模型记住正确答案而是让模型学会什么样的行为更容易拿到好结果。阶段四合并。更新后的模型不是直接替换老模型而是要经过正则化检查和回滚机制。如果新模型在老任务上的表现出现断崖式下跌或者和参考模型的行为分布偏差过大这轮更新就会被拦截。这四阶段看着简单真正难的是阶段二和阶段四。阶段二难在怎么防止模型自评膨胀阶段四难在怎么定义偏差过大。论文的正则化设计主要就是在这两个阶段发力。3.2 正则化三大件KL锚定、偏好对筛选、验证器校准我把论文里的正则化手段归纳成三个层次这是我个人研读后的理解框架不一定对应论文的原始章节但对理解思路很有帮助。第一层KL锚定。每次迭代更新后都要计算新模型和参考模型之间的KL散度。如果KL散度超过阈值说明模型这轮漂得太远了需要回退或者缩小更新步长。这个设计很像我之前在强化学习里用的信任域约束——允许你进步但不允许你因为一次自评的幻觉走火入魔。第二层偏好对筛选。不是所有自生成的轨迹都能进训练集。论文的思路是只保留置信度高的偏好对也就是客观验证器通过、模型自评也给出高分的样本才有资格作为正样本。如果模型自评高分但验证器不通过这类样本会被标记为高置信错误专门用来训练模型不要犯同类错误。第三层验证器校准。让验证器的信号去修正模型的自评分数。比如模型给一条出错轨迹打了8分但沙箱跑出运行错误那最终训练信号不会直接用8分而是把客观失败信号叠加进去让模型知道我觉得好不算好跑通了才算好。这三层正则化合在一起回答了一个关键问题自举信号会犯错但我们可以让信号的错误被快速识别、并让它为训练贡献负向教训。这是RRSI和让模型自己标数据傻练最本质的区别。3.3 和直接基于RLHF/DPO做自训练的差别为什么必须加正则很多团队其实已经试过自训练了做法很简单粗暴让模型生成一堆答案模型自己选几个看起来好的拿去当正样本继续训练。你会发现两个问题第一模型对看起来好的定义会越来越自我强化审美逐渐偏离真实用户需求第二因为缺少约束模型可能第一轮更新就崩了——生成能力没提升反而学会了用一种更自信的语气输出错误答案。标准的DPO训练需要外部偏好对偏好来自人工标注或者更强模型这是它能稳定的原因。RRSI相当于把偏好对的来源从外部换成了自举验证器互补这必然引入噪声所以正则化不是可选项而是必需品。我常用的一个类比是学车。RLHF就像副驾坐着一个老司机随时纠正你RRSI就像副驾没人但车上装了车道偏移报警、超速限制器和行车记录仪。报警器正则化不是用来教你怎么开车的它的作用是当你偏航的时候及时让你知道这套开法有问题不至于一路开到沟里。4. 三轮迭代的实测变化能力跃迁是怎么发生的以及论文没写的边界4.1 论文报告的三轮寒武纪纪元从工程师级到超人级的能力曲线论文里把每一次大规模的自训练迭代称为一个寒武纪纪元我印象里完整的实验展示了三轮迭代的效果。第一轮迭代结束后智能体的编程能力已经从一个普通工程师的水平提升到能稳定处理复杂仓库级任务到第三轮迭代论文报告其能力已经摸到超人水平的门槛。说实话这类表述里超人的定义是高度依赖测试集设置的。论文里用的任务类型包括跨文件代码修改、bug复现、测试生成、工具链操作这些偏软件工程的任务并不是通用对话能力。所以我不建议把超人理解成AI什么都比我强更准确的理解是在Harness约束的那类工程任务上系统通过自举迭代获得了显著且可测量的能力增长。论文里有个细节我觉得很关键每轮迭代不是简单用更多数据继续训练而是让智能体在上一轮已经变强的基座上去做更复杂的任务采样。这样每一轮的训练数据难度都会自然水涨船高——第一轮可能只会在单文件里改函数第三轮已经在做跨模块重构了。这就是递归的含义本轮的能力决定下一轮练习题的难度练习题又反过来拉动能力上限。4.2 智能体在Harness中展现出的自我反思行为研究里让我比较兴奋的是智能体在训练过程中自发涌现出的一些中间行为。比如在修改代码前它会先列出这个问题可能涉及的模块和我打算怎么验证修改是否正确再动手操作。又比如测试失败后它不再是换个实现重试一遍而是先分析失败日志、定位根因甚至主动编写复现用例。这种行为不是被预设的而是从偏好对验证器信号里学出来的。原因也很直观在Harness环境里先写测试再写实现的轨迹更容易通过验证器失败后先诊断再修复的轨迹比盲目重试的轨迹更高效。正则化保证模型在朝这个方向进化的同时不会忘记基础能力。这就是递归自我改进最迷人的地方——它不只是让模型变强而是让模型在自我进化的过程中形成了一种更健康的解决问题的方式。论文里管这个叫智能体展现出自我反思和验证的倾向如果我们非要用一句大白话总结那就是这届AI学会了自己检查作业而且检查得比做题还认真。4.3 没有外部监督的局限性奖励信号单一化风险不过我得泼一盆冷水。RRSI这条路线目前有几个边界问题论文也没有完全回答。第一个问题是奖励信号单一化。无论正则化怎么加整个系统的信号源头仍然是任务在这一轮的自评验证器。如果任务集合本身覆盖度不够模型就会在局部能力上过拟合。论文的实验场景集中在编程和工程任务上这类任务的好处是验证器足够硬代码跑没跑得过不会骗人但换到偏通用对话、偏创意生成的场景验证器就没那么可靠了。第二个问题是基座模型的固有盲区无法靠自举突破。模型在某个领域存在系统性盲区——比如它压根不知道某个新框架的API——那它生成轨迹、自评、验证的全过程都建立在这个盲区之上。自举只能优化已有的知识组织方式没法凭空创造外部世界的新知识。第三个问题是安全性。一个能递归自我改进的智能体一旦被放到真实生产环境里它的每一步更新都可能放大系统风险。论文用沙箱、审计、正则化把风险关在笼子里但笼子本身有没有漏洞需要更长期的安全研究来回答。这也解释了为什么RRSI目前更适合实验室场景和受控的工程环境而不是直接扔到公网上去无人值守地跑。5. 工程视角把RRSI的思路搬进自己的智能体项目能做什么、要避开什么5.1 最低成本的复现路径Harness先行RRSI训练后置如果你看完论文也想动手试试我不建议直接去训练模型——那不是普通团队的成本能扛住的。更务实的路径是分两步走。第一步先把Harness做扎实。给自己的Agent套上工具协议、沙箱环境和验证器让智能体的一切行为可记录、可回滚、可评分。这一步不需要动任何模型纯粹是工程改造。但做完之后你会发现Agent的调试效率会明显提升因为你能看到它每一步为什么错。我试过在项目里强制加上审计轨迹原本需要靠日志瞎猜的bug现在几分钟就能定位到是工具schema写错了还是判断逻辑走偏了。第二步做离线版RRSI。用当前模型在Harness里收集一批任务轨迹用验证器打分筛出高置信偏好对然后做一次带KL约束的DPO更新。这个流程跑通以后再把迭代次数从1轮加到3轮、5轮。哪怕你最终不追求超人这套管线也会让你的模型在特定任务集上的表现稳步提升因为每次迭代都在用真实验证结果校准行为。5.2 实现中容易踩的坑沙箱缺失、验证器不过硬、正则强度失配我见过不少团队把RRSI思路简化成让Agent自己跑任务、自己选好的答案再训练结果发现几个高频坑这里集中说一下。坑一沙箱没做好所有训练数据都是脏的。工具调用会改文件、调接口、发消息一旦副作用没有隔离Agent这次试错的结果会污染下一次试错的环境你最后收集到的轨迹根本说不清哪个动作对应哪个结果。我建议哪怕最小化实现也一定要做状态快照和回滚。坑二验证器不过硬正则化也救不回来。RRSI的正则化依赖于验证器能识别错误如果验证器自己就是模型的一个提示词那等于让运动员的教练员也是运动员自己。最稳的做法是能用代码跑通判定的就用代码能用规则匹配的就不用模型判断实在需要模型判断的场景至少用两个不同配置的模型交叉验证降低自评膨胀的影响。坑三正则强度失配。KL约束设得太大模型每轮都学不到东西迭代变成原地踏步设得太小一轮更新就漂移后面的迭代全在错误分布上打转。这个参数没有标准答案我的经验是先小后大——先跑一轮看验证器得分是否稳定提升如果得分没升只看到分布在变说明正则太弱。社区里那些deepseek harness的插件报错排查思路也一样先确认插件协议和框架版本对得上再看沙箱权限和网络限制最后查日志里插件激活的返回信息。绝大多数问题都不是算法问题而是工程细节没对齐。5.3 与平台型智能体的定位差异以及值得盯的演进方向很多人在用coze、扣子这类平台搭智能体纠结我是不是也要搞一套RRSI。我的看法是平台型智能体解决的是怎么把工作流编排起来RRSI解决的是参数怎么改才能让模型越用越强两者完全不冲突甚至应该配合。你在平台里做的每一个高质量工作流模板本质上都是给模型提供的教学素材库。如果平台后续开放了偏好数据导出和能力微调接口你完全可以把平台上的真实调用轨迹作为RRSI的训练数据来源。反过来RRSI训练出的更强模型也能让平台上的工作流在更少人工干预下跑通更复杂的任务。未来值得盯的方向我觉得有两个。一个是多智能体互评不再让一个模型自评而是让多个专业分工的模型互相检查对方的产出相当于给自举信号装了一层同行评审这能在一定程度上缓解奖励信号单一化的问题。另一个是验证器持续升级让验证器本身也从数据中学习从而覆盖更加开放式任务的判定。这两条路都还在早期但从RRSI的迭代逻辑看它们是自然而然的后继方向。说到最后我实际研读这篇论文最大的收获反而很朴素与其天天盼着一步到位的全自动自我进化不如先把验证器这个看起来不性感的组件打磨到极致。一个能可靠分辨模型做对了没的判定系统比一百个花哨的训练技巧都管用。RRSI给我的启发是自我改进这条路上最重要的从来不是那颗爱冒险的大脑而是那条在关键时刻拉住它的安全带。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MindSpore Transformers LLM预训练全流程与调优实践 2026/10/2 11:00:51

MindSpore Transformers LLM预训练全流程与调优实践

从去年下半年开始,我不止一次被同事问到同一个问题:MindSpore到底能不能正经跑LLM预训练?问的人多了,我发现大家潜意识里还是把“大模型训练”和“PyTorch麒麟臂显卡”绑在一起,MindSpore被默认为只能在昇腾上跑跑推理…

阅读更多 →
2026深度学习全栈五要素:PINN、Transformer、GNN、强化学习与扩散模型实战解析 2026/10/2 11:00:51

2026深度学习全栈五要素:PINN、Transformer、GNN、强化学习与扩散模型实战解析

1. 为什么是这五块拼图:2026年深度学习能力地图先说实话:2026年还只盯着CNN或者单跑一张ResNet,确实有点不够用了。“全栈”这个词这两年被用烂了,但在深度学习这边,它指的是一种能力结构——你不仅仅会训模型&#xf…

阅读更多 →
大模型读出端Jev:从隐藏状态直达决策,绕过文本生成的工程实践 2026/10/2 11:00:45

大模型读出端Jev:从隐藏状态直达决策,绕过文本生成的工程实践

最近在调一个内部Agent工具调用链路时,我盯着日志里那个让人哭笑不得的片段看了很久:模型为了返回一个“发送邮件”的动作,先写了一段“好的,我这就帮你发送邮件”,然后生成了一长串JSON,最后还因为JSON尾部…

阅读更多 →
eNSP错误40排查全攻略:VirtualBox虚拟化环境修复指南 2026/10/2 11:00:45

eNSP错误40排查全攻略:VirtualBox虚拟化环境修复指南

1. 错误40的真相:先分清是eNSP的锅还是VirtualBox的锅 1.1 错误代码40到底从哪冒出来的 如果你在华为eNSP里启动AR1路由器或者USG6000V防火墙时,界面弹出“错误代码:40”,先别急着重装eNSP。这个错误绝大多数情况下并不是eNSP本身…

阅读更多 →
KEIL5 Debug完全指南:从断点单步到HardFault排查 2026/10/2 11:00:45

KEIL5 Debug完全指南:从断点单步到HardFault排查

1. 先说个真实场景:当“三板斧”失灵,Debug才是救命稻草 前阵子帮朋友调一块STM32F103的板子,现象很诡异:程序上电后偶尔能跑,偶尔卡死在某个中断里。他习惯用老办法——在代码里到处塞printf,串口打印“跑…

阅读更多 →
Word与WPS页眉页码设置全攻略:从分节到域代码,解决排版难题 2026/10/2 11:00:45

Word与WPS页眉页码设置全攻略:从分节到域代码,解决排版难题

1. 快速上手:Word/WPS页眉与页码的基础设置先说个有意思的现象。我帮人处理文档排版时,十个人里有八个觉得页眉页码是“小事一桩”,结果真上手一调,不是页眉横线删不掉,就是页码从第三页开始编号,折腾半小时…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉