新闻详情

新闻详情

首页 / 资讯中心 / 详情

浙大阿里提出RetireOPD:让AI学生自己决定何时毕业

发布时间:2026/9/28 19:51:14来源:尧图网络
浙大阿里提出RetireOPD:让AI学生自己决定何时毕业
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning作者Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen核心发表机构Zhejiang University、Alibaba Group论文链接arXiv:2609.20784v1发布于arXiv 预印本cs.CL|——| RetireOPD (Ours) | 60 | 92.2 || w/o Alignment Stagnation | 50 | 89.0 || w/o Relative Competence | 100 | 89.0 || w/o Retirement | – | 82.8 || w/o OPD (GRPO-only) | 0 | 75.0 |结论清晰全程保留 OPD 只有 82.8%而完整方法达 92.2%说明及时移除教师监督对后续优化至关重要单独使用 alignment progress第 50 步退休或单独使用 relative competence第 100 步退休都只达到 89.0%两者结合达到最佳说明“差异停滞”与“能力达标”两个判据互补——前者缺位会导致较早切换后者缺位会导致过晚切换而两种偏差都带来约 3 个百分点的损失。此外从退休点继续训练的对照实验进一步佐证了机制比较“继续联合优化”“切换回 OPD”“移除 OPD 仅用 GRPO”三种策略后只有第三种能让成功率从退休点的 76.6% 稳步提升至 93.8%继续联合优化会进入平台并伴随师生差异持续扩大而切回更强教师对齐则会压缩甚至损害任务性能。自适应退休 vs 线性退火。与 ATOD 的对照显示线性退火在训练早期提升迅速但后期趋于平台自适应准则则持续改进。这一结果支持论文的核心论点教师效用并不按预定义时间表衰减用训练动态确定过渡阶段既能保留早期指导又能避免后期约束。退休阈值敏感性。论文在 3B 设置下扫描了能力阈值γ \gammaγ与有符号相对停滞阈值δ \deltaδ。完整方法γ 0.9 , δ 0 \gamma0.9,\delta0γ0.9,δ0在第 60 步退休、成功率 92.2γ 0.8 \gamma0.8γ0.8在第 55 步退休、90.6γ 1.0 \gamma1.0γ1.0在第 95 步退休、91.4δ 0.03 \delta0.03δ0.03在第 65 步退休、89.1δ 0.05 \delta0.05δ0.05在第 95 步退休、91.4。更宽范围的扫描表明对于γ ∈ [ 0.80 , 0.96 ] \gamma\in[0.80,0.96]γ∈[0.80,0.96]与δ ∈ [ − 0.10 , 0.04 ] \delta\in[-0.10,0.04]δ∈[−0.10,0.04]退休步数保持在默认设置± 5 \pm 5±5步以内只有在相对极端的阈值下才会出现明显延迟。综合来看阈值变化把过渡点从第 55 步推到第 95 步而成功率始终落在 89.1%–92.2% 区间且性能并不随过渡步数单调变化——这说明方法不依赖精细调参或某一个精确的切换点。需要说明“Adaptive Retirement vs. Linear Annealing”一节的正文结论在所提供的源码片段中未完整给出此处仅基于图中可确证的“线性退火后期平台、自适应持续改进”这一趋势进行描述。)五、相关工作 / Related WorkRLVR 与稀疏监督。以 GRPO 为代表的 RLVR 范式依托可验证结果奖励训练智能体但每条轨迹只有一个标量奖励信用分配粗粒度。RetireOPD 保留了 RLVR 的奖励信号作为主驱动只是在其之上叠加一层可控的密集监督并在适当时机撤回这层监督。On-Policy Distillation 与 OPSD。OPD 让学生在自身采样分布上接受更强教师的 token 级反馈OPSD 在没有更强外部教师时把同一模型条件于特权信息后作为教师蒸馏到无条件分支。智能体任务中的特权信息通常是检索或事后hindsight技能。已有方法让教师与学生共享同一策略、仅在上下文上分叉并通过 gating、同步或 advantage shaping 在 token 粒度上控制教师信号。RetireOPD 的关键差异在于蒸馏之前用环境奖励单独训练教师使教师与学生解耦避免“技能分支从未被训练去使用技能”的失效模式。蒸馏与 RL 的混合方法。已有混合方案包括退火蒸馏权重、在预定步数从蒸馏切换到 RL、扩展暴露给学生的轨迹视野、在衰减预算下撤回 in-context 技能、以及顺序执行蒸馏与 RL 等。它们的共同点是 transition 在训练前就被固定。更细粒度的在线决策只存在于局部层面例如仅对整条 rollout 失败的 prompt 施加蒸馏或按 token 门控教师信号但没有任何方法真正移除教师。RetireOPD 的差异是从师生差异与学生相对能力出发在线决定全局 transition并最终彻底移除教师此后仅用 GRPO 训练。与教师退火调度的区别。ATOD 一类方法用预定义线性退火表控制蒸馏权重其隐含假设是教师效用随时间线性衰减。RetireOPD 的代之以数据驱动的判据实验显示这一区别在后期性能上有可观差距。六、局限性与展望 / Limitations Future Work需要明确说明的是所提供的源码片段中并未出现独立的 Limitations 章节也未给出作者对局限性的正式声明因此以下内容是基于片段可确证信息的整理以及片段未覆盖项的标注不构成对作者观点的推测。其一理论分析的适用条件较窄。附录的一阶分析忽略有限样本噪声、假设 GRPO clipping 在局部不激活并且“退出优于联合”的结论需要步长η \etaη足够小。这意味着该分析刻画的是局部行为不能保证在训练早期的强随机性与大更新下仍然成立——这也正是方法需要额外引入能力门槛γ \gammaγ来防止过早退出的原因。其二方法的成本结构未被充分讨论。RetireOPD 需要一个完整的 Phase 1 教师训练阶段教师与学生同规模且教师监督期间每次更新都需要一次额外的教师前向传播片段未给出教师训练步数、总体计算开销相对基线的倍数也未讨论技能检索质量SkillBank 与 Keyword Matching对结果的敏感性。这些属于片段未覆盖项。其三超参与实现细节存在未明确之处。方法定义中出现了监控窗口W WW实验实现只说明每H 5 H5H5个 evaluation steps 评估一次退休准则片段未清晰给出W WW的实际取值与两者的关系δ \deltaδ的具体取值在不同片段中也有“未给出”与“默认δ 0 \delta0δ0”的不同表述需要以论文正文为准。其四对照实验存在信息缺口。“Adaptive Retirement vs. Linear Annealing”一节的正文与结论在片段中缺失无法提取该对比的完整数值结论训练动力学四类曲线成功率、差异、熵、奖励的具体数值同样未在片段中给出。其五可扩展性与泛化性有待检验。所有实验均在 Qwen2.5 系列 1.5B–7B 与 ALFWorld、WebShop 两个文本环境上完成未涉及更大规模模型、多模态环境或需要更长交互视野的任务“外部大教师 OPD 效果极差”这一现象虽被报告但其成因分布不匹配、能力差距过大抑或教师本身未适配任务格式在片段中未做进一步分析是有价值的后续研究方向。七、总结 / ConclusionRetireOPD 处理的是自蒸馏式智能体强化学习中两个被长期默认、却并不成立的假设。它先说清“哪个教师”的问题特权信息本身不会自动产生可靠教师只有用环境奖励显式训练 skill-conditioned 教师才能把上下文中的信息优势转化为一致的行为优势这一点在未优化分支 7B 模型仅 23.4% 成功率的反例中体现得尤为鲜明。它再说清“学多久”的问题教师监督是阶段相关的临时脚手架早期能消除 GRPO 的慢启动并突破纯 OPD 的低上限后期却会与奖励驱动优化冲突把学生封顶在教师水平附近。对应的解法是解耦的教师构建加自适应退休。学生先在 GRPO 与 OPD 的联合目标下吸收技能同时以窗口级统计量监控师生差异的相对变化ρ m ( K ) \rho_m^{(K)}ρm(K)​与相对能力η m \eta_mηm​一旦差异停止缩小且学生成功率接近教师成功率的 90%就永久移除教师此后仅用 GRPO 继续训练。论文的局部一阶分析为这一判据提供了形式化依据差异停滞意味着⟨ g , h ⟩ 0 \langle g,h\rangle0⟨g,h⟩0的局部冲突或 OPD 信号枯竭而在冲突成立时退出教师能获得更大的一阶回报提升。实验上RetireOPD 在 Qwen2.5-1.5B/3B/7B 与 ALFWorld、WebShop 上一致超过纯 RL、蒸馏、混合基线乃至其自身的 skill-conditioned teacherALFWorld 成功率相对 RL 基线提升 14.1%–18.8%WebShop 准确率提升 11.8%–19.0%消融则显示两个退休判据互补、阈值在较宽范围内稳定、且自适应退休优于预定义线性退火。一句话概括其洞察教师的价值不在于被赋予了多少特权信息而在于是否能被训练去使用它以及是否知道何时该退场。原文摘要:Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher’s success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.PDF链接:https://arxiv.org/pdf/2609.20784v1部分平台可能图片显示异常请以我的博客内容为准
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

使用国内最新编译器生成安卓app编程入门的全过程 2026/9/28 20:36:58

使用国内最新编译器生成安卓app编程入门的全过程

阅读更多 →
FastAPI 实战:从“能跑的 Demo“到“敢上生产的 API“ 2026/9/28 20:36:57

FastAPI 实战:从“能跑的 Demo“到“敢上生产的 API“

FastAPI 是近几年 Python Web 框架里上升势头最猛的一个:类型标注即文档、Pydantic 校验、原生 async、自动 OpenAPI。但很多人学完官方 Tutorial 就直接上了生产,然后被同步阻塞、依赖注入乱用、模型版本升级这些坑逐一教育。本文按项目演化的时间线&am…

阅读更多 →
园区访客管理系统有哪些品牌?四类厂商横向看清 2026/9/28 20:36:57

园区访客管理系统有哪些品牌?四类厂商横向看清

一、先说结论:这个问题难答,不是因为你没找到资料 搜“园区访客管理系统有哪些品牌”,出来的是几十家官网,看着都差不多,报价却能差好几倍。 问题不在资料太少,在于**“访客管理系统”这个词底下装的不是一…

阅读更多 →
实测体验|PaperXie 五大核心板块上手感受,毕设党可以直接参考 2026/9/28 20:36:57

实测体验|PaperXie 五大核心板块上手感受,毕设党可以直接参考

正在做毕设的同学,大概率都听过 PaperXie 这款一站式 AI 论文平台。很多人好奇,它的五大核心板块实际用起来是什么样?不是干巴巴的功能罗列,今天从使用者视角聊聊每个板块适合解决什么痛点、真实体验以及使用时需要留意的地方。 &…

阅读更多 →
从“大脑的神经机制”到一套临界性意识理论的完整构建(一) 2026/9/28 20:36:57

从“大脑的神经机制”到一套临界性意识理论的完整构建(一)

[score0.816] 进一步探索神经机制与意识涌现的关系,尤其是全局工作空间理论与整合信息理论在解释意识本质上的互补与冲突。同时可比较人类大脑与类脑智能模型在动态网络上的异同,以深化对智能本质的理解。 人类大脑的神经机制,与其说是一个可…

阅读更多 →
第16篇_电路分析_VRM同步Buck手算效率与损耗模型 2026/9/28 20:36:51

第16篇_电路分析_VRM同步Buck手算效率与损耗模型

第16篇 | 服务器 VRM 同步 Buck 电路手算效率——损耗模型与波形拆解分析方法: Buck 电路图 → 导通/开关损耗分项公式推导 → 仿真验证(SW 节点波形 电感电流 效率曲线) → 开关频率与电感选型的工程权衡一、导言:CPU 的饭怎么…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉