新闻详情

新闻详情

首页 / 资讯中心 / 详情

HyperAgents基线与消融实验全解读:DGM对比揭示自我改进的真实价值

发布时间:2026/10/2 17:10:51来源:尧图网络
HyperAgents基线与消融实验全解读:DGM对比揭示自我改进的真实价值
HyperAgents基线与消融实验全解读DGM对比揭示自我改进的真实价值【免费下载链接】HyperAgentsSelf-referential self-improving agents that can optimize for any computable task项目地址: https://gitcode.com/gh_mirrors/hy/HyperAgentsHyperAgents 是一类自我改进的智能体系统它不止于完成单个任务而是会反过来修改自己的代码让自己在下一代中变得更聪明。本文带你完整看懂仓库中baselines/目录下的 DGM 对比基线以及多组消融实验的设计逻辑——从generate_loop.py的一个个命令行开关到analysis/里的对比曲线逐步拆解自我改进到底带来了什么真实价值。什么是 HyperAgents先看懂元智能体 任务智能体双引擎HyperAgents 的核心由两个角色组成理解了它们后面所有基线对比才有意义元智能体Meta Agent源码在 meta_agent.py它的指令就是修改代码库的任何部分目标是让整体系统变得更强任务智能体Task Agent源码在 task_agent.py负责真正去解题它的得分就是进化的适应度。主循环由入口脚本 generate_loop.py 驱动每一代都在 Docker 容器里生成子代 → 跑评测 → 更新档案archive→ 选出下一代父本。所有实验开关都集中在这一个文件里这也是本文的重点。 一句话概括DGM 回答没有档案的朴素自我改进能做到什么消融实验回答HyperAgents 的每个设计件各自值多少分。DGM 基线最朴素的诊断 → 修复对照实验DGMDriven Genetic Model基线放在 baselines/dgm/ 目录包含两个核心文件文件作用baselines/dgm/coding_agent.py执行编码修改的 CodingAgentforward()是入口baselines/dgm/utils.py从失败案例中诊断问题并生成改进需求描述它的流程非常直观可以看成 HyperAgents 的对照组挑一个失败案例get_failed_entry_info()从上一代的评测结果中随机挑一个没解对的题目诊断DIAGNOSE_PROMPT让 LLM 分析运行日志产出一条GitHub issue 风格的改进需求实现CodingAgent拿着需求描述修改代码产出model_patch.diff保护评测区reset_paths_to_commit()会把domains/目录重置回基线防止智能体偷偷修改评测代码作弊。DGM 有两个版本dgm标准版只改进通用编码能力dgm_custom定制版DIAGNOSE_PROMPT_CUSTOMIZED同时参考任务智能体的实现允许做与任务更贴合的改进。在 generate_loop.py 中可以看到DGM 分支调用coding_agent.py而默认的 HyperAgents 分支调用run_meta_agent.py——两者共享同一套容器、补丁应用与评测流水线保证对比公平。消融实验设计用命令行开关拆卸系统零件HyperAgents 的消融实验不需要改代码只需要在generate_loop.py的启动参数里切换开关。核心开关一览开关可选值消融含义--run_baselineno_selfimprove/no_archive/dgm/dgm_custom/dgmno_selfimprove等关闭自我改进、关闭档案或整体换成 DGM 流程--optimize_optiononly_agent/only_ensemble/both_agent_ensemble只优化智能体、只优化集成、或两者都优化--parent_selectionrandom/latest/best/score_prop/score_child_prop父本选择策略默认按得分×子代数概率选择--edit_select_parent布尔允许智能体自己修改父本选择机制开放探索--reset_task_agent/--reset_meta_agent布尔迁移实验中重置某一方检验自我改进能否迁移几个关键消融的直观解释no_selfimprove每代都从同一份只读副本DONOTTOUCH_仓库出发智能体修改不会累积——直接验证改进真的在跨代复利no_archive只用最新一代当父本父本选择强制为latest等价于把开放探索的档案机制砍掉集成消融only_ensemble固定智能体档案不变只让集成策略进化衡量集成这一层的独立贡献。父本选择的完整实现见 select_next_parent.py其中score_child_prop策略正是既选强者、又保留探索性的折中方案。六大实验组对比曲线是怎么画出来的所有对比图由 analysis/plot_comparison.py 统一生成图中方法的颜色映射METHODS_TO_COLORS恰好暴露了论文级的实验矩阵MULTITASK主消融在paper_reviewgenesis_go2walking双任务上对比 5 条曲线——DGM、DGM-custom、DGM-HA w/o open-ended exploration、DGM-HA w/o self-improve、DGM-HA完整版蓝色。这是自我改进真实价值的主证据。TRANSFER零样本迁移在imo_grading上对比 DGM 关闭自我改进、加迁移、加定制三种组合TRANSFER_CONTINUE完整 HyperAgents 迁移后继续进化还加入从 ProofAutoGrader 出发的对照点PARENT_SELECTION随机父本 vs 可修改父本选择机制 vs 默认策略量化选择机制本身的贡献DIFFJUDGES用不同判分器评估imo_proof检验结论对评测方式的鲁棒性。画图细节值得新手学习每条曲线取历代最好智能体的分数累积最大值多次运行用 bootstrap 置信区间聚合_aggregate_runs_on_grid()并自动导出显著性检验结果到analysis/outputs/目录。日常观察单代进度可用 analysis/plot_progress.py 与 analysis/visualize_archive.py。迁移实验中选哪个节点去迁移由 analysis/transfer_utils.py 决定支持三种策略最高分max_score、后代增长潜力growth、即时增益growth_imd——这本身就是一组关于什么才叫真正有潜力的改进的方法学消融。其余基线与配套实验让对比更严谨baselines/目录里还藏着几类容易被忽略但很关键的对照SFT 基线baselines/sft_openai/ 用监督微调训练出SFT曲线黑色回答同样的数据拿去微调能不能达到自我改进的效果IMO 系列baselines/imo_proof/ 与 baselines/imo_grading/ 提供数学证明生成/自动判分的领域基线如proofautograder.pyAI 审稿人baselines/ai_reviewer/ 对应paper_review领域的代表性基线Genesis 机器人奖励函数baselines/genesis_go2walking/reward_functions/ 里reward_function_00~04对应默认奖励函数基线用于对比自进化奖励函数。BALROG 游戏类任务BabyAI、MiniHack、NetHack 等是另一大实验域NetHack 环境的像素图集直观展示了这类任务的难度与风格此外generate_loop.py 里的Polyglot 分阶段评测先跑small.json子集分数低于 0.4 阈值就跳过全量评测与 DGM 论文设置完全一致属于成本控制的工程细节而非实验差异。如何读图DGM 对比揭示了什么拿到analysis/outputs/comparison_*.png后建议按这个顺序读看起点所有方法的第 0 代分数应基本重合同一初始智能体否则说明设置不对等看w/o self-improve曲线它代表每代独立优化、不累积的上限。若完整 HyperAgents 明显甩开它说明跨代复利成立看w/o open-ended exploration与no_archive差距即档案与开放探索机制的贡献看 DGM vs DGM-HA同为诊断失败→提出改进但 HyperAgents 允许修改系统任意部分含集成与选择机制差距反映自由度的价值看置信区间bootstrap 区间重叠越多差异越可能是噪声脚本已自动生成显著性检验辅助判断。 核心结论方向DGM 曲线证明了失败诊断驱动的改进有效而消融曲线逐层证明自我改进的价值不仅来自单点修 bug更来自档案保留多样性、集成聚合历史最优、以及让智能体自己进化选择机制——这三者叠加才是自我改进的真实价值。快速上手复现基线对比的最小步骤# 1. 获取仓库 git clone https://gitcode.com/gh_mirrors/hy/HyperAgents # 2. 配置 API 密钥并安装详见 README.md 的 Setup 部分 # 将 OPENAI_API_KEY 等写入 .env 文件 # 3. 运行完整版 HyperAgents python generate_loop.py --domains paper_review genesis_go2walking # 4. 运行 DGM 基线同域同参数仅加 --run_baseline python generate_loop.py --domains paper_review genesis_go2walking --run_baseline dgm # 5. 生成对比曲线 python -m analysis.plot_comparison运行结果保存在outputs/目录每代包含metadata.json、agent_output/与各领域评测报告仓库官方实验日志可通过 README.md 中 Logs from Experiments 一节获取。常见问题Q为什么 DGM 分支要强制重置domains/目录Adomains/下是评测与领域逻辑若允许自我改进修改它智能体可能改题而非解题。coding_agent.py中的reset_paths_to_commit()是防作弊护栏。Qdgmno_selfimprove是什么组合ADGM 的诊断流程 不累积修改每代从只读副本出发用于隔离诊断驱动改进与跨代累积两个因素各自的作用。Q新手应该先读哪个文件A按 generate_loop.py主循环→ meta_agent.py自我改进入口→ baselines/dgm/utils.py对照组的诊断提示词的顺序阅读半天内即可建立完整图景。结语HyperAgents 的基线与消融实验设计堪称自我改进研究的模板用 DGM 划定朴素方法的基线水位用--run_baseline等开关逐一拆卸系统零件再用 bootstrap 置信区间和显著性检验把进步从噪声中分离出来。读懂这套实验矩阵你不仅能看懂这份代码也能学会如何为任何 AI 系统做有说服力的价值验证。【免费下载链接】HyperAgentsSelf-referential self-improving agents that can optimize for any computable task项目地址: https://gitcode.com/gh_mirrors/hy/HyperAgents创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI编程进阶:用Superpowers规则驱动,让代码生成不再“看心情” 2026/10/2 18:11:28

AI编程进阶:用Superpowers规则驱动,让代码生成不再“看心情”

1. 从“会用AI”到“会用superpowers”:先搞懂它解决什么问题这几年AI编程工具层出不穷,今天换这个明天换那个,但你会发现一个尴尬的事实:同一个模型,在不同人手里表现差距巨大。有人能用它半小时搞定一个模块&#xf…

阅读更多 →
【贪心-1】55.跳跃游戏 2026/10/2 18:11:22

【贪心-1】55.跳跃游戏

题目描述:给你一个非负整数数组 nums ,你最初位于数组的 第一个下标 。数组中的每个元素代表你在该位置可以跳跃的最大长度。判断你是否能够到达最后一个下标,如果可以,返回 true ;否则,返回 false 。示例 …

阅读更多 →
基于XGBoost和LSTM的污染物浓度预测实战方案 2026/10/2 18:11:21

基于XGBoost和LSTM的污染物浓度预测实战方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
常驻智能体产品化元年开启,安全治理成为产业新门槛|2026年10月1日 2026/10/2 18:11:20

常驻智能体产品化元年开启,安全治理成为产业新门槛|2026年10月1日

OpenAI 在 DevDay 上把常驻智能体 Dots 推向付费用户,底层由 GPT-6 Astra 驱动、跑在独立云端计算机上[① MarkTechPost];Anthropic 则用 Claude Sonnet 5.5 把 Terminal-Bench 4.0 推上 70.6%[① MarkTechPost]。模型、智能体与安全三条技术线同日交汇&…

阅读更多 →
ollama v0.35.0发布:决策模型正式上线,接口直接返回选择、概率与评分 2026/10/2 18:11:19

ollama v0.35.0发布:决策模型正式上线,接口直接返回选择、概率与评分

发布日期:2026年9月30日 版本号:v0.35.0 核心关键词:决策模型、/v1/systemone、choice、noul、score、概率、评分、模型路由、工单分流、内容分类Ollama v0.35.0 正式发布。本次更新最值得关注的内容,是新增了对决策模型的支持。 …

阅读更多 →
PyCharm实战对比:传统算法与MTCNN+ArcFace人脸识别管线 2026/10/2 18:11:17

PyCharm实战对比:传统算法与MTCNN+ArcFace人脸识别管线

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉