新闻详情

新闻详情

首页 / 资讯中心 / 详情

如何理解 Codex Autoresearch 核心循环?修改-验证-保留/回滚的无限迭代原理详解

发布时间:2026/10/2 9:13:20来源:尧图网络
如何理解 Codex Autoresearch 核心循环?修改-验证-保留/回滚的无限迭代原理详解
如何理解 Codex Autoresearch 核心循环修改-验证-保留/回滚的无限迭代原理详解【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch想让 AI 编程助手像真正的研究员一样工作——反复尝试、用数据说话、失败就回滚Codex Autoresearch 核心循环正是为此而生它让 Codex 在 Git 仓库中持续执行「修改 → 验证 → 保留或回滚」的无限迭代直到达成你设定的数值目标。本文将用通俗的语言完整拆解这套自主实验系统的迭代原理、Git 回滚机制与验证设计帮你快速看懂 Codex Autoresearch 的核心循环是如何运转的。什么是 Codex Autoresearch 核心循环30 秒看懂Codex Autoresearch 是一个面向 Codex 的自主实验技能受 Karpathy 的 autoresearch 概念启发。它的用法非常直白你告诉它一个可测量的结果比如把报错数降到 0它就开始自动循环观察仓库 → 修改一个点 → 验证 → 保留改进或回滚失败 → 重复直到目标达成。整个系统由两个角色分工协作这是理解核心循环的关键前提角色负责什么CodexAI工程判断分析代码、提出假设、编写修改控制脚本严格执行 Git 边界、测量指标、回滚、记录状态与日志也就是说AI 只负责聪明地改代码而提交、测量、保留/回滚、状态记录这些容易出错的环节全部交给一个确定性的脚本来完成。这种AI 出想法、脚本管纪律的架构正是核心循环能长期可信运行的基础。完整的循环定义写在 SKILL.md 中inspect - change one thing - verify - keep or revert - repeat。核心循环五步走修改-验证-保留/回滚如何运转核心循环的每一轮迭代都可以拆解为五个步骤。下面用一个降低报错数的例子说明 观察证据InspectCodex 读取已验证的运行状态和最近的实验记录检查代码、日志等证据明确上一次尝试为什么失败。✏️ 只改一处Change One Thing在预先确认的范围内比如src/只做一个聚焦的、完整的假设性修改。比如修复嵌套解析分支。 提交并测量Commit Measure控制脚本自动创建一个试验提交trial commit然后运行你指定的验证命令得到一个数值如报错数从 2 变成 3。✅/⏪ 保留或回滚Keep or Revert指标变好且守卫检查通过 →保留这次提交在下一次迭代中继续指标没变好或守卫失败 → 用git revert回滚这次试验换一个假设再来。 记录并重复Log Repeat每轮结果都被追加写入事件日志然后立即开始下一轮直到指标达到目标值。README 中对循环的原始描述非常精炼观察证据 | 修改一个聚焦的点 | 提交并测量 | -- 改进 守卫通过 -- 保留 | -- 否则 ------------- 回滚 | 追加一条审计事件 | 重复直到达成目标为什么每轮只改一处是核心循环的灵魂这是核心循环最反直觉、也最关键的设计一次finish只允许一个完整实验。它遵循的是科学实验的单一变量原则如果一轮里改了 5 个地方指标下降了——你不知道是哪一处起的作用如果一轮里改了很多指标变差了——你无法回滚那一个有用的改动。只改一处每个实验都独立可测量、可逆成功 → 这次提交就是净收益进入下一轮失败 →git revert完整撤销仓库回到干净基线AI 换一条路。项目明确要求回滚使用git revert而不是破坏性的 reset详见 references/experiment.md这样 Git 历史中永远保留着每一次尝试的足迹——包括失败的。这既是审计轨迹也是 AI 下一轮观察的证据来源。验证Verify与守卫Guard两道关卡如何分工核心循环的验证阶段其实有两个角色理解它们的分工是理解整个机制的钥匙验证 Verify守卫 Guard回答的问题目标指标改进了吗试验是否守住了必要行为输出形式一个数值越低/越高越好通过 / 不通过退出码例子python3 scripts/score.py输出报错数python3 -m pytest -q全部测试通过是否必需必需核心循环只认这一个指标可选特殊要求—必须在基线时就通过判断规则很简单指标改进了但守卫失败 → 照样回滚。⏪典型例子你在优化接口延迟指标是 p95 毫秒数如果某次修改让延迟降低了却导致功能测试挂了这次试验会被丢弃——因为更快不能用更坏来换。守卫保护的是指标管不到的行为两者配合才能让核心循环只进不退。指标输出也有明确契约验证命令必须正常退出哪怕测出来的数值很差并把一个有限数值放在最后一行输出也可以用 JSON 加一个显式指定的数值键。更多指标模式可以查看 docs/GUIDE.md 的 Verify And Guard 章节与 docs/EXAMPLES.md 中的实用示例。保留还是回滚Git 就是核心循环的实验记忆很多人会问AI 自动跑几十轮中间乱改了一堆东西怎么办Codex Autoresearch 的答案是Git 就是整个系统的记忆和回滚边界。每一次试验都是一个 Git 提交——没有悄悄改文件这回事非改进或守卫失败的试验立即git revert仓库回到上一个被保留的提交越界修改、分支漂移、指标格式错误、命令超时等任何异常都会立即停止运行并给出精确的报错和日志路径绝不猜着继续。所有的运行状态都保存在一个独立、不入库的autoresearch-results/目录中文件作用run.json已确认的、不可变的运行配置events.jsonl只追加的事件历史基线、每轮保留/回滚、终止是状态的唯一事实来源logs/指标命令、守卫命令、后台 worker 的完整输出特别值得新手注意的是events.jsonl的只追加设计系统只信任这份经过校验的事件日志绝不从对话记忆或旧文件里推测当前状态。这种严格的失败语义宁停勿猜看起来苛刻但它正是长时间自主运行能够被信任的前提。前台 vs 后台核心循环的两种运行方式同一个核心循环Codex Autoresearch 提供两种运行模式规则完全一致只是谁来推进循环不同前台 Foreground后台 Background运行位置当前 Codex 任务中独立的分离控制器推进机制Codex 官方 Goal 持续续跑每轮启动一个独立的codex execworker适合场景实时观察、随时指导长时间任务、跑一夜控制方式Goal 的暂停 / 恢复用$codex-autoresearch询问状态、停止、恢复前台适合想盯着 AI 干活、中途插话调整策略的场景后台适合睡前启动早上看结果的场景控制器按序拉起 worker每个 worker 恰好完成一个实验后退出架构细节见 references/background.md。两种模式共用同一套实验规则与 Git 边界选哪种不影响核心循环本身的行为。看懂核心循环结果HTML 实验报告详解循环跑完后你可以直接对技能说生成 HTML 报告它会基于校验后的事件日志生成一份可视化快照写入autoresearch-results/report.html。以这份报告为例核心循环的完整旅程一目了然基线 2初始测量报错数为 2第 1 轮红色 discard尝试扩大解析器兜底指标升到 3 → 被回滚保留值仍是 2第 2 轮绿色 keep修复嵌套解析分支指标降到 1 → 提交被保留第 3 轮绿色 keep消除最后一处解析错误指标归 0 → 达成目标状态变为complete。注意那条蓝色保留指标曲线它只记录被保留的试验所以只降不升——这正是核心循环只进不退特性的直观体现。红色空心点则代表被丢弃的试验失败也清清楚楚。除了 HTML 报告还可以说查看实验历史获得表格视图或导出为 TSV用于分析。新手三步上手启动你的第一个 Codex Autoresearch 循环理解了原理实际使用只有三步安装步骤见 docs/INSTALL.md第 1 步准备好一个干净的 Git 仓库核心循环依赖 Git 做提交与回滚所以要求一个干净的具名分支、工作区无未提交改动。第 2 步给 Codex 一个可测量的目标在 Codex 中调用技能直接描述你想要的结果例如把scripts/score.py输出的 error_count 降到 0同时保持 pytest 通过。第 3 步确认七项配置后说 Go首次写入之前Codex 会向你确认这些值完整定义见 references/workflow.md配置项含义示例目标 Goal期望的仓库结果消除解析错误范围 Scope允许修改的路径前缀src指标 Metric数值结果报错数方向 Direction越低越好还是越高越好lower验证 Verify输出指标的命令行python3 scripts/score.py目标值 Target达到即完成的数值0守卫 Guard可选的回归检查python3 -m pytest -q确认后选择前台或后台核心循环就开始自动运转——每轮试验提交、失败回滚直到指标达标。中途想停前台可随时暂停后台用技能入口请求 stop 即可。核心循环适合哪些任务边界在哪里✅ 非常适合任何有可重复数值结果的任务——测试失败数、类型错误数、Lint 告警数 → 降到 0代码覆盖率、评分函数 → 提升到某阈值基准延迟p95、二进制体积 → 压到目标以下可复现的安全问题数量 → 清零❌ 不太适合一次性的小改动、主观的设计评审、部署发布以及成功与否无法被命令反复度量的任务。对这类任务更好的做法是先帮它定义一个可复现的指标再启动核心循环。另外记住三条边界一次运行只管理一个仓库、一个主指标、一个目标值验证命令必须确定性足够高跑两次能得到可比较的结果基准测试如果噪声大先稳定测试方法再启动否则噪声会决定哪些实验被保留或丢弃。一文总结Codex Autoresearch 核心循环的 5 个关键点#关键点一句话记忆1循环结构修改 → 验证 → 保留/回滚 → 无限重复直到达标2单一假设每轮只改一处成功即净收益失败可完整撤销3Git 是记忆每次试验都是提交失败用git revert全程可审计4双关卡验证指标管有没有变好守卫管有没有变坏5宁停勿猜任何异常立即停止并给出日志路径绝不猜测状态Codex Autoresearch 的核心循环本质上就是把科学实验的方法论移植到了 AI 编程流程里提出假设、控制变量、用数据裁决、保留可复现的改进。理解了这个修改-验证-保留/回滚的无限迭代机制你就能把报错清零、覆盖率提升、性能优化这类棘手的仓库级任务放心地交给 AI 自主完成了。【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

selenium_driver_updater:自动化同步ChromeDriver与浏览器版本 2026/10/2 10:02:15

selenium_driver_updater:自动化同步ChromeDriver与浏览器版本

简介:这是一份面向Python自动化测试工程师与Web开发者的Selenium驱动管理工具包,专为解决ChromeDriver、GeckoDriver等浏览器驱动版本不匹配、手动更新繁琐、CI/CD环境部署不稳定等痛点而设计。selenium_driver_updater-3.9.0作为轻量级Python库&#xf…

阅读更多 →
LabVIEW下载不是点链接:NI官方分发体系与版本兼容性指南 2026/10/2 10:02:08

LabVIEW下载不是点链接:NI官方分发体系与版本兼容性指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
OpenCode使用指南:开源终端AI编程助手的安装与实操 2026/10/2 10:02:08

OpenCode使用指南:开源终端AI编程助手的安装与实操

OpenCode 这个名字最近在 AI 编程工具圈里出现的频率越来越高,我身边不少朋友从 Cursor、Claude Code 一路切换到它,实测一段时间后给我的反馈几乎一致:这东西在终端里用起来是真的顺手。如果你还没接触过它,可以把它理解为一个开…

阅读更多 →
Win11下Claude Code Desktop接入第三方API:环境变量配置与401报错排查 2026/10/2 10:02:08

Win11下Claude Code Desktop接入第三方API:环境变量配置与401报错排查

如果你最近在 Win11 上折腾过 Claude Code Desktop,大概率和我一样,被同一串报错拦在门口:unexpected status 401 unauthorized: incorrect api key provided。我第一次看到这串英文时,第一反应是密钥复制错了,于是反复…

阅读更多 →
掌握.NET Framework Release值:从版本检测到部署避坑指南 2026/10/2 10:02:01

掌握.NET Framework Release值:从版本检测到部署避坑指南

1. 为什么一定要搞清楚Release值与.NET Framework版本的对应关系1.1 一个让我折腾到凌晨的安装检测问题先讲一个真实的踩坑经历。之前我给一个内部工具写安装引导程序,需要在安装前检测当前系统是否已经安装了 .NET Framework 4.7.2 及以上版本,如果没有…

阅读更多 →
用Laya微调7B模型:构建毫秒级System 1决策网关的实践 2026/10/2 10:01:55

用Laya微调7B模型:构建毫秒级System 1决策网关的实践

从去年年底开始,我一直在折腾一个实时决策网关,核心场景是:请求进来之后,系统需要在几十毫秒内完成意图判断、风险拦截、会话路由这类“低延迟但必须准确”的决策。最初我用的方案是串一个通用大模型API上去,效果虽好&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉