新闻详情

新闻详情

首页 / 资讯中心 / 详情

Codex Autoresearch 架构全景:SKILL.md、references 与三大核心脚本如何分工协作

发布时间:2026/10/1 9:39:36来源:尧图网络
Codex Autoresearch 架构全景:SKILL.md、references 与三大核心脚本如何分工协作
Codex Autoresearch 架构全景SKILL.md、references 与三大核心脚本如何分工协作【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearchCodex Autoresearch 是一个让 Codex 自主迭代的技能包修改代码、验证数值指标、保留改进或回滚失败循环往复直到达标。本文带你从架构视角看懂它的三大组成——SKILL.md、references/协议文档与三大核心脚本——是如何分工协作的。30 秒理解 Codex Autoresearch一个带 Git 边界的实验循环核心思想只有一句话inspect - change one thing - verify - keep or revert - repeatCodex 负责工程判断——提出假设、改代码随附的控制脚本负责严格边界——测量、回滚、状态与日志。一次实验循环The Loop长这样inspect evidence | change one focused thing | commit and measure -- improved guard passes -- keep -- otherwise --------------- revert | append an audit event | repeat until target适合它任务都有一个共同点存在一个可重复测量的数值指标——失败测试数、覆盖率、警告数、延迟、二进制体积等。架构全景一个入口、三层分工整个技能可以理解为三层职责边界非常清晰层位置角色入口层SKILL.md技能前台何时加载什么文档、执行流程、不变量协议层references/3 份协议文档按需读取执行层scripts/3 个 Python 脚本构成控制平面这种设计的妙处Codex 每次被唤起时只需要读 SKILL.md再按指引按需加载协议文档既省上下文又保证规则完整。SKILL.md技能的前台与命令地图打开 SKILL.md你会看到三段关键内容Load加载规则每次调用必读 references/workflow.md开始活动实验前读 references/experiment.md后台运行才读 references/background.md。Start启动流程前台用init初始化并挂接官方 Codex Goal后台用launch启动分离控制器。且首次写入前必须获得用户明确确认。Invariants10 条不变量比如初始化要求干净的命名 Git 分支、一次finish只做一个聚焦实验、绝不隐藏失败、绝不用兜底解析伪造成功。可以把它理解为指挥手册它不写业务逻辑而是规定 Codex 什么时候做什么、绝对不能做什么。references/ 目录按需加载的实验协议库references/下的 3 个文档各司其职是典型的渐进式披露设计文档读取时机内容references/workflow.md每次调用全新/已有运行的完整流程、确认格式、前后台控制命令references/experiment.md开始或继续活动实验前单次迭代契约唯一事实来源、测量要求、Git 边界、失败语义references/background.md仅后台运行分离控制器架构、worker 契约、权限策略与生命周期其中 references/experiment.md 定义了最关键的两个概念autoresearch-results/run.json—— 不可变的运行配置autoresearch-results/events.jsonl—— 只追加的状态历史。当前状态永远是逐条验证全部事件推导出来的没有缓存、没有对话记忆。这就是为什么status命令如此权威。三大核心脚本执行层的控制平面scripts/ 目录下的 3 个 Python 脚本是真正的发动机分工如下autoresearch.py命令入口与后台控制器scripts/autoresearch.py约 1584 行是唯一的 CLI 控制平面提供全套子命令生命周期init前台初始化、launch后台启动、stop、resume、archive实验收尾finish提交、测量、保留或回滚一次实验的唯一路径、block只读视图status、history、report后台模式下它还包含一个内部入口_controller控制器一次只启动一个codex execworker每个 worker 恰好完成一次实验后退出控制器验证事件日志后决定是否启动下一个 worker——不轮询、不装 hook、不碰 Codex 配置。autoresearch_core.py状态机与 Git 边界scripts/autoresearch_core.py约 1213 行是被上层复用的规则引擎核心能力包括严格校验validate_run/validate_event逐条验证 schema拒绝未知字段、重复键、非 UTF-8 输出状态推导derive_state从事件序列推导出当前 status、指标与迭代数Git 操作commit_trial创建试验提交revert_trial用git revert回滚保留可审计痕迹而非破坏性 reset命令执行run_command带超时并落盘完整输出到autoresearch-results/logs/指标解析parse_metric_output支持末行标量与JSON 键两种显式解析方式。autoresearch_report.py只读渲染视图scripts/autoresearch_report.py约 524 行不碰任何状态只做三件事终端表格history、TSV 导出、以及自包含的静态 HTML 报告report。渲染前同样会验证完整的run.json与events.jsonl。它们如何协作一次完整迭代的数据流把三层串起来一次finish的协作过程是这样的Codex 依 SKILL.md 指引读取 references/experiment.md确认迭代契约Codex 只修改确认范围内的文件不手动提交然后调用finishscripts/autoresearch.py 的finish_iteration校验分支、HEAD、scope 后调用 core 层commit_trial创建试验提交运行 verify 与 guard 命令core 层解析指标并快照对比控制文件是否被篡改指标改进且 guard 通过 → 保留提交否则revert_trial回滚追加一条iteration事件到events.jsonl目标达成则追加complete。Codex 改代码脚本管提交、测量与回滚——双方谁也不越界这是整个架构的安全基石。最终交付一份可追溯的 HTML 实验报告运行结束后report命令会基于验证通过的事件历史生成静态报告存放在autoresearch-results/report.html。报告包含指标轨迹图、逐次实验的 keep/discard 明细、提交哈希与完整日志链接红色 discard 点被自动回滚绿色 keep 点被保留进 Git 历史——每一轮实验的去留都有据可查。总结一套值得借鉴的人机分工架构Codex Autoresearch 的架构本质是把聪明和严谨拆开SKILL.md管何时做什么——入口与指挥references/管规则是什么——按需加载的协议库scripts/ 三大脚本](scripts/autoresearch.py)管如何不可错——CLI 入口、状态机、Git 边界、报告渲染。想深入细节推荐阅读这三份文档references/workflow.md完整工作流、references/experiment.md实验契约、references/background.md后台运行时。【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

深度学习电力负荷预测实战:LSTM/GRU时序模型完整解析 2026/10/1 13:22:44

深度学习电力负荷预测实战:LSTM/GRU时序模型完整解析

简介:面向课程设计与期末大作业的深度学习区域电力负荷预测项目,基于Python构建,适合机器学习初学者及需要完整项目范例的学生参考。项目覆盖数据预处理、模型构建、训练评估与结果可视化,源码结构化划分为数据加载、训练器、模型…

阅读更多 →
MFC扫雷实战:从对话框工程到GDI双缓冲与递归展开 2026/10/1 13:22:44

MFC扫雷实战:从对话框工程到GDI双缓冲与递归展开

简介:这份资源是基于MFC框架实现的扫雷游戏完整工程,面向具备一定C基础、希望借助经典案例入门Windows GUI开发或课程设计的学习者。项目将扫雷核心逻辑与MFC的窗口管理、消息映射、CDC图形绘制、资源管理及状态维护等机制结合,帮助读者理解如…

阅读更多 →
Python爬虫+数据分析+LSTM预测与机器学习可视化完整实践 2026/10/1 13:22:44

Python爬虫+数据分析+LSTM预测与机器学习可视化完整实践

简介:面向Python爬虫与数据分析学习者的完整实践项目,集成信息爬取、LSTM时序预测与机器学习分析,适合课程设计、毕业设计、项目立项演示或作为实战入门参考。压缩包共472个文件,源码以Python脚本和Jupyter Notebook为主&#xff…

阅读更多 →
用 TypeScript 类型系统实现动态参数柯里化:type-challenges 00462 Currying 2 深度解析 2026/10/1 13:22:44

用 TypeScript 类型系统实现动态参数柯里化:type-challenges 00462 Currying 2 深度解析

示例工程 【免费下载链接】type-challenges Collection of TypeScript type challenges with online judge 项目地址: https://gitcode.com/GitHub_Trending/ty/type-challenges 点击查看 免费下载 type-challenges 的第 00462 题(Currying 2&#xff0…

阅读更多 →
AnythingLLM 实战:从本地知识库到 Agent 工作区的完整搭建指南 2026/10/1 13:22:37

AnythingLLM 实战:从本地知识库到 Agent 工作区的完整搭建指南

1. 为什么我要把 AnythingLLM 当作主力工作台 第一次接触 AnythingLLM 是在一个需要把几十份内部文档变成可问答知识库的项目里。当时试过几种方案:纯提示词拼接、自己写检索脚本、用现成的云端知识库服务。纯提示词拼接上下文一长就崩,自己写检索脚本维…

阅读更多 →
Apple Pay 接入实战:从证书配置到支付令牌解密全链路 2026/10/1 13:22:37

Apple Pay 接入实战:从证书配置到支付令牌解密全链路

简介:本资源面向在SpringBoot后端集成iOS端Apple Pay的开发者,聚焦支付回调验证这一关键环节,帮助解决支付令牌解码、签名校验与交易状态确认等实际问题。压缩包共98个文件,约93KB,以70个xml配置、10个class字节码、8个…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉