新闻详情

新闻详情

首页 / 资讯中心 / 详情

不再自己生成自己通过:AutoResearch Idea Forge多模型交叉评审机制深度拆解

发布时间:2026/9/28 19:09:08来源:尧图网络
不再自己生成自己通过:AutoResearch Idea Forge多模型交叉评审机制深度拆解
不再自己生成自己通过AutoResearch Idea Forge多模型交叉评审机制深度拆解【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearchAutoResearch 是一个把 AI/ML 研究从想法推进到可写论文证据的开源智能体工作流。它的Idea Forge模块解决了研究智能体最大的隐患——多模型交叉评审至少 3 个不同模型的席位独立构思、互相当审稿人投票表决从机制上杜绝模型自己生成、自己通过。本文将完整拆解这套交叉评审的设计、投票规则与防误判细节。为什么单模型自审不可信 让同一个 LLM 先出主意再自己说不错就像让厨师自己给自己的菜评米其林——幻觉会被反复自我确认。AutoResearch 在 README.md 中把独立多模型评审列为核心能力评审阶段至少需要三个不同的底层模型同一模型换别名、换 endpoint 只算一票。这条硬性下限写在角色策略层 src/roles.pyMIN_INDEPENDENT_MODELS {ideator: 3}ideator构思席位是唯一的面板角色必须同时消费多个独立模型启动时若席位不足require_idea_panel()直接报错拒绝运行而不是悄悄降级成自审Idea Forge 三步流水线从研究信号到实验计划 Idea Forge 位于 src/idea_forge/forge.py把外部研究信号与本地知识库方向做交叉共三步Step 1每个席位独立深度构思每个席位模型拿到同一个 prompt 独立构思研究信号的核心机制 领域方向的知识文档 硬件约束。如果映射不合理模型只需输出NO_MATCH该席位本轮弃权。Step 2全员交叉评审多数票制这是整条流水线的心脏——包括生成者自己所有席位都要评审每一个候选 idea避免单一模型主导否决。规则是只看 D1机制深度/ D2方法简洁/ D3实验充分三个硬维度通过门槛 席位数的一半加一3 席时至少 2 票通过必须至少收到 3 个可解析的独立评审票数不足直接判负不降级放行D4 时新性只做软警告旧模型/数据可以在 Step 2.5 由 arXiv 搜索就地刷新不在此处击杀好方案Step 3只有幸存者才配拥有计划书通过交叉验证的 idea 还会经过时新性刷新和社区共识检查见下文最后才由 planner 角色写出第 1 周预实验 第 2-4 周完整实验的可执行计划书。被否决的 idea 连同每一票的原始评审文本一起落盘到data/idea_forge/事后可复核那几票是怎么投的。防一票误判判定解析器的较真之处 评审模型只输出一行自然语言verdict: 通过/不通过怎么保证不读错src/verdicts.py 用了几条相当较真的规则否定式优先不通过包含通过、不值得包含值得必须先消掉否定式再匹配否则一次不通过会被误读成两票只认最终判定行评审会对每个维度各写一行判定不通过若把最后一行当结论截断的响应会让 D1 一票定生死解析器从后往前找自称最终判定的行读不出就是读不出返回UNPARSED该票不计入分子也不计入分母——凭空造通过票或反对票都是造假每一票还单独存下解析器实际据以判定的那一行verdict_line供事后审计最后一道防线社区共识检查 ️交叉验证通过后还有 src/idea_forge/consensus_check.py 的撞共识检查让模型拿 idea 逐条对照知识库里的常见错误直觉和可行创新切入点清单——即使 idea 看起来新颖撞了业内公认的错误直觉也要果断否决。一个细节值得注意知识库缺失时检查结果是UNAVAILABLE未检查它不是否决idea 仍会前进但会被明确标记status: unchecked。查不了和查过了没问题是两回事不能混为一谈。知识库文档放在 knowledge_base/格式模板见 knowledge_base/TEMPLATE.md——你补上自己领域的常见误区清单共识检查才能真正生效。如何配置你的三个评审席位 ⚙️复制 config.example.json 为本机配置在idea_forge.idea_models中填 3 个不同模型如 gemini-pro / gpt-5.5 / claude-opus也可以用环境变量AR_MODEL_IDEATOR模型A,模型B,模型C整体替换席位名单运行scripts/preflight.py --live验证席位独立性——检查器与运行时读的是同一份配置不会出现报告说用 A、实际跑 B的分叉完整运行入口是 idea_generation.py架构总览见 ARCHITECTURE.md。小结 ✨AutoResearch 的 Idea Forge 用三条铁律换来了可信的 idea 产出独立席位多数票没有 3 个不同模型就不许跑、解析失败不计票宁可弃权不造票、共识检查独立于评审新颖不等于正确。对任何想在多智能体流水线里引入自我审批的开发者这套防自嗨机制都值得借鉴。【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI辅助前端开发-5:Bug调试篇——用TaoToken统一Key打通Cline排错链路 2026/9/28 19:58:41

AI辅助前端开发-5:Bug调试篇——用TaoToken统一Key打通Cline排错链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【教程】OpenClaw Windows 部署教程:WSL2 环境配置与 TaoToken 接入 2026/9/28 19:58:41

【教程】OpenClaw Windows 部署教程:WSL2 环境配置与 TaoToken 接入

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【程序员必藏】大模型Token实战指南:从基础理论到优化技巧,一文搞定 TaoToken 配置与验证 2026/9/28 19:58:41

【程序员必藏】大模型Token实战指南:从基础理论到优化技巧,一文搞定 TaoToken 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
UWB替代GPS:PX4室内无人机定位实战全记录 2026/9/28 19:58:41

UWB替代GPS:PX4室内无人机定位实战全记录

最近一直在折腾室内无人机定位,GPS在天上挺靠谱,可一旦进了厂房、停车场、桥底,信号直接被按在地上摩擦。最后索性把目光转向了UWB,折腾了一圈下来,结论是:在几十米范围的半封闭环境里,UWB完全可…

阅读更多 →
UWB超宽带定位接入PX4:从GPS失效到室内自主飞行的完整指南 2026/9/28 19:58:41

UWB超宽带定位接入PX4:从GPS失效到室内自主飞行的完整指南

在室外跑惯GPS航点的固定翼和穿越机,一到室内停车场、隧道、厂区这类环境,我第一反应就是先检查信号数。GPS在遮挡严重的环境里要么搜不到星,要么位置一跳就是十几米,飞控的EKF滤波器直接被脏数据带偏,姿态都跟着晃。后…

阅读更多 →
strands-agents Python SDK v0.1.7 技术解读:ContentBlock 缓存点、会话管理接口与模型层健壮性升级 2026/9/28 19:58:35

strands-agents Python SDK v0.1.7 技术解读:ContentBlock 缓存点、会话管理接口与模型层健壮性升级

人工智能大模型AI AgentAgent 框架多智能体工具调用MCP 服务 【免费下载链接】harness-sdk Build an agent harness and control it end-to-end. Open-source SDK for production AI agents in Python & TypeScript - any model, any cloud. 项目地址: https://…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉