新闻详情

新闻详情

首页 / 资讯中心 / 详情

AutoResearch双MCP Server实战:让外部模型进入代码审查与结论评审闭环

发布时间:2026/9/28 21:17:56来源:尧图网络
AutoResearch双MCP Server实战:让外部模型进入代码审查与结论评审闭环
AutoResearch双MCP Server实战让外部模型进入代码审查与结论评审闭环【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearchAutoResearch 是一个开源 AI 研究智能体项目能把研究想法自动推进到论文级证据。本文实战讲解它的两个内置 MCP Server——ar-gemini-review代码审查与ar-external-critic结论评审如何配置、如何自检以及它们怎样构成一个外部模型参与决策的完整闭环。一、双 MCP Server 解决什么问题AutoResearch 的执行层 ar-runtime/ 由官方claudeCLI 驱动一个确定性工作流队列见 ar-runtime/ar-coordinator-startup-flow.md从plan_gate到code_gate、code_review、实验运行最后close_if_done收尾。问题在于干活和把关不能是同一个模型。如果 Claude Code 自己写代码、自己判断可以结束了研究结论就缺乏外部校验。AutoResearch 的答案是两个 stdio 型 MCP Server基于 Bun MCP SDK 实现让外部模型以评审员身份安全地介入MCP Server职责核心工具落盘产物ar-gemini-review代码审查code_review 单元gemini_reviewreview.mdar-external-critic结论评审 / 盲审external_critic、blind_reviewcritic.md 评审回执一句话总结设计哲学模型负责判断引擎负责留痕。所有评审报告都必须经过契约校验并写入工作流引擎换掉模型可以报告必须可追溯。二、代码审查 Serverar-gemini-review实现见 ar-runtime/scripts/ar-gemini-review-mcp.ts。它注册了唯一工具gemini_review兼容旧名实际路由到code_reviewer角色输入是代码包 上下文计划、成功标准、硬约束输出是一份严格结构化的 markdown 报告Blockers运行前必须修复崩溃、静默错误结果、数据泄露、无效结论或任何被违反/未验证的硬约束Warnings应当修复不影响实验范围与有效性的改进项Constraint Audit上下文中的每条硬约束必须恰好出现一次标注satisfied / violated / not_verified及证据文件:行号被违反或未验证的约束必须同时报为 BlockerNotes / Overall低风险观察与总体评价报告通过 MCP 返回后并不是口头结论。当调用方指定了unit、cycle、project_root、output四个参数时ar-runtime/scripts/ar-review-contract.ts 会校验输出路径必须是project_root/review.md注入溯源信息model、model_identity、unit、cycle并重新规范化blockers_count程序化校验 Constraint Audit 条目无重复、证据齐全、blocker 编号一致调用 ar-runtime/scripts/ar-workflow-engine.py 的record-review-report命令把报告绑定到队列单元引擎拒绝则整个工具调用失败。也就是说Blocker 数量、约束审计结果都会被机器校验模型说没问题是没问题还是真的没问题由契约层说了算。三、结论评审 Serverar-external-critic实现见 ar-runtime/scripts/ar-external-critic-mcp.ts它提供两个工具1.external_critic—— 挑战是否该结束工作流到达收尾阶段时协调者把产物包bundle提交给外部评审。关键机制是双评审独立身份主评审critic与次评审critic_secondary必须来自不同的模型身份次评审调用时还会显式排除主评审的身份防止同一模型自己审自己两者都必须成功且返回可解析的 verdict否则整个工具抛错不允许半吊子放行共识裁决有明确优先级任一评审给出needs_revision代码/分析/报告缺陷→ 优先于needs_more_research证据不足→ 最后才是finish_ok再审一轮也不太可能改变结论。报告持久化到critic.md后还会写入评审回执receipt每位评审的角色、模型、身份、verdict 以及响应原文的 SHA256 哈希见 ar-runtime/scripts/ar-critic-contract.ts。事后可以逐字节验证结论评审确实发生过、是谁做的。2.blind_review—— 模拟同行评审把研究提交做成无记忆审稿场景Reviewer A 扮演方法论怀疑者Reviewer B 扮演实证严谨性怀疑者按目标会议默认 ICLR校准输出 1–10 分评分、soundness/contribution/presentation 分项、accept/borderline/reject 决定并强制忽略自评分与内部评审历史、中位数投稿应被拒稿。这是给论文质量加的一层外部标尺。四、配置步骤3 步跑通双 MCP Server第 1 步注册 Server。配置集中在 ar-runtime/.mcp.json两个 server 都用 Bun 启动对应脚本ar-gemini-review: { command: bun, args: [run, ./scripts/ar-gemini-review-mcp.ts] } ar-external-critic: { command: bun, args: [run, ./scripts/ar-external-critic-mcp.ts] }第 2 步配置角色与模型。MCP Server 本身不含密钥它通过 Python 桥 scripts/call_role.py由 ar-runtime/scripts/ar-role-client.ts 拉起按角色名取模型code_reviewer、critic、critic_secondary。参考 config/providers.example.json 在本地config/providers.local.json中为三个角色选择模型——三个角色至少需要两个互不相同的模型身份否则独立身份检查会失败。凭据与投影机制详见 ar-runtime/README.md。第 3 步自检。在ar-runtime/目录运行统一入口./scripts/ar-preflight-mcp.shar-runtime/scripts/ar-preflight-mcp.sh 会一次性验证Bun 可用、render_env本机投影新鲜、两个 server 的--self-test各自真实调用一次角色并检查独立身份对。全部通过才输出MCP preflight: 两个 server 都可用。五、闭环实战评审结果如何驱动工作流配置完成后两个 Server 嵌入队列的关键节点code_gate/code_reviewcoder 写完代码后ar-gemini-reviewer整理上下文并调用gemini_review报告落review.mdBlocker 未清零就回到修复循环close_if_done协调者准备收尾时调用external_criticneeds_revision会把工作打回只有独立双评审共识finish_ok才允许输出完成标记promiseAUTORESEARCH_DONE/promise投稿前用blind_review给准论文做一次外部盲审校准。整个过程的进度可以在项目监控面板中直接看到Code review 单元显示 blockers/warnings 计数External review 单元显示 primary/secondary 两位独立评审的模型身份与健康状态上文的监控面板截图即来自项目自带面板生成逻辑见 src/generate_project_dashboard.py。真实的判断进度不要只信队列状态而应读project_root/state.md的## agents段与review.md、critic.md实际产物研究结论沉淀则进入项目知识库面板生成逻辑见 src/generate_kb_dashboard.py六、关键文件速查内容路径MCP Server 注册ar-runtime/.mcp.json代码审查 Serverar-runtime/scripts/ar-gemini-review-mcp.ts结论评审 Serverar-runtime/scripts/ar-external-critic-mcp.ts评审契约报告校验/落盘ar-runtime/scripts/ar-review-contract.ts回执与独立身份契约ar-runtime/scripts/ar-critic-contract.ts角色调用桥scripts/call_role.py统一自检入口ar-runtime/scripts/ar-preflight-mcp.sh工作流队列说明ar-runtime/ar-coordinator-startup-flow.md示例想法文件examples/ideas/synthetic_gpu_smoke.md总结AutoResearch 的双 MCP Server 把外部模型参与研究决策变成了一条可验证的流水线——代码审查有结构化契约与约束审计结论评审有独立身份共识与 SHA256 回执配置与自检各有统一入口。新手按注册 → 配角色 → 跑自检三步即可把这套闭环跑起来让每个实验结论都有外部模型的独立背书。【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

中文微博情感分析实战:LSTM三分类模型与工业级预处理链路 2026/9/28 22:08:36

中文微博情感分析实战:LSTM三分类模型与工业级预处理链路

简介:本资源是一份面向高校人工智能课程设计与深度学习实践者的Python三分类文本情感分析完整项目,基于LSTM模型实现正面、中性、负面情感判别,适用于课程大作业、毕设基础模块或NLP入门实战。压缩包共15个文件,包含3个CSV标注数据…

阅读更多 →
从Agent Framework到Agent Harness:智能体稳定落地的关键跃迁 2026/9/28 22:08:29

从Agent Framework到Agent Harness:智能体稳定落地的关键跃迁

“模型已经够聪明了,框架也遍地都是,可我们的 Agent 项目还是推不进生产。”这是我过去半年被客户问到最多的一句话。从 2023 年到 2025 年,Agent Framework 层出不穷,LangChain、AutoGen、MetaGPT、CrewAI 轮番刷屏,每…

阅读更多 →
Substrate是区块链操作系统内核,不是开发框架 2026/9/28 22:08:08

Substrate是区块链操作系统内核,不是开发框架

1. 项目概述:Substrate不是“框架”,而是区块链的“操作系统内核”你搜“substrate”,十有八九会看到一堆“Substrate是Polkadot的底层框架”“Substrate是Rust写的区块链开发框架”这类说法。但从业十年、亲手用Substrate搭过7条链、参与过3…

阅读更多 →
从“能聊代码”到“能干活”:AI编码助手XiheAgent的调度执行与告警实战 2026/9/28 22:08:02

从“能聊代码”到“能干活”:AI编码助手XiheAgent的调度执行与告警实战

去年下半年开始,我一直在琢磨一个问题:市面上的AI编码助手大部分都在解决“代码问答”,你问它一段代码是什么意思、哪里可能出bug、要怎么改,它能给你讲得明明白白。可一问到“帮我把这个任务跑起来”“数据同步失败了帮我查一下怎…

阅读更多 →
UDS多帧传输避坑指南:STmin与BS参数详解及调试技巧 2026/9/28 22:08:02

UDS多帧传输避坑指南:STmin与BS参数详解及调试技巧

1. 为什么多帧传输是UDS诊断里最容易翻车的一环搞过UDS诊断的人都有一个共识:单帧收发的诊断服务(比如会话控制、读取故障码)基本不会出问题,真正让人抓耳挠腮的,永远是那些数据长度超过7个字节、必须走多帧传输的场景…

阅读更多 →
从认知匹配到行为形成:WSaiOS 中能力、知识与行为的匹配理论 2026/9/28 22:08:02

从认知匹配到行为形成:WSaiOS 中能力、知识与行为的匹配理论

从认知匹配到行为形成:WSaiOS 中能力、知识与行为的匹配理论摘要:本文系统阐述 WSaiOS 认知匹配理论中“能力—知识—行为”匹配框架。该框架回应了一个核心问题:一个方法能够被找到,并不等于认知对象能够执行它;一个行…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉