新闻详情

新闻详情

首页 / 资讯中心 / 详情

HarnessRouter 基准测试与合规套件:76 项检查与 5 场景矩阵如何验证 Harness 可靠性

发布时间:2026/10/1 18:27:38来源:尧图网络
HarnessRouter 基准测试与合规套件:76 项检查与 5 场景矩阵如何验证 Harness 可靠性
HarnessRouter 基准测试与合规套件76 项检查与 5 场景矩阵如何验证 Harness 可靠性【免费下载链接】harnessrouterHarnessRouter Community Edition: the self-hosted, Apache-2.0 edition of the unified interface for agent harnesses. Run Codex, Claude Code, Hermes, PI, DSH, and more through one API, with sessions, streaming, files, cancellation, and failure handling. Implements the Unified Harness Protocol (UHP), an open standard. Your keys, your infrastructure.项目地址: https://gitcode.com/gh_mirrors/ha/harnessrouterHarnessRouter 是开源、可自托管的 Agent 统一接口网关把 Codex、Claude Code、Hermes、Pi、DSH 等十几个编码 Agent业内称 Harness收敛成一套 API。围绕它建设的三套验证工具——UHP 合规套件76 项检查、5 场景支持矩阵与基准测试套件——用可复现的自动化流程回答一个问题这个 Harness 到底可不可靠。本文带你读懂这三层验证如何工作、规则如何裁定结果以及你能从中得到什么。为什么要先验证再使用多 Agent 网关最容易踩的坑不是跑不起来而是看起来跑起来了会话悄悄切换了模型、流式输出被代理缓冲、取消接口返回 200 但任务仍在后台烧 token。HarnessRouter 的验证体系专门针对这类隐性失败其判定规则全部写在代码里而不是靠人工目测详见 docs/harness-verification.md。它把可靠性拆成三个递进的问题层级套件回答的问题协议合规UHP 合规套件这个网关是否严格遵守统一 Harness 协议UHP功能支持5 场景支持矩阵每个 Harness × 模型组合是否真实可用效果基准基准测试套件同一份任务哪个组合做得又快又好76 项检查UHP 合规套件如何裁定符合通过合规套件就是UHP 符合的完整含义——不是实现了部分端点不是自评不是大部分通过。套件在仓库内protocol/conformance/可对任何 HTTP 服务运行任何人可针对任何实现发起测量。76 项检查分为三个累积层级Core40 项服务发现、版本协商、鉴权、错误信封、会话、流式任务执行与事件流、取消机制等协议骨架Extended8 项会话列表与检查、文件输入、产物下载头、路径穿越探针等Full26 项Harness 增删改、插件包往返、技能文件夹、会话共享等完整能力。其中有几项检查专门捕捉schema 检查永远发现不了的缺陷S-09测量事件到达时间分布让全部缓冲、最后一次性冲刷的服务器当场现形——这是 UHP 部署中最常见、也最容易被误认为模型太慢的故障 C-03发起长任务后真正取消它等待终态专治取消接口返回 200 但 Agent 还在跑 X-07/X-08产物下载必须带nosniff头且 ID 不能穿越出容器目录——产物是攻击者可影响的内容缺了前者就是存储型 XSS。套件还有一个被反复强调的诚实原则跳过SKIP永远不算通过。JSON 报告中的conformant字段只有在该层级的每一项检查都运行且通过时才为true跳过的检查会被逐一列在skipped_not_verified中。参考实现的成绩单也是公开可查的证据Community Edition 0.17.3 在 2026-09-15 的实测中 74/74 通过、0 跳过获 UHP 2026-09-12 Full 级符合。更有说服力的是开发这套检查的过程本身就挖出了真实缺陷——包括一次会话共享链接在删除后仍可读取完整对话的越权问题以及禁用工具形同虚设的静默失效。5 场景矩阵每个 Harness × 模型都要过的关卡支持矩阵scripts/support-matrix/驱动控制台以真实用户身份操作对每个 Harness、其菜单提供的每个模型在同一个会话里连续跑五个场景场景验证点首轮回话Harness 在指定模型上启动并作答追问会话延续而不是重新开局模型切换中途换模型仍保持上下文再换回来产物任务必须产出的文件真实存在于轮次记录并展示给读者回收沙箱被主动释放后追问仍能回忆起第一条消息完成不等于通过四条裁定规则保证严谨跑在你指定的连接上、跑在你点名的模型上供应商前缀/版本后缀算同一模型换成别的编号或档位就是违规、渲染给读者的文件卡片必须与存储文件一致、模型目录不得承诺 Harness 做不到的事。任何一条不满足该组合记为 finding发现项单独列出、永不计为通过。完整的逐供应商结果表生成在 docs/support-matrix.md例如 Anthropic 一列 49 个组合、245 次场景运行全部通过失败的行则必须附上复现的供应商报错原文。运行笔记与逐项说明在 docs/support-matrix-notes.md。矩阵之外还有两个特色维度自定义 Harness 维度scripts/support-matrix/custom-harness.mjs验证你写的技能包真的送达了 Agent、被禁用的工具真的没被调用判定依据是答案里出现只存在于随包脚本内部的每轮随机令牌家族巡游scripts/support-matrix/family-tour.mjs则用一个 PPT 交付物让 OpenAI、Anthropic、Google 等十余个模型家族轮流接手同一份文件确保上一轮谁回答的不影响会话状态。基准测试同一份任务量化谁做得好如果支持矩阵证明 Harness能用基准测试套件scripts/benchmark/则测量它做得多好公开任务套件、确定性判分、每任务一个独立会话、所有数字直接读取运行器已存储的轮次记录。首列成绩50 道 SpreadsheetBench Verified 电子表格任务、deepseek-v4.1-flash、四个 Harness 关闭网络工具Harness解决率中位耗时工具调用失败调用pi40/4785%48 s52617%opencode39/4881%75 s56312%dsh36/4678%100 s72116%cline36/4777%108 s73616%四条独家规则让数字敢看跑在指定连接上串线即 finding、跑的正是你点名的模型、禁止抄答案联网抓取或全盘搜索任务本身都算 finding不计分——因为早期试点真有 Agent 去公网搜 ground truth、无模型裁判需要模型主观判断的题集直接不收录。完整原始记录见 docs/benchmark-results.json生成的表格见 docs/benchmark.md。上手在自己实例上跑一遍三个套件都设计为可对任何自托管实例运行。以合规套件为例先本地安装包再指向你的服务根地址pip install -e protocol/conformance uhp-conformance --base-url https://your-instance \ --api-key $UHP_API_KEY --class full --json report.json退出码 0 表示全部通过可直接接入 CI。支持矩阵与基准测试同理均支持断点续跑——已记录的组合自动跳过被打断的 worker 重启后继续。小结HarnessRouter 的验证体系把可靠翻译成了可执行的判定76 项协议检查盯住网关本身5 场景矩阵盯住每个 Harness × 模型的可用性基准测试盯住真实任务的效果与成本而所有结果都以公开 JSON 和生成文档的形式留在仓库里证据可复核、规则可检查。对于正在选型或自托管多 Agent 网关的团队这套先测量、后上线的流程本身比任何单点功能都值得借鉴。【免费下载链接】harnessrouterHarnessRouter Community Edition: the self-hosted, Apache-2.0 edition of the unified interface for agent harnesses. Run Codex, Claude Code, Hermes, PI, DSH, and more through one API, with sessions, streaming, files, cancellation, and failure handling. Implements the Unified Harness Protocol (UHP), an open standard. Your keys, your infrastructure.项目地址: https://gitcode.com/gh_mirrors/ha/harnessrouter创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI编程工业化:从开源模型到多Agent编队的工程实战 2026/10/1 19:12:00

AI编程工业化:从开源模型到多Agent编队的工程实战

今天看到这条“今日AI大事件”时,我脑子里冒出的第一个词不是“融资”,也不是“大模型”,而是“工业化”。智谱一下子甩出50亿美元的消息,加上中国开源模型连续20周在排行榜上霸屏,再叠加AI编程开始讲“千人编队”&…

阅读更多 →
GPT Image 2 API实战:从图像生成到局部编辑的自动化工作流 2026/10/1 19:12:00

GPT Image 2 API实战:从图像生成到局部编辑的自动化工作流

图像生成早就不停留在“出一张好看的图”阶段了。我最近把整套业务从纯生成改成“先生成、再局部编辑”的管线,核心驱动就是 GPT Image 2 API。这代 API 真正让人舒服的地方在于,它把生成和局部编辑统一成了同一个接口,既能用自然语言描述画面…

阅读更多 →
AI网关如何化解RAG生产难题:从知识割裂到成本管控 2026/10/1 19:12:00

AI网关如何化解RAG生产难题:从知识割裂到成本管控

做RAG项目的同学应该都有这种体会:前期搭个demo很快,一两天就能让大模型对着PDF问答,演示效果各种惊艳。可一旦上了生产环境,问题就开始排队出现——知识库之间互相割裂、检索命中率忽高忽低、换个模型就要改一堆代码、线上出了问…

阅读更多 →
Hermes-Agent 部署与调优实战:从硬件选型到性能优化 2026/10/1 19:11:59

Hermes-Agent 部署与调优实战:从硬件选型到性能优化

Hermes-Agent 这个项目,第一次接触的人很容易被它的名字误导,以为是个轻量级的对话机器人,实际上它是一套完整的智能体运行框架,涉及依赖管理、模型加载、工具注册、记忆存储等多个子系统。我前后在三台不同配置的机器上部署过它&…

阅读更多 →
Java开发者AI入门实战:Spring AI与LangChain4j构建RAG与Agent 2026/10/1 19:11:59

Java开发者AI入门实战:Spring AI与LangChain4j构建RAG与Agent

1. Java 开发者切入 AI 的真实路径拆解 1.1 为什么 Java 开发者不需要从零学 Python 我做了十多年 Java 后端,这两年身边问得最多的问题就是“要不要转 Python 才能搞 AI”。实测下来,这个判断本身就是个误区。Java 生态在 AI 工程化落地这一层&#xf…

阅读更多 →
金融产品经理笔试真题拆解:从题型框架到复盘方法 2026/10/1 19:11:53

金融产品经理笔试真题拆解:从题型框架到复盘方法

简介:2017京东校招金融产品经理笔试试题PDF是一份面向金融产品经理岗位求职者的真题资料,围绕资料分析、数学运算、逻辑推理等笔试常考模块展开,适合金融类专业学生、校招候选人及产品岗位从业者刷题自测与查漏补缺。文档内含1个PDF文件&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉