新闻详情

新闻详情

首页 / 资讯中心 / 详情

三步接入你自己的任务:LLM-as-a-Verifier自定义Benchmark适配完全指南

发布时间:2026/9/28 20:28:26来源:尧图网络
三步接入你自己的任务:LLM-as-a-Verifier自定义Benchmark适配完全指南
三步接入你自己的任务LLM-as-a-Verifier自定义Benchmark适配完全指南【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifierLLM-as-a-Verifier 是一个通用的Agent 轨迹验证框架无需任何额外训练它就能对任意 Agent 任务的候选轨迹给出细粒度评分在编码、机器人、医疗等 Agent 基准上均达到 SOTA 表现。更友好的是官方把接入你自己的任务精简成了3 步—— 放数据、改命名、交给 AI 编码代理跑通。本文将带你从零走通自定义 Benchmark 适配的完整路径。接入前 2 分钟先认识框架的三个角色 LLM-as-a-Verifier 的核心理念很简单与其让大模型当裁判只给一个笼统结论不如让它沿着一组**验证标准Criteria逐条打分取分数分布的期望作为细粒度奖励再用枢轴锦标赛Pivot Tournament**以 O(Nk) 的比较成本对 N 条轨迹排序选出最优的一条。接入你的任务时你只需要提供三样东西角色文件位置说明 轨迹数据data/任务名_trajs/任务提示 各候选轨迹 成功/失败标签 验证标准criteria/任务名.md2-3 条陌生人也能照着打分的标准⚙️ 运行脚本adapt_run.py加载数据并调用llm_verifier.select()输出排名 仓库中已有现成范例可以参考criteria/terminal_bench.md、criteria/swe_bench.md以及 data/terminal_bench_2.0_trajs/ 下的数据布局。三步接入官方推荐的完整流程 官方适配指南写在 add_new_benchmark.md 中整个流程只有三步第一步添加你的数据Add your data把你的 Agent 轨迹复制到data/task_name_trajs/目录。每条轨迹应包含三部分信息任务/问题提示problem prompt各候选轨迹candidate trajectories真实奖励标签success / failure——用于事后核对验证器选得准不准第二步更新命名Update naming打开 add_new_benchmark.md把其中所有的task_name占位符替换成你的任务名。这一步看似简单但它决定了后续生成的标准文件、运行脚本、结果文件名是否一致。第三步启动 AI 编码代理执行Spin up Claude Code在仓库中启动 Claude Code或 Codex 等任何 AI 编码工具建议关闭文件写入权限把add_new_benchmark.md的全部内容粘贴给它。它会按指南自动完成五件事熟悉现状阅读 README检查你的数据目录布局生成标准按 criteria/TEMPLATE.md 的格式写出criteria/task_name.md编写运行器创建adapt_run.py加载轨迹并调用llm_verifier.select()检查凭证确认.env中有 API Key评分是真实 API 调用如VERTEX_API_KEY跑起来执行python adapt_run.py报告被选中的轨迹、各轨迹得分、以及选择是否正确核心调用看起来非常简洁result llm_verifier.select( problem, trajectories, criteriatask_name, n_evaluations8, # 每条标准的重复验证次数 K pivots2, # 枢轴数量 k控制成本与精度 ) print(result.index, result.scores)运行后把选中的索引、逐轨迹得分、是否选对、以及所用配置写入results/task_name.txt就完成了一次完整的自定义 Benchmark 适配 ✅写好验证标准的关键技巧 ✍️criteria/任务名.md是整个框架的灵魂官方模板 criteria/TEMPLATE.md 明确要求保留如下结构## Ground Truth Note一段每次比较都会看到的提示比如不要相信 Agent 的自我评估以工具原始输出为准## Criteria下接若干### 标准名小节每条标准一段可独立执行的打分说明几条来自模板的实战建议2-4 条窄标准胜过 1 条宽标准——每条标准独立评分写清楚去哪里看证据哪些命令、字段、文件、输出写清楚什么该得高分、什么该得低分以及要忽略什么防止标准之间串味避免标签泄漏标准应评估轨迹中可观测的行为而非直接暗示答案标准文件写完后无需任何 API Key 即可预览验证器将看到的内容python -m llm_verifier criteria/your_task.md这个预览功能实现在 llm_verifier/prompts.py 中能帮你快速检查标准是否被正确解析。进阶把你的任务注册进 Benchmark 注册表 如果希望像内置基准一样用命令行一键复现可以在 llm_verifier/benchmarks.py 的BENCHMARKS注册表中加一个条目声明数据路径、标准文件、评分缓存位置等参数。若你的数据格式与内置布局不同再往 llm_verifier/loaders.py 里加一个加载器——每个加载器把数据解析为任务 ID → 多次试验列表的映射即可。注册完成后一条命令即可运行python scripts/run.py your_task python scripts/run.py your_task --pivots 2 --n-evaluations 8 --seed 0运行报告Pass1 vs 验证器 vs Oracle会自动打印并写入results/目录入口脚本见 scripts/run.py。验证是怎么排名的理解枢轴锦标赛 朴素的全员循环赛需要比较 C(N,2) 对轨迹成本是 O(N²)。LLM-as-a-Verifier 的**概率枢轴锦标赛PPT**分四步把成本压到 O(Nk)环形轮随机排序后相邻配对打分每个候选在 A/B 槽位各出现一次抵消位置偏差选枢轴按环轮得分取前 k 名作为枢轴枢轴轮非枢轴只与枢轴比较重复比较时互换 A/B 槽位聚合选择累加各候选的胜场质量返回归一化得分最高者pivots参数即在此处权衡成本与精度枢轴越多比较次数越多排名越准。实现位于 llm_verifier/pivot_tournament.py。接入之后你还能做什么自定义任务跑通只是开始。同一套细粒度奖励还可以驱动进度追踪——逐步给轨迹打分实时观察 Agent 是在推进还是在绕圈甚至在中途放弃毫无希望的运行。官方用 Terminal-Bench 的pytorch-model-cli任务演示过这种对比如上图成功轨迹的验证分数稳步爬升而失败轨迹因错误行为始终分数偏低——这正是细粒度反馈相比0/1 判定的价值所在。常见问题速答 ❓Q需要准备多少条轨迹每任务多条内置基准普遍是 3-5 条Best-of-N 选择才有意义若只有单条轨迹更适合用进度追踪模式。Q需要训练或微调验证器吗不需要。框架的核心卖点就是零训练依赖现成模型的 logprob 分布完成细粒度评分只需在.env中配置对应后端的 API Key。Q评分要花多少 Token每次比较会携带两条完整轨迹大任务可达数万 Token但 0.2.0 版本起内置前缀缓存优化可将未缓存输入 Token 减少约 3.4 倍运行结束后llm_verifier.token_usage()会给出精确账单详见 CHANGELOG.md。总结一张清单带走全文 ✅安装pip install llm-verifier或克隆仓库后pip install -e .轨迹放入data/任务名_trajs/含提示、轨迹、成败标签替换 add_new_benchmark.md 中的task_name交给 AI 编码代理生成标准文件 运行脚本配置.env凭证运行并核对选择结果可选注册进llm_verifier/benchmarks.py用scripts/run.py一键复现三步接入、零训练、细粒度反馈——这就是 LLM-as-a-Verifier 让任意任务可验证的完整路径。现在轮到你自己的任务了 【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifier创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI批量重写存量代码:GitHub三周128个PR的工程实践拆解 2026/9/28 21:53:55

AI批量重写存量代码:GitHub三周128个PR的工程实践拆解

1. 一个反直觉的工程选择:让 AI 修改自己的源码先说一个可能和多数人直觉相悖的事实:GitHub 这个承载了全球数亿个代码仓库的平台,其自身的代码库也面临着所有老系统都会遇到的麻烦——技术债堆叠、依赖版本过于陈旧、核心服务之间的耦合越来…

阅读更多 →
辉芒微FT62F28X烧录与调试避坑指南 2026/9/28 21:53:49

辉芒微FT62F28X烧录与调试避坑指南

1. 项目概述:为什么辉芒微FT62F28X的烧录与调试值得专门拆解FMD IDE、辉芒微、FT62F28X、烧录、调试——这五个词组合在一起,不是泛泛而谈的“单片机开发入门”,而是指向一个非常具体、非常真实、也相当容易踩坑的工程现场:一款国…

阅读更多 →
AI自主提交128个PR重构83万行代码的工程方法论 2026/9/28 21:53:49

AI自主提交128个PR重构83万行代码的工程方法论

前几天看到 GitHub 那波"AI 自己给自己提交了128个PR、改了83万行代码"的消息时,我第一反应是:又来了个噱头。但把三周时间线、PR列表和自动化验证的细节翻了一遍之后,我发现真正值得聊的其实不是"AI 重写自己"这个标题&…

阅读更多 →
Superpowers实战:给Codex与Claude Code装上结构化技能库 2026/9/28 21:53:49

Superpowers实战:给Codex与Claude Code装上结构化技能库

最近一段时间我几乎逢人就推荐一个东西:给手头的 Codex(或者 Claude Code,看你习惯用哪个)装上 superpowers。你第一次听到这个名字可能会觉得夸张,但它解决的事情非常具体——默认状态下,AI 编码代理更像一…

阅读更多 →
STM32串口调试5分钟闭环:USB转TTL驱动与硬件连接全指南 2026/9/28 21:52:54

STM32串口调试5分钟闭环:USB转TTL驱动与硬件连接全指南

1. 为什么“5分钟搞定”不是口号,而是可复现的操作节奏STM32串口通信,是每个嵌入式新手跨出开发板点亮LED后的第一道真实门槛。它不像GPIO那样只写寄存器就能看到结果,而是一条需要两端协同、软硬咬合、信号精准对齐的“数据通道”。你手里的…

阅读更多 →
校园POS消费数据清洗与行为建模实战指南 2026/9/28 21:52:54

校园POS消费数据清洗与行为建模实战指南

简介:本资源是一份面向本科生与Python初学者的校园消费行为分析实战项目,适用于毕业设计、期末大作业及课程设计场景,聚焦学生群体消费偏好、时段规律与食堂就餐结构等现实问题,助力掌握从数据清洗到建模可视化的完整分析链路。压…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉