新闻详情

新闻详情

首页 / 资讯中心 / 详情

Harvey LAB优秀Rubric设计:让法律Agent评分标准具体、可审计的完整指南

发布时间:2026/9/21 2:40:08来源:尧图网络
Harvey LAB优秀Rubric设计:让法律Agent评分标准具体、可审计的完整指南
Harvey LAB优秀Rubric设计让法律Agent评分标准具体、可审计的完整指南【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LAB 是一个开源的法律工作 Agent 评测基准用于评估并改进大模型 Agent 处理真实法律事务的能力。它的评分体系不靠模糊的总体印象分而是依赖一套写进每个任务里的Rubric评分量规——全库共约 10 万条标准每一条都具体到可以被逐条核验、逐条审计。本文将拆解这套具体可审计的评分标准是如何设计的以及它为什么值得你借鉴。为什么具体可审计对法律 Agent 评测很重要 ⚖️法律工作有一个特点漏掉一个关键问题整份工作的价值就大打折扣。一份尽职调查备忘录即便发现了 95% 的风险点只要漏掉一处实质性红旗red flag对客户来说它依然是错的。传统评测常用平均分来衡量质量这在法律场景下具有误导性。因此 Harvey LAB 的选择是不做加权打分每条标准权重相同只有 pass / fail 两种结果不做参考答案对比没有单独的标准答案文件评判依据就是标准本身全通过才算过任务得分 所有标准全部通过 ? 1.0 : 0.0这套all-pass全通过规则看似严苛恰恰是它保证评测结果可解释、可审计的关键。方法论细节可见官方文档docs/eval-strategies.md。一条优秀 Rubric 标准的解剖 每个任务都是一个目录核心是task.json文件Rubric 直接内联在其中的criteria字段。以 MA 数据房红旗审查任务为例打开 tasks/corporate-ma/review-data-room-red-flag-review/task.json可以看到一条典型标准{ id: C-001, title: ISSUE_001: Identifies $1.0M EBITDA discrepancy between CIM and QofE, deliverables: [red-flag-memo.docx], match_criteria: PASS if the memo identifies that the CIM states adjusted EBITDA of $22.8M while ... FAIL if the discrepancy is not identified or the dollar amounts are materially wrong. }一条标准由这几个字段构成字段作用id唯一编号如 C-001方便在报告里精确定位title描述性标题点明这条标准考察什么match_criteria实质评判标准——明确写出 PASS 和 FAIL 各自的条件deliverables声明该标准只针对哪个交付文件缩小评审范围sources可选任务文件中与该标准相关的来源文档三条让标准具体可审计的设计原则 ✨1. 具体到数字和出处而非形容词。标准不说分析应全面准确而是写明CIM 中 EBITDA 为 2280 万美元而 QofE 回复显示 1840 万 540 万调整项共 2380 万美元差 100 万美元——连金额写错都会判 FAIL。评审模型和人工复核者面对的是同一个可验证的事实陈述。2. PASS / FAIL 双条件写法。每条match_criteria都同时写清什么情况下通过和什么情况下不通过消除模糊地带让每次判定都能被复现和争议时追溯。3. 按交付物划定评审边界。每条标准声明自己只检查哪个文件评审时模型只加载该标准声明的文件——考 DDQ 回复准确性的标准不会看到无关的问题备忘录避免交叉污染也让为什么这条不通过的解释更聚焦。官方对标准作者还有一条提醒Rubric 里应只放监督律师交付前真正会检查的要点锦上添花的填充项只会拉低全通过率、稀释真实质量信号。LLM JudgeRubric 的执行者 ⚖️标准写好了谁来执行Harvey LAB 用LLM 裁判默认claude-sonnet-4-6逐条评审实现在 evaluation/judge.py。它的工作方式被刻意设计得可审计逐条独立评审每条标准一次独立的裁判调用互不干扰判定理由单独留痕温度 0.0确定性执行最大化跨次评测的可复现性语义匹配按实质而非措辞判分——Agent 用不同表述抓住同一分析点同样通过理由全程留痕每次判定都会把reasoning写入scores.json事后可逐条复查边界判定裁判使用的提示词模板公开在 evaluation/prompts/rubric_criterion.txt——模板里只有任务描述、Agent 输出、标准标题和match_criteria四个变量没有任何隐藏的参考答案标准本身就是唯一标尺。此外还支持--dual双裁判模式Sonnet 4.6 GPT-5.5 独立打分降低单一裁判的偏置。如何审计一次评分结果 跑完 Agent 并执行评分后uv run python -m evaluation.run_eval结果目录会生成scores.json包含all_pass、n_criteria、n_passed诊断字段以及每条标准的 verdict reasoning——这就是审计入口report.html可视化报告展示全通过状态徽章ALL PASS/MISSED N、逐条判定与可展开的裁判推理比如某次运行显示8/12 criteria passed. Missed 4 — task FAIL点开报告就能看到 C-005 为什么 failThe agent did not address the 30% revenue concentration...——评分不再是黑箱。评分逻辑源码在 evaluation/scoring.py报告与对比看板由evaluation/report.py和evaluation/compare.py生成。快速上手自己验证一遍 克隆仓库后执行./scripts/setup.sh完成环境配置详见 docs/tutorial.md查看某个任务的完整 Rubricuv run python -m utils.describe_task corporate-ma/review-data-room-red-flag-review运行 Agent 并按 Rubric 评分然后打开report.html逐条审计判定完整的运行 → 评分 → 报告三阶段架构可继续阅读 docs/architecture.md 了解细节。小结Harvey LAB 的 Rubric 设计给所有想构建可审计评测的团队上了三堂课把评判标准写成可验证的事实陈述、让每条判定都留下理由、用全通过而非平均分反映真实质量。当评分标准本身足够具体AI 打的分到底靠不靠谱就不再是一个玄学问题——你可以打开scores.json一条一条地看。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

聚焦具身智能教育,华清远见发布三款硬件新品与课程体系2.0 2026/9/21 3:22:14

聚焦具身智能教育,华清远见发布三款硬件新品与课程体系2.0

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
STM32结构体封装原理与GPIO初始化设计解析 2026/9/21 3:22:14

STM32结构体封装原理与GPIO初始化设计解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
linsa 开源路线图前瞻:如何第一时间关注并参与这个即将开源的私有云项目 2026/9/21 3:22:14

linsa 开源路线图前瞻:如何第一时间关注并参与这个即将开源的私有云项目

linsa 开源路线图前瞻:如何第一时间关注并参与这个即将开源的私有云项目 【免费下载链接】linsa Work. Save. Share. Privately. 项目地址: https://gitcode.com/gh_mirrors/le/linsa linsa 是一个即将开源的私有云存储项目,核心卖点是端到端加密…

阅读更多 →
Voyager 入門ガイド:Gemini にタイムライン・フォルダ・プロンプト管理を組み込む 5 分間セットアップ 2026/9/21 3:22:14

Voyager 入門ガイド:Gemini にタイムライン・フォルダ・プロンプト管理を組み込む 5 分間セットアップ

AI 应用前端 【免费下载链接】voyager Enhancement suite for Gemini, AI Studio, Claude & ChatGPT — plus a prompt manager for any websites, DeepSeek Harness included. / 面向 Gemini、AI Studio、Claude 与 ChatGPT 的增强套件;其中的提示词管理器可用…

阅读更多 →
DDR5内存SPD Hub深度解析:JESD300-5A规范与SPD5118/5108实战指南 2026/9/21 3:22:14

DDR5内存SPD Hub深度解析:JESD300-5A规范与SPD5118/5108实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
嵌入式下载故障排查:ST-LINK与GD32 Programmer典型问题解决 2026/9/21 3:19:14

嵌入式下载故障排查:ST-LINK与GD32 Programmer典型问题解决

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞