新闻详情

新闻详情

首页 / 资讯中心 / 详情

为什么logprob分布比单一分数更准?LLM-as-a-Verifier细粒度奖励的核心原理

发布时间:2026/9/28 21:24:43来源:尧图网络
为什么logprob分布比单一分数更准?LLM-as-a-Verifier细粒度奖励的核心原理
为什么logprob分布比单一分数更准LLM-as-a-Verifier细粒度奖励的核心原理【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifierLLM-as-a-Verifier 是一个通用的智能体Agent验证框架它不让大模型只给出一个单一分数而是读取模型打分时logprob 概率分布的完整形态用期望值算出 0~1 之间的细粒度奖励fine-grained reward从而实现对任意 Agent 的精准评估——无需任何额外训练。下面用 4 个部分讲清楚它为什么比传统的 LLM 打分方式更准。为什么单一分数不够LLM 评估的第一个陷阱传统的LLM-as-a-Judge做法是让评审模型输出一个离散标签比如 1~10 分里的某个整数然后直接采信。问题在于信息被强行压缩模型内部其实对这个答案值 12 分还是 15 分存在真实的犹豫输出单一整数时这份犹豫被丢掉了。边界情况被误判一个差一点点就全对的轨迹和一个完全跑偏的轨迹可能被粗暴地打成相邻的两档却看不出差距到底是 1 分还是 5 分。无法连续比较单一分数是阶梯状的做强化学习信号或进度监控时粒度太粗会导致训练信号稀疏。LLM-as-a-Verifier 的关键洞察是模型对每个候选分数的概率本身就是它最诚实的判断。与其让它二选一地落子不如把整条概率分布读出来。核心原理读取评分 token 的完整 logprob 分布整个框架的数学核心只有一句话对评分 token 集合求概率加权期望$$ R(x, \tau) \frac{1}{CK} \sum_{c1}^{C} \sum_{k1}^{K} \sum_{g1}^{G} p_{\theta}(v_g \mid x, c, \tau),\phi(v_g) $$各符号含义很直白符号含义直觉理解C评估标准数把对不对拆成多个独立标准分别打分K重复验证次数多次采样取平均抑制随机波动G评分 token 数粒度默认 20 档A~T 字母p(v_g)模型给某档分数的概率分布而不是单点φ(v_g)把评分 token 映射为标量值A20 分 … T1 分关键实现在 extract_score()它定位到模型回答中评分标签如score_A之后的那个 token 位置取出该位置的 top-20 候选 token 及其 logprob做 softmax 归一化后计算加权期望最后把结果线性缩放到 [0, 1]。如果某个后端拿不到 logprob才退化为解析文本里的字面字母——也就是说分布优先、单值兜底。为什么用 A~T 字母而不是数字 1~20评分标尺定义在 fine_grained_reward.py 的 SCALEA~T 共 20 个字母每个字母在主流分词器tokenizer里都是独立的 token因此每个档位都能单独拿到 logprob而1020这类多位数字往往被切成多个碎片 token分布就取不干净了。档位语义明确分级A完全成功H~M不确定区间T彻底失败进度跟踪场景方向相反A0% 进度T100%。提示词里明确要求模型先推理、最后才输出评分行让分布建立在完整分析之上。再配合一个工程细节 prefill 评分技巧对开源模型框架会先把score_A标签预填进对话再用结构化输出约束该位置只能落在这 20 个字母上——这样读到的 top-logprob 就是在评分尺度上重新归一化的真实分布不受无关 token 干扰。细粒度奖励的四根支柱分解、重复、粒度、不确定性单看分布只是第一根支柱。框架把准拆成了四个可叠加的杠杆对应总览图中 Verification Scaling Framework 的四个模块分解Criteria Decomposition评估标准不是一句好不好而是写在 criteria/ 目录 下的独立条目如是否修了根因是否跑了验证。每条标准单独打分再平均避免一个优点掩盖另一处硬伤。标准文件由 load_prompts() 解析可直接照 TEMPLATE.md 复制改写。重复Repetition每对比较重复 K 次评分取均值。有意思的是奇数次重复会自动交换 A/B 槽位顺手抵消了模型的位置偏置。粒度Granularity就是本文主角——20 档分布期望而非 1 档单值。不确定性Uncertainty直接建模模型自己有多确定分布越尖锐分数越可信分布弥散则说明模型真的拿不准。四者相乘奖励从粗糙的档位变成了连续、可微、可比较的 [0,1] 标量。细粒度奖励能干什么Best-of-N 选型与实时进度追踪用 O(Nk) 成本从 N 条轨迹里挑出最好的拿到连续奖励后选最优轨迹不再需要 O(N²) 的全两两比较。Probabilistic Pivot TournamentPPT 分三步随机环上一圈粗排 → 选出 top-k 个轴心候选 → 只让其余候选与轴心比。每场比较的胜负用 Bradley-Terry 软投票p sigmoid(R_a − R_b)见 bradley_terry()连续奖励在这里变成软胜率——这正是单一分数做不到的0.62 对 0.60 和 0.9 对 0.2 的赢法完全不同。实测效果在 Terminal-Bench 2.1 上Best-of-5 细粒度验证达到88.0%远超基线 Pass1 的 78.7%SWE-Bench Verified 上从 76.1% 提到 78.2%。连续分数画出的进度曲线是分布更准最直观的证据用 track() / ProgressTracker 给一条执行轨迹的每一步打分得到的不是一串跳变的档位而是一条平滑连续曲线。下图是 Terminal-Bench 任务pytorch-model-cli的两次运行成功运行的分数随步骤单调爬升到 1.0失败运行的分数在错误路径上持续走低——如果只有单一分数这种差距在逐步拉大的信号根本看不到。复现脚本terminal_bench_progress.py。快速上手三步跑通 LLM-as-a-Verifier 细粒度奖励pip install llm-verifier配置好任一支持 logprobs 的后端如 vLLM 本地服务、DeepSeek、Vertex Gemini后几行代码即可体验import llm_verifier result llm_verifier.select( problemWrite a function that reverses a string., candidates[traj_1, traj_2, traj_3], criteria{Correctness: Does the code actually reverse the string?}, ) print(result.index, result.scores) # 最优候选及每个候选的连续奖励想要复现论文表格里的基准成绩直接运行 scripts/run.pypython scripts/run.py terminal_bench python scripts/run.py swe_bench基准注册表在 benchmarks.py各基准的轨迹数据随仓库提供data/目录。常见问题LLM 验证与 logprob 奖励 FAQ问为什么不用更大范围比如 1~100 分的标尺答档位越细越准但受限于 top-logprobs 接口上限OpenAI 系 API 封顶 20 个候选 token20 档是当前接口下的最优粒度且 20 档对区分优劣已绰绰有余。问logprob 分布取的是哪一步的答模型回答中评分标签后的那个位置且取最后一次出现避免模型在分析中引用格式时误采。问这个方法需要微调模型吗答完全不需要。它只依赖推理时接口返回的 token 级 logprob对 Gemini、DeepSeek、vLLM 部署的开源模型通用。问细粒度奖励能直接当强化学习的 reward 吗答可以。连续 [0,1] 信号比 0/1 稀疏奖励更适合做 RL 的 reward shaping这也是框架宣传的三个落地场景之一测试时扩展、进度追踪、强化学习。小结单一分数是模型判断的投影logprob 分布才是它的原像。LLM-as-a-Verifier 用 20 档字母标尺 分布期望 标准分解 重复验证把 LLM 评审从拍脑袋打档升级为连续、可解释、免训练的细粒度度量——这就是它能在编程、机器人、医疗等多个智能体基准上稳定超过基线的原因。【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifier创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

高通Adreno DPU显示链路全解析:从DRM/KMS到MIPI DSI实战 2026/9/28 22:23:55

高通Adreno DPU显示链路全解析:从DRM/KMS到MIPI DSI实战

1. 显示链路全景拆解:从应用层到屏幕像素的完整路径高通Adreno DPU(Display Processing Unit)这套显示架构,我第一次接触是在调试一块MIPI DSI屏幕的时候。当时屏幕能亮,但画面撕裂、竖屏横显、色彩偏移各种问题轮番出…

阅读更多 →
VSCode+PlatformIO搭建Arduino开发环境:从安装到ESP32进阶 2026/9/28 22:23:48

VSCode+PlatformIO搭建Arduino开发环境:从安装到ESP32进阶

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Substrate区块链开发框架:从Runtime到Pallet的造链实践 2026/9/28 22:23:48

Substrate区块链开发框架:从Runtime到Pallet的造链实践

如果你在技术社区里搜索“substrate”,大概率会同时撞见好几个完全不同的东西:材料科学里它是衬底,生物化学里它是底物,而在区块链圈子,Substrate 是一个几乎绕不开的开发框架——Parity Technologies 团队用 Rust 写的…

阅读更多 →
ZYNQ上AXI_IIC驱动24C02的5分钟实操指南 2026/9/28 22:23:41

ZYNQ上AXI_IIC驱动24C02的5分钟实操指南

1. 为什么是“5分钟搞定”?——ZYNQ上I2C通信的真实门槛与认知纠偏“5分钟搞定ZYNQ的I2C通信”这个标题,乍看像营销话术,实则精准锚定了一个被严重低估的工程现实:在ZYNQ SoC平台上,I2C通信本身的技术复杂度远低于其环…

阅读更多 →
ZYNQ I2C驱动24C02的三层协同原理与实战排错 2026/9/28 22:23:41

ZYNQ I2C驱动24C02的三层协同原理与实战排错

1. 为什么“5分钟搞定”是个危险的幻觉——ZYNQ上I2C通信的真实水深你搜“ZYNQ I2C 24C02”,首页弹出的标题几乎全是“手把手”“零基础”“5分钟速成”。我当年第一次在ZYNQ-7020上跑通AXI_IIC驱动24C02,也是被这类标题骗进去的。结果呢?烧写…

阅读更多 →
Java Swing+SqlServer学生成绩管理系统:毕业设计实现与避坑指南 2026/9/28 22:23:41

Java Swing+SqlServer学生成绩管理系统:毕业设计实现与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉