新闻详情

新闻详情

首页 / 资讯中心 / 详情

MedPRMBench 医学推理过程验证榜单发布:MedPRM 以 87.1 分居首,领先 GPT-5.4 11.7 分

发布时间:2026/9/2 8:18:36来源:尧图网络
MedPRMBench 医学推理过程验证榜单发布:MedPRM 以 87.1 分居首,领先 GPT-5.4 11.7 分
评测背景大模型在医学问答中给出正确答案并不意味着它的推理过程同样可靠。一条推理链结论正确却可能在中间混入错误事实、遗漏必要前提、忽视药物禁忌甚至用看似自信的表述掩盖逻辑缺陷。对于医疗这类高风险场景只判断最终答案是否正确难以发现这些隐藏在过程中的问题。为此MedPRMBench 构建了步骤级评测基准要求模型对推理链中的每个步骤做对错判断而非直接回答问题。评测集包含 6,500 道医学问题每题提供一条正确推理链和一条注入错误的推理链共计 13,000 条推理链、113,910 个步骤标签。错误注入覆盖简洁性、正确性和敏感性三大类共 14 种错误类型。主指标 PRMScore 同时衡量错误步骤检出能力与正确步骤判断能力用于评价模型能否均衡判断推理步骤是否正确。需要说明的是本榜单反映的是医学推理过程验证能力不是医学问答正确率也不能等同于诊疗能力。榜单概览点击访问晓天衡宇评测社区查看完整榜单、排行榜规则、评测集详情、详细得分榜单。核心结论结论 1MedPRM 以 87.1 分居首但 11.7 分的领先优势部分源于专项训练基于 Qwen3-8B、使用 MedPRMBench 训练集进行专项 PRM 训练的 MedPRM 取得 87.1 分排名第一。GPT-5.4 以 75.4 分位居第二是未经过专项训练的模型中最优者两者相差 11.7 分。不过MedPRM 与 GPT-5.4 等通用评审模型在训练数据和训练目标上均不相同这 11.7 分的差距不能理解为同等条件下的通用能力对比。结论 2前沿 API 评审模型组平均 PRMScore 为 70.4 分两类开放权重评审模型组均约为 54 分本次评测中9 款前沿 API 评审模型的平均 PRMScore 为 70.4 分高于开放权重推理评审模型组的 54.0 分和开放权重医学评审模型组的 53.6 分两类开放权重模型组均分接近。说明医学专门化或通用推理能力本身并不保证模型能在该基准上获得更高的步骤级验证分数。结论 3部分模型存在明显单边判断偏置高正确步骤判断率不代表会查错Meditron3-8B 对正确步骤的判断准确率达到 96.4%但错误步骤检出率只有 9.7%最终 PRMScore 仅为 46.8 分DeepSeek-R1-Distill-Qwen-32B 也呈现类似偏置。相比之下MedPRM 的判断准确率和错误步骤检出率分别为 89.4% 和 85.4%差距仅 4.0 个百分点最终以PRMScore 87.1 分位列总榜第一。这说明PRMScore 同时约束能否找出错误与会不会误伤正确步骤避免了模型通过单边预测获得虚高成绩。评测设计MedPRMBench 的数据来自 MedQA、MedMCQA、MMLU-Medical、PubMedQA、MedExpQA、MedXpertQA 和 MedCaseReasoning 七个医学问答数据集。原始题目经过难度筛选用 GPT-4o-mini 对每题重复采样 8 次仅保留通过率不超过 50% 的题目以剔除过于简单的样本。对于自带专家推理文本的数据直接切分为独立步骤对于仅有问答对的数据则用多款前沿模型进行拒绝采样保留答案正确且格式合规的分步推理链。随后从推理文本中提取证据推理网络并压缩为临床推理蓝图用以标注核心因果路径、必要前提和安全关键节点。在此基础上通过受控方式向正确推理链注入错误覆盖三大类 14 种错误类型数据构建还经过自动过滤、确定性文本差异校验、医学专业人员审阅及多模型投票修订。最终评测集包含 6,500 道题每题配一条正确推理链和一条注入错误的推理链并标注 Critical、Major、Moderate、Minor 四级临床影响。主榜按不引入严重度权重的总体 PRMScore 排名。同一道题可包含多种错误类型因此 14 个分项对应相互重叠的样本子集不能将各类分数简单平均作为总体分。评测方法每个模型接收一道医学问题及其分步推理链并逐步判断每个推理步骤是正确还是错误。评测关注的是模型能否检查推理过程而不是能否直接答对医学问题。主指标 PRMScore 由错误步骤检出 F1 和正确步骤判断 F1 等权计算满分 100。它同时考察模型能否找出错误以及会不会把正确步骤误判为错误避免模型通过“几乎全判正确”或“几乎全判错误”获得虚高成绩。榜单采用评测结果的 PRMScore 排名完全同分按并列处理评测结果的 Acc 和 First 只作为补充指标不计入主榜排名。分析与结论MedPRM 断层领先通用模型内部分化明显MedPRM 以 87.1 分排名第一领先第二名 GPT-5.4 达 11.7 分是榜单中相邻排名间最明显的分差。GPT-5.4、GPT-5.2、Claude Opus 4.5 和 GLM-4.7 分别获得 75.4、74.6、73.7 和 72.4 分四款通用模型之间仅相差 3.0 分表现较为接近。DeepSeek V3.1 和 Qwen3 Max 分别以 70.7 分和 70.4 分位列第六、第七DeepSeek R1 以 67.8 分位列第八。Sky-T1-32B-Flash 与 DeepSeek V3.2 同为 65.4 分并列第九Gemini 3.1 Pro 以 63.6 分位列第十一。第 12 至第 22 名的得分分布在 46.8-57.7 分之间。本次参评的 22 款模型平均 PRMScore 约为 62.2 分最高分 87.1 分最低分 46.8 分首尾相差 40.3 分。若排除使用本基准训练集进行专项训练的 MedPRM其余 21 款模型平均约为 61.0 分最高为 75.4 分、最低为 46.8 分相差 28.6 分。这说明不同模型在医学推理过程验证上的表现差距依然较大并非所有具备医学知识或推理能力的模型都能胜任这一任务。API 模型整体领先医学知识不直接转化为审错能力根据本次评测结果9 款闭源/API 模型的平均 PRMScore 为 70.4 分6 款开源推理模型平均为 54.0 分5 款开源医学模型平均为 53.6 分。闭源/API 组分别领先两类开源模型 16.4 分和 16.8 分差距明显。进一步看开放权重推理评审模型组Sky-T1-32B-Flash 以 65.4 分排名组内第一也是该组唯一进入总榜前十的模型与 DeepSeek V3.2 并列总榜第九。开放权重医学评审模型组平均 PRMScore 为 53.6 分开放权重推理评审模型组为 54.0 分两组仅相差 0.4 分。这说明在 MedPRMBench 上医学专门化并未体现为更高的组均分。回答医学问题、生成医学推理和逐步验证推理步骤是三种相互关联但不能简单等同的能力。部分模型陷入单边偏置高分不等于均衡本次评测结果显示Meditron3-8B 对正确步骤的判断准确率高达 96.4%但对错误步骤的检出率仅有 9.7%两者相差 86.7 个百分点DeepSeek-R1-Distill-Qwen-32B 同样呈现明显偏置两项准确率分别为 87.6% 和 17.1%相差 70.5 个百分点。这两款模型的 PRMScore 分别只有 46.8 分和 49.7 分——如果只看正确步骤判断率很容易误以为它们表现不错但实际上它们几乎把所有步骤都判为正确几乎没有查错能力。相比之下Claude Opus 4.5 对正确步骤的判断准确率为 69.1%对错误步骤的检出率为 82.5%两项相差 13.4 个百分点。虽然它更倾向于将步骤判断为错误但相比 Meditron3-8B 和 DeepSeek-R1-Distill-Qwen-32B两类判断结果更加均衡PRMScore 为 73.7 分。GPT-5.4 的两项准确率分别为 74.3% 和 79.0%相差 4.7 个百分点PRMScore 为 75.4 分MedPRM 的两项准确率分别为 89.4% 和 85.4%相差 4.0 个百分点在更高水平上保持了相对均衡PRMScore 为 87.1 分位居总榜第一。这说明 PRMScore 不能当作普通正确率来理解模型取得约 50 分并不代表它正确判断了一半的步骤。本次评测中部分模型虽然能够正确判断大多数正常步骤却漏掉了大量错误步骤。例如Meditron3-8B 对正确步骤的判断准确率达到 96.4%但错误步骤检出率只有 9.7%。因此接近 50 分有时反映的不是“两类步骤各判断对一半”而是模型严重偏向某一种判断实际查错能力较弱。14 类错误分析三类对比评审模型均在“非冗余性”上得分最低MedPRM 在 14 类错误上的 PRMScore 分布在 85.7-89.4 分之间最高与最低相差 3.7 分整体表现较为均衡。其中“多方案一致性”得分最高为 89.4 分“鉴别诊断覆盖”和“抗干扰能力”相对较低分别为 85.7 分和 86.0 分“定量正确性”为 88.0 分。GPT-5.4 的 14 类分数分布在 68.0-79.6 分之间最高项同样是“多方案一致性”为 79.6 分最低项是“非冗余性”为 68.0 分“定量正确性”为 77.8 分。“非冗余性”并非 GPT-5.4 的个别弱项。本次评测中前沿 API 评审模型组在该项上的平均分为 64.5 分开放权重推理评审模型组和开放权重医学评审模型组分别为 49.5 分和 52.1 分均为各组 14 类错误中的最低分。这表明三类对比评审模型在识别冗余推理步骤方面普遍较弱。综合判断从本次 MedPRMBench 评测来看22 款参评模型在医学推理过程验证上表现分化显著。MedPRM 以 87.1 分领先但这一优势包含了专项训练的条件差异。API 模型组整体领先开放权重模型约 16 分而开放权重医学组与推理组均分持平印证了医学领域知识与推理过程验证能力之间并不存在简单的对应关系。同时多款模型暴露出单边判断偏置选型时应关注模型对正确步骤与错误步骤的均衡判断能力而非仅看总分。注本文基于 MedPRMBench 公布的评测设置、样本与模型结果进行整理和分析反映模型在该基准下的相对表现不代表实际诊疗能力或所有业务场景中的绝对优劣。写在最后最新垂类领域模型评测榜单已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

构建高性能Java问答社区:从领域模型到Feed流与排名算法实战 2026/9/2 9:15:48

构建高性能Java问答社区:从领域模型到Feed流与排名算法实战

简介:这是一套面向具备Java Web开发基础的中高级学习者与项目实践者的高仿知乎功能论坛源码,聚焦问答社区核心场景,涵盖用户注册登录、文章/视频/想法发布、提问回答及互动评论等完整业务流程。资源包共441个文件,含53个Java源文件…

阅读更多 →
QGIS FlyPath插件实战:无人机测绘航线规划从入门到精通 2026/9/2 9:15:48

QGIS FlyPath插件实战:无人机测绘航线规划从入门到精通

在无人机测绘项目中,你是否也遇到过这样的困扰:面对一片待测区域,手动规划飞行航线耗时费力,既要考虑地形起伏、相机参数,又要计算航向重叠度、旁向重叠度,确保影像质量。好不容易规划好,导出到…

阅读更多 →
Medusa 移动端支付集成指南:支付宝与微信支付接入的完整路径 2026/9/2 9:15:48

Medusa 移动端支付集成指南:支付宝与微信支付接入的完整路径

Medusa 移动端支付集成指南:支付宝与微信支付接入的完整路径 【免费下载链接】medusa The worlds most flexible commerce platform for agents and developers 项目地址: https://gitcode.com/GitHub_Trending/me/medusa 如果你的电商系统跑在 Medusa 上&am…

阅读更多 →
基于STM32的智能寻迹小车:硬件设计、PID算法与嵌入式开发实战 2026/9/2 9:15:48

基于STM32的智能寻迹小车:硬件设计、PID算法与嵌入式开发实战

简介:本资源是一套完整的基于STM32F103C8T6的四驱智能小车寻迹系统开发套件,面向嵌入式初学者、电子设计竞赛备赛学生及智能车项目实践者,解决从硬件搭建到软件闭环控制的一体化学习需求。压缩包共102个文件,含39个C语言源码&…

阅读更多 →
基于STM32的篮球记分器:嵌入式开发全流程实战解析 2026/9/2 9:15:48

基于STM32的篮球记分器:嵌入式开发全流程实战解析

简介:本资源是一套基于STM32F103C8T6的嵌入式篮球记分器完整开发方案,面向高校电子类、自动化及物联网专业学生的课程设计与毕业设计实践需求,解决体育教学场景中实时、精准、可遥控的赛事计时与计分控制问题。压缩包共159个文件,…

阅读更多 →
模型预测控制(MPC)仿真:从MATLAB底层实现到工程实践 2026/9/2 9:12:46

模型预测控制(MPC)仿真:从MATLAB底层实现到工程实践

简介:本资源是一套面向控制理论学习者与自动化方向工程实践者的MPC模型预测控制MATLAB仿真程序,聚焦于线性系统带约束条件下的实时优化控制实现,适用于高校课程设计、科研原型验证及工业控制算法入门。压缩包共27个文件,全部为.m脚…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞