新闻详情

新闻详情

首页 / 资讯中心 / 详情

【人工智能每日精选】AI评委也怕打分尺度

发布时间:2026/10/1 10:20:23来源:尧图网络
【人工智能每日精选】AI评委也怕打分尺度
AI评委也怕打分尺度当我们让大语言模型给答案打分时常会先纠结提示词怎么写、模型够不够强却容易忽略一个看起来很普通的设置评分范围到底是 0 到 5、0 到 10还是 0 到 100我最近读到一组关于“模型评委”的对照实验最大的收获是评分尺度并非换个数字单位那么简单。它可能改变模型如何理解评分标准也会改变它和人类评审的校准方式。对自动评测来说量表设计本身就属于实验设计。一分数范围会改变评委的判断实验覆盖六类任务包括语义相似度、毒性识别、道德判断、事实性、指令遵循和摘要质量。研究者让 12 名人类评审和 6 个语言模型评审对同一批样本打分并比较 0–5、0–10、0–100 三种**连续分值范围**。人和模型都可以给小数分所以这里考察的是数值范围和端点校准不是“5个离散选项”和“10个离散选项”的差别。为了衡量人和模型是否给出相近分数作者使用了组内相关系数ICC和归一化平均绝对误差。简单说ICC关注的是绝对一致程度能发现系统性的偏高、偏低或分数波动范围不匹配误差指标则告诉我们人和模型平均差了多少。整体汇总后0–5 的人机一致度最高0–10 最低。一个很容易被误解的点是人类评审内部一致、模型评审内部一致并不代表两组彼此一致。两组都稳定地给分却仍可能用不同尺度理解“好答案”。二汇总分数会掩盖任务差异在相对客观的任务上例如语义相似度和毒性判断模型与人类的评分更容易对齐在开放式的回答质量、摘要评价等主观任务上模型自身跨尺度的一致性和人机一致性都更容易下降。事实性任务也有特殊挑战评审者自身的知识背景不同分歧未必只是模型校准造成的。这让我想到一个常见误区只报告一个总体一致性指标可能会让评测看起来比实际更可靠。若客观任务在汇总数据里贡献了更明显的差异整体数值就可能显得漂亮而主观任务里的不稳定被平均掉了。因此我更希望看到按任务、按评审模型拆开的结果而不是只看总分。文中还观察到不同性别评审群体与模型的对齐模式有所差别。不过每组只有 6 名人类评审这更适合作为需要进一步检验的信号不能直接推广成人群规律。三我会怎样设计一次模型评测如果我用语言模型做自动评审我会先把评分规则固定下来再把尺度作为明确的配置记录而不是临时写进提示词后就不再提。若任务主观性较强我会在一部分样本上让人类与模型使用同一标准评分分别报告 ICC 和平均分差并按任务类别检查结果。0–5 在这组实验的总体结果中表现最好但它不是所有任务、所有评审模型上的普遍最优选项。样本范围也有限完整模型跨尺度分析有 5,497 条任务样本人机对照只抽取了 150 条每个基准 25 条人类评审来自研究生群体。研究测试的是连续数值范围不能直接推出离散 Likert 量表的结论。如果某个成熟的人类量表已经固定并经过验证我也不会为了追求这组实验里的总体一致度就擅自换尺度。更稳妥的做法是针对具体任务做校准并公开尺度、端点定义和分层一致性结果这样后续读者才知道分数究竟能比较到什么程度。四评分规则也是模型的一部分“让 AI 来打分”并没有消除评测中的主观选择只是把一部分选择藏进了提示词、模型和分值范围里。选一个更合适的评分尺度可能提升人机对齐同时按任务拆解指标才能发现总体数字背后的不一致。所以我会把量表和评分端点当作评测方法的一部分认真记录。一个模型评委是否可信不只取决于它说得像不像人也取决于我们有没有把它如何打分这件事设计清楚。参考资料Li, W., Zhao, M., Dong, W.et al.Grading scale impact on LLM-as-a-judge: human-LLM alignment is highest on 0–5 grading scale.npj Artif. Intell.(2026)
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

【共创稿事节】喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录 2026/10/1 11:10:39

【共创稿事节】喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录

喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录 本文基于「喵屿」应用在 HUAWEI Pura X Max 折叠屏上的一多适配实战,结合 HarmonyOS Dev Assistant 的官方能力与全流程编排,系统梳理插件介绍、安装配置、一多适配能力、一次…

阅读更多 →
Matlab中用CNN做单输入单输出时间序列预测的完整实践指南 2026/10/1 11:10:33

Matlab中用CNN做单输入单输出时间序列预测的完整实践指南

上个月我在做一个设备振动信号的预测任务:输入过去20个采样点的振动幅值,预测下一个采样点的数值。这就是典型的单输入单输出时间序列预测——只有一个特征序列作为输入,输出也只是一个未来值。我一开始用的ARIMA,后来同时试了LST…

阅读更多 →
基于Spring Boot的自习室预订座位管理系统:从规则设计到并发实践 2026/10/1 11:10:24

基于Spring Boot的自习室预订座位管理系统:从规则设计到并发实践

1. 为什么这类系统总在“预选座”和“实际履约”之间翻车先说个我亲眼见过的场景:学校考研自习室,两百多个座位,每天早上六点半开门,五点半就有人在门口排队。有人为了占座,把复习资料往桌上一堆,一整天人都…

阅读更多 →
Node-RED低代码可视化:零Node.js基础构建工业数据看板 2026/10/1 11:10:10

Node-RED低代码可视化:零Node.js基础构建工业数据看板

1. 这不是写代码,是搭积木:为什么“拖拽可视化”能绕过Node.js门槛 “即使不会node.js,拖拽就可完成数据的可视化展示”——这句话乍看像营销话术,但背后是一套真实存在的、已被工业现场和中小团队验证数年的低代码可视化路径。它…

阅读更多 →
CIOE2026展台交换机选型与配置实操:从光模块到AI集群的现场验证 2026/10/1 11:10:09

CIOE2026展台交换机选型与配置实操:从光模块到AI集群的现场验证

CIOE2026的展台上要摆一台交换机,这在三年前几乎是不可想象的事。光通信展区的主角向来是光模块、硅光芯片、相干DSP,交换机最多在角落当个背景板。但这几年风向变了,AI集群、数据中心互联、CPO光电共封装全都要靠交换机来验证价值——谁家的…

阅读更多 →
银河麒麟V10 SSH安装配置与故障排查实战 2026/10/1 11:10:02

银河麒麟V10 SSH安装配置与故障排查实战

1. 银河麒麟 V10 上的一套 SSH 究竟由哪些东西组成很多人第一次接触银河麒麟 V10 的远程运维,脑子里只有一句"要用 SSH 连上去",但真到机器上敲命令的时候才发现,SSH 其实不是"一个软件",而是一组工具的集合。…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉