论文arxiv cs.CL · 1mo ago重要

The Coin Flip Judge? Reliability and Bias in LLM-as-a-Judge Evaluation

分类释义:学术论文 / 技术报告

TL;DR

研究发现 LLM-as-a-Judge 在相同输入下 pairwise 判断平均有 13.6% 的偏好翻转率,28% 问题超过 20%,且存在显著的首位偏差(72% 偏向排在前面的选项),即使 pointwise 分数差很小时仍会选择胜负双方。

关键要点

  • 01研究发现 LLM-as-a-Judge 在相同输入下 pairwise 判断平均有 13.6% 的偏好翻转率
  • 0228% 问题超过 20%
  • 03且存在显著的首位偏差(72% 偏向排在前面的选项)
  • 04即使 pointwise 分数差很小时仍会选择胜负双方
为什么值得关注

当前许多公司用 LLM 裁判做模型排名、RLHF reward model 训练和公开 leaderboard 填充,单次评估太 noisy 了。工程师可以借鉴的做法:1)对高风险评估强制 multi-trial 投票(本研究建议至少 11 次);2)随机化选项顺序并显式报告置信度;3)在 benchmark 论文中披露翻转率而非只报均值。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead更新内部评估协议,强制高风险场景使用 multi-trial 投票(至少 11 次)并记录翻转率
应用工程师在使用 LLM-as-a-Judge 时实现随机化选项顺序,并在结果中显式标注置信度而非仅返回胜负结论
运维 / 平台在评估流水线中增加选项顺序随机化功能和重复采样统计模块,支持置信度聚合输出
产品 / 业务暂未直接影响,了解即可
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5