论文arxiv cs.CL · 3w ago重要

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

分类释义:学术论文 / 技术报告

TL;DR

研究发现LLM在道德判断中表现出的「yes-no偏差」并非价值观偏移,而是可分解的人为产物:选项顺序偏好(朝向最后打印的选项,与人类相反)和词汇「no」的吸引力。Claude模型此偏差显著(-0.32至-0.86),GPT-5.5和Gemini几乎为零。

关键要点

  • 01研究发现LLM在道德判断中表现出的「yes-no偏差」并非价值观偏移
  • 02而是可分解的人为产物:选项顺序偏好(朝向最后打印的选项
  • 03与人类相反)和词汇「no」的吸引力
  • 04Claude模型此偏差显著(-0.32至-0.86)
为什么值得关注

工程团队在做模型道德判断评估时,单次提问会被人为因素严重干扰——需要用交叉框架设计(balanced pairs)来分离真实立场和格式artifact。对Claude用户来说,这个偏差在实际对话中可能影响用户体验评估结果。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7
角色你应该做什么
Tech Lead更新模型评估标准文档,要求所有道德判断类测试必须包含balanced pairs设计
应用工程师避免在关键决策功能中使用单次LLM道德判断结果,改为多次交叉提问取共识
运维 / 平台暂无直接影响,了解即可
产品 / 业务审查依赖Claude道德判断的用户调研结果,确认是否考虑了答案顺序和用词的artifact干扰
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5