论文arxiv cs.CL · 3w ago重要
The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
分类释义:学术论文 / 技术报告
TL;DR
研究发现LLM在道德判断中表现出的「yes-no偏差」并非价值观偏移,而是可分解的人为产物:选项顺序偏好(朝向最后打印的选项,与人类相反)和词汇「no」的吸引力。Claude模型此偏差显著(-0.32至-0.86),GPT-5.5和Gemini几乎为零。
关键要点
- 01研究发现LLM在道德判断中表现出的「yes-no偏差」并非价值观偏移。
- 02而是可分解的人为产物:选项顺序偏好(朝向最后打印的选项。
- 03与人类相反)和词汇「no」的吸引力。
- 04Claude模型此偏差显著(-0.32至-0.86)。
为什么值得关注
工程团队在做模型道德判断评估时,单次提问会被人为因素严重干扰——需要用交叉框架设计(balanced pairs)来分离真实立场和格式artifact。对Claude用户来说,这个偏差在实际对话中可能影响用户体验评估结果。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 更新模型评估标准文档,要求所有道德判断类测试必须包含balanced pairs设计 |
| 应用工程师 | 避免在关键决策功能中使用单次LLM道德判断结果,改为多次交叉提问取共识 |
| 运维 / 平台 | 暂无直接影响,了解即可 |
| 产品 / 业务 | 审查依赖Claude道德判断的用户调研结果,确认是否考虑了答案顺序和用词的artifact干扰 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5