论文arxiv cs.CL · 2mo ago重要
Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs
分类释义:学术论文 / 技术报告
TL;DR
LLM diversity collapse源于两种校准失败:有效token的排序不可靠(order miscalibration),以及概率质量过度集中于少数输出(shape miscalibration)。
关键要点
- 01LLM diversity collapse源于两种校准失败:有效token的排序不可靠(order miscalibration)。
- 02以及概率质量过度集中于少数输出(shape miscalibration)。
为什么值得关注
这意味着 diversity 问题根植于模型分布本身,而非采样方法可解决,对创意生成、科学发现等应用的设计和评估方式有根本性影响。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 在LLM选型评估体系中增加校准指标(order calibration / shape calibration) |
| 应用工程师 | 放弃通过temperature/top-p调整解决多样性的思路,转向应用层补偿(如n-shot prompting重排或rerank机制) |
| 运维 / 平台 | 在模型评测流程中补充diversity collapse的回归测试用例,监控新版本模型的校准变化 |
| 产品 / 业务 | 重新定义LLM应用的成功指标,纳入输出多样性维度而非仅看质量分数 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5