论文arxiv cs.CL · 1w ago重要

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

分类释义:学术论文 / 技术报告

TL;DR

研究发现 SFT 微调会显著降低 LLM 在棋盘游戏中的行动多样性,且这种多样性崩溃程度超过准确性-多样性权衡所需的最低程度。

关键要点

  • 01研究发现 SFT 微调会显著降低 LLM 在棋盘游戏中的行动多样性
  • 02且这种多样性崩溃程度超过准确性-多样性权衡所需的最低程度
为什么值得关注

对于构建 LLM Agent 的工程师来说,这意味着微调后的模型可能在决策时变得可预测甚至陷入局部最优。论文提出的「行动增强」(训练时包含所有最优动作而非单一示范动作)是一个可执行的技术方案,建议在微调决策类模型时采用。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead在模型微调评估标准中新增「行动多样性」指标,避免只关注准确率
应用工程师对决策类模型采用「行动增强」训练方式——训练时包含所有等优动作而非单一示范
运维 / 平台暂无直接影响,了解即可
产品 / 业务在涉及 Agent 决策能力的验收场景中,增加行为多样性的测试用例
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5