论文arxiv cs.LG · 1mo ago重要

Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models

分类释义:学术论文 / 技术报告

TL;DR

循环语言模型中每循环交叉熵损失只控制读出层暴露的变量,RMSNorm 等尺度不变读出会隐藏隐藏状态的径向尺度,导致最终隐藏状态范数膨胀到数千。

关键要点

  • 01循环语言模型中每循环交叉熵损失只控制读出层暴露的变量
  • 02RMSNorm 等尺度不变读出会隐藏隐藏状态的径向尺度
  • 03导致最终隐藏状态范数膨胀到数千
为什么值得关注

这解释了为何某些循环/Agent架构训练不稳定(隐藏状态数值爆炸),设计规则是让尺度对损失可见或从循环中移除,可直接用于优化 Recurrent Transformer 或 Memory-augmented Agent 的架构选择。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead审查团队正在使用的循环/Agent架构,评估是否采用了RMSNorm等尺度不变读出机制
应用工程师检查循环Transformer或Memory-augmented架构中隐藏状态的范数变化,警惕数值膨胀导致的训练不稳定
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5