模型arxiv cs.LG · 1mo ago重要

Gaussian Mixture Attention: Linear-Time Sequence Mixing via Probabilistic Latent Routing

分类释义:新模型发布或升级

TL;DR

MIT 等提出 GMA,用 K 个高斯混合组件的路由机制替代显式 Q-K 比较,将注意力内存复杂度从 O(N²) 降到 O(NK),同时保持端到端可微。

关键要点

  • 01MIT 等提出 GMA
  • 02用 K 个高斯混合组件的路由机制替代显式 Q-K 比较
  • 03将注意力内存复杂度从 O(N²) 降到 O(NK)
  • 04同时保持端到端可微
为什么值得关注

长上下文推理是当前模型部署的核心瓶颈,固定 K 的线性内存 scaling 使 GMA 天然适合超长序列任务。工程师可借鉴「软聚类路由」思路:在现有 Transformer 中插入 GMA 层处理局部上下文(如代码 diff、文档分段),用 Mamba/SDPA 处理全局依赖,实现精度与速度的帕累托最优。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将 GMA 路由机制作为长上下文场景的技术备选方案
应用工程师在代码 diff、文档分段等局部上下文场景中尝试集成 GMA 层
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5