MIT 等提出 GMA,用 K 个高斯混合组件的路由机制替代显式 Q-K 比较,将注意力内存复杂度从 O(N²) 降到 O(NK),同时保持端到端可微。 创意点:长上下文推理是当前模型部署的核心瓶颈,固定 K 的线性内存 scaling 使 GMA 天然适合超长序列任务。工程师可借鉴「软聚类路由」思路:在现有 Transformer 中插入 GMA 层处理局部上下文(如代码 diff、文档分段),用 Mamba/SDPA 处理全局依赖,实现精度与速度的帕累托最优。 原文:https://arxiv.org/abs/2606.18283
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。