模型arxiv cs.LG · 3w ago重要

TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation

分类释义:新模型发布或升级

TL;DR

TriRoute 提出用一个统一轻量控制器联合决策注意力模式、MoE 专家选择和 KV-cache 量化精度,在 160M-1.3B 模型上实现 FLOPs 和内存的帕累托最优。

关键要点

  • 01TriRoute 提出用一个统一轻量控制器联合决策注意力模式、MoE 专家选择和 KV-cache 量化精度
  • 02在 160M-1.3B 模型上实现 FLOPs 和内存的帕累托最优
为什么值得关注

该工作证明了注意力分辨率、专家选择和 cache 精度三个决策高度耦合,联合优化优于分别调优。工程师可借鉴其 heterogeneous relaxation(Gumbel-Softmax + load-balanced gating)和 Lagrangian 约束训练框架,将推理预算作为可调参数直接控制;产品侧可将「句子开头/专有名词/稀有词」分配高注意力+高精度 cache,「功能词」轻量路由的策略直接用于构建端侧 LLM 的自适应推理引擎。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估是否在自研 MoE 架构中引入 TriRoute 的联合路由框架,对比独立调优模块的工程复杂度
应用工程师看 TriRoute 开源代码,理解 Gumbel-Softmax + load-balanced gating 在实际推理时的实现细节
运维 / 平台评估 KV-cache 分级量化对显存占用的影响,计算现有集群的推理密度提升空间
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5