模型arxiv cs.LG · 2w ago重要

Sticky Routing: Training MoE Models for Memory-Efficient Inference

分类释义:新模型发布或升级

TL;DR

StickyMoE 通过在训练阶段引入可微分路由一致性损失,将连续 token 的专家切换率降低 60%,同时保持 perplexity 损失小于 4%。

关键要点

  • 01StickyMoE 通过在训练阶段引入可微分路由一致性损失
  • 02将连续 token 的专家切换率降低 60%
  • 03同时保持 perplexity 损失小于 4%
为什么值得关注

在边缘设备部署 MoE 模型时,专家频繁切换会导致权重在慢速存储和快速内存间反复交换,StickyMoE 无需改变模型架构,只需调一个超参数 lambda,就能让路由器在语义连贯的 token 跨度内保持同一专家分配,工程师可以在训练阶段就解决这个部署瓶颈,而不是事后打补丁。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估团队现有 MoE 项目是否面临边缘部署的权重交换瓶颈,决定是否在训练流程中引入 StickyMoE
应用工程师若使用 MoE 模型进行边缘部署,在训练脚本中加入 StickyMoE 的路由一致性损失,设置 lambda 超参数调优
运维 / 平台暂无直接影响,了解即可——该优化在训练阶段完成,部署侧无感知变化
产品 / 业务暂无直接影响,了解即可——属于底层训练优化,不直接改变功能或交互
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5