工具arxiv cs.LG · 2mo ago重要

BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization

分类释义:开发工具与基础设施

TL;DR

BitsMoE 通过 SVD 分解将 MoE 层拆分为共享基和专家专属谱因子,再结合激活感知的整数线性规划实现精细化混合精度量化,在 Qwen3-30B-A3B 的 2-bit 量化下比 GPTQ 快 12.3 倍、准确率提升 27.83 个百分点、解码速度提升 1.76 倍。

关键要点

  • 01BitsMoE 通过 SVD 分解将 MoE 层拆分为共享基和专家专属谱因子
  • 02再结合激活感知的整数线性规划实现精细化混合精度量化
  • 03在 Qwen3-30B-A3B 的 2-bit 量化下比 GPTQ 快 12.3 倍、准确率提升 27.83 个百分点、解码速度提升 1.76 倍
为什么值得关注

MoE 模型全量专家常驻内存导致部署成本极高,BitsMoE 提供的谱能量化思路可以直接借鉴——对专家层做 SVD 分解后保留共享基(不量化)再对谱因子做 ILP 优化的混合精度分配,工程团队可用此框架实现 Ultra-low bit 场景下的 MoE 高效部署。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将 BitsMoE 纳入模型压缩技术栈的可行性,重点对比现有 GPTQ/QAT 方案
应用工程师跟进 BitsMoE 开源代码仓,准备在 Qwen3-30B-A3B 上复现 2-bit 量化实验流程
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5