论文arxiv cs.LG · 1mo ago必读

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

分类释义:学术论文 / 技术报告

TL;DR

MIT 等团队发现 LLM 在 prefill 阶段已把决策结论写入 KV cache,字段自身的 key/value 对最终决策影响不到 1%,使得 KV cache 可被编辑(修正错误)和组合(RoPE 重定位拼接预编译 skill),实现 14.9x 延迟降低和 53-398x TTFT 提升。

关键要点

  • 01MIT 等团队发现 LLM 在 prefill 阶段已把决策结论写入 KV cache
  • 02字段自身的 key/value 对最终决策影响不到 1%
  • 03使得 KV cache 可被编辑(修正错误)和组合(RoPE 重定位拼接预编译 skill)
  • 04实现 14.9x 延迟降低和 53-398x TTFT 提升
为什么值得关注

推理引擎可直接复用前缀缓存同时支持局部动态更新,vLLM 在线测试保持 98.5% 命中率;Agent 开发者可将高频 skill 预编译为 KV cache,通过位置重定位实现跨场景复用,无需重计算。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将 KV cache 预编译能力纳入推理架构设计的可行性
应用工程师梳理高频重复使用的 prompt 或 skill,尝试基于 vLLM 实现 KV cache 预编译
运维 / 平台跟进 vLLM 0.7.x 版本对可编辑 KV cache 的支持,计划灰度验证 98.5% 命中率
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5