论文arxiv cs.LG · 1mo ago必读
Models Take Notes at Prefill: KV Cache Can Be Editable and Composable
分类释义:学术论文 / 技术报告
TL;DR
MIT 等团队发现 LLM 在 prefill 阶段已把决策结论写入 KV cache,字段自身的 key/value 对最终决策影响不到 1%,使得 KV cache 可被编辑(修正错误)和组合(RoPE 重定位拼接预编译 skill),实现 14.9x 延迟降低和 53-398x TTFT 提升。
关键要点
- 01MIT 等团队发现 LLM 在 prefill 阶段已把决策结论写入 KV cache。
- 02字段自身的 key/value 对最终决策影响不到 1%。
- 03使得 KV cache 可被编辑(修正错误)和组合(RoPE 重定位拼接预编译 skill)。
- 04实现 14.9x 延迟降低和 53-398x TTFT 提升。
为什么值得关注
推理引擎可直接复用前缀缓存同时支持局部动态更新,vLLM 在线测试保持 98.5% 命中率;Agent 开发者可将高频 skill 预编译为 KV cache,通过位置重定位实现跨场景复用,无需重计算。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估将 KV cache 预编译能力纳入推理架构设计的可行性 |
| 应用工程师 | 梳理高频重复使用的 prompt 或 skill,尝试基于 vLLM 实现 KV cache 预编译 |
| 运维 / 平台 | 跟进 vLLM 0.7.x 版本对可编辑 KV cache 的支持,计划灰度验证 98.5% 命中率 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5