MIT 等团队发现 LLM 在 prefill 阶段已把决策结论写入 KV cache,字段自身的 key/value 对最终决策影响不到 1%,使得 KV cache 可被编辑(修正错误)和组合(RoPE 重定位拼接预编译 skill),实现 14.9x 延迟降低和 53-398x TTFT 提升。 创意点:推理引擎可直接复用前缀缓存同时支持局部动态更新,vLLM 在线测试保持 98.5% 命中率;Agent 开发者可将高频 skill 预编译为 KV cache,通过位置重定位实现跨场景复用,无需重计算。 原文:https://arxiv.org/abs/2606.17107
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。