研究对比 Turbo-Quant 和 SpectralQuant 等 KV-Cache 压缩方法,发现基于特征基的方法在重尾分布数据上因协方差不稳定而失效,但在结构化场景下表现良好,有效语义维度取决于校准预算而非真实数据秩。 创意点:工程团队在做 LLM 推理优化时,选压缩策略应优先分析数据分布尾部特征而非只看 rank;可据此设计数据自适应管道,在重尾输入时切换到旋转量化方案。 原文:https://arxiv.org/abs/2607.09683
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。