Google 发布 JAXBench——首个 TPU 原生内核优化基准套件(50 个 JAX 工作负载),测试发现针对 TPU 文档的上下文条件可将 Pallas 内核正确率从 5.8% 提升至 37.3%,Autocomp 的 beam-search 方案相比 XLA 达到 1.36x 几何平均加速。 创意点:对 TPU 推理基础设施团队,这项工作填补了 GPU 有 OSQuery 但 TPU 无基准的空白,且发现「上下文相关性 > 模型规模」的规律可直接用于改进内部代码生成 pipeline——在喂入 Pallas DSL 专项文档后,Gemini 3 Flash 的内核生成质量显著提升。 原文:https://arxiv.org/abs/2607.20466
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。