工具arxiv cs.LG · 1w ago重要
Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels
分类释义:开发工具与基础设施
TL;DR
研究发现当前 tensor kernel 测试的容差阈值普遍过于宽松,通过分析 8,076 行 GPU 真实运行数据,自动校准的 atol 可将 attention_triton fp16 收紧 2,184 倍,并将 LLM bug 检测率从 73.2% 提升至 82.4%。
关键要点
- 01研究发现当前 tensor kernel 测试的容差阈值普遍过于宽松。
- 02076 行 GPU 真实运行数据。
- 03自动校准的 atol 可将 attention_triton fp16 收紧 2。
- 04并将 LLM bug 检测率从 73.2% 提升至 82.4%。
为什么值得关注
当前 AI 框架的 kernel 测试容差是手工设定且长期不更新的,这导致大量 bug 漏检。该研究提供了数据驱动的校准方法,推理引擎团队可直接借鉴来构建自动化容差回归测试。创意点:在 CI 流程中加入基于历史误差分布的动态 tolerance 自动调优。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估将动态容差校准引入团队测试体系的技术可行性与 ROI |
| 应用工程师 | 在现有 kernel 测试中引入基于历史误差分布的自动 atol 校准流程 |
| 运维 / 平台 | 在 CI 流水线中集成 tolerance 自动调优模块,替代手工设定的固定阈值 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
arxiv cs.LG·1d ago
Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding
arxiv cs.CL·1d ago
Prompt Chaining in Practice: A Case Study in Automated Scholarly Report Generation
arxiv cs.CL·1d ago
AI-assisted pre-review of open-source software submissions: an experience report from BOSC 2026
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5