研究发现当前 tensor kernel 测试的容差阈值普遍过于宽松,通过分析 8,076 行 GPU 真实运行数据,自动校准的 atol 可将 attention_triton fp16 收紧 2,184 倍,并将 LLM bug 检测率从 73.2% 提升至 82.4%。 创意点:当前 AI 框架的 kernel 测试容差是手工设定且长期不更新的,这导致大量 bug 漏检。该研究提供了数据驱动的校准方法,推理引擎团队可直接借鉴来构建自动化容差回归测试。创意点:在 CI 流程中加入基于历史误差分布的动态 tolerance 自动调优。 原文:https://arxiv.org/abs/2607.16228
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。