CaRE 是一个计算感知的 MDLM 评估框架,发现当前 7 种重掩码策略的排名在控制 NFE 和温度后会被反转,且温度是 MAUVE 指标方差的主要来源。 创意点:这篇论文揭示了 MDLM 评估中被忽视的系统性 confound——温度和计算量控制缺失可能导致错误的策略结论。工程师在做 diffusion language model 选型时,应使用 CaRE 的标准化 NFE + 温度对照方法替代单点对比;产品可考虑在评测报告中强制要求 NFE-temperature 帕累托前沿图。 原文:https://arxiv.org/abs/2607.24763
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。