研究发现 GPT-2 规模语言模型无法在测试时独立泛化出「零」概念,但经数十至数百样本微调后可学会,且语言预训练能将所需样本量减少约 50%。 创意点:研究量化了 LLM 数学发现的「冷启动」成本——纯推理无法突破训练分布,但对齐人类认知的语言能力确实能 scaffold 数学泛化。产品层面可启发设计「渐进式数学概念注入」的训练 pipeline,而非期待模型自主发现基础概念。 原文:https://arxiv.org/abs/2606.17289
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。