模型arxiv cs.CL · 4d ago重要
Learning When to Reason for Text-to-SQL via SFT and DPO
分类释义:新模型发布或升级
TL;DR
AutoThinkSQL 通过 SFT+DPO 训练,让 Qwen3-Coder-30B-A3B 能动态判断何时跳过 CoT 推理,Spider 和 BIRD 基准上保持精度同时将输出 token 减少 18-25%、延迟降低 11-17%。
关键要点
- 01AutoThinkSQL 通过 SFT+DPO 训练。
- 02让 Qwen3-Coder-30B-A3B 能动态判断何时跳过 CoT 推理。
- 03Spider 和 BIRD 基准上保持精度同时将输出 token 减少 18-25%、延迟降低 11-17%。
为什么值得关注
这个框架把「何时深度推理」的决策内化到模型权重,而非靠规则/分类器过滤。工程师可以借鉴 SFT+DPO 自适应推理的 pipeline,复用到代码生成、数学推导、Agent 多步任务等 CoT 成本高的场景,直接降低线上推理费用。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估将自适应推理框架纳入技术选型,重点关注 SFT+DPO pipeline 对团队 AI 能力建设的长期价值 |
| 应用工程师 | 在代码生成或 Agent 任务中尝试复现「自适应跳过 CoT」逻辑,观察实际 token 节省效果 |
| 运维 / 平台 | 测算 CoT 推理成本占比,若高于 30% 则值得引入类似的自适应推理机制降低线上推理费用 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5