论文arxiv cs.CL · 3w ago重要
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
分类释义:学术论文 / 技术报告
TL;DR
DeepSearch-World 提供 42 万可验证的多跳问答任务环境,DeepSearch-Evolve 框架通过自蒸馏(无需更强教师模型)训练 9B 模型,在 BrowseComp/GAIA/HotpotQA 上分别达到 31.2%/61.5%/93.4%。
关键要点
- 01DeepSearch-World 提供 42 万可验证的多跳问答任务环境。
- 02DeepSearch-Evolve 框架通过自蒸馏(无需更强教师模型)训练 9B 模型。
- 03在 BrowseComp/GAIA/HotpotQA 上分别达到 31.2%/61.5%/93.4%。
为什么值得关注
可验证环境解决了 Agent 训练中「无法判断答案正确性导致无法自改进」的核心痛点——工程师可借鉴「环境可验证 → 轨迹筛选 → 自蒸馏」这条 pipeline,直接在自己的垂直场景构建小规模可验证数据集,无需依赖 GPT-5 等外部大模型蒸馏。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估「环境可验证→轨迹筛选→自蒸馏」pipeline 是否适用于团队当前 Agent 项目的训练需求 |
| 应用工程师 | 查看 DeepSearch-Evolve GitHub 仓库,了解 9B 模型在多跳问答场景的 API 调用方式和效果 |
| 运维 / 平台 | 评估 42 万任务数据规模对存储和训练资源的需求,规划可验证数据集的构建基础设施 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5