论文arxiv cs.CL · 3w ago重要

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

分类释义:学术论文 / 技术报告

TL;DR

DeepSearch-World 提供 42 万可验证的多跳问答任务环境,DeepSearch-Evolve 框架通过自蒸馏(无需更强教师模型)训练 9B 模型,在 BrowseComp/GAIA/HotpotQA 上分别达到 31.2%/61.5%/93.4%。

关键要点

  • 01DeepSearch-World 提供 42 万可验证的多跳问答任务环境
  • 02DeepSearch-Evolve 框架通过自蒸馏(无需更强教师模型)训练 9B 模型
  • 03在 BrowseComp/GAIA/HotpotQA 上分别达到 31.2%/61.5%/93.4%
为什么值得关注

可验证环境解决了 Agent 训练中「无法判断答案正确性导致无法自改进」的核心痛点——工程师可借鉴「环境可验证 → 轨迹筛选 → 自蒸馏」这条 pipeline,直接在自己的垂直场景构建小规模可验证数据集,无需依赖 GPT-5 等外部大模型蒸馏。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7
角色你应该做什么
Tech Lead评估「环境可验证→轨迹筛选→自蒸馏」pipeline 是否适用于团队当前 Agent 项目的训练需求
应用工程师查看 DeepSearch-Evolve GitHub 仓库,了解 9B 模型在多跳问答场景的 API 调用方式和效果
运维 / 平台评估 42 万任务数据规模对存储和训练资源的需求,规划可验证数据集的构建基础设施
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5