HyperAIHyperAI

Command Palette

Search for a command to run...

DeepSearch-World:面向可验证环境中深度搜索代理的自蒸馏方法

Xinyu Geng Xuanhua He Sixiang Chen Yanjing Xiao Fan Zhang Shijue Huang Haitao Mi Zhenwen Liang Tianqing Fang Yi R. Fung

摘要

训练工具使用型代理从自身经验中持续改进仍具挑战,因为监督微调依赖固定的教师蒸馏轨迹,而稀疏奖励强化学习为长程交互提供的监督信号较弱。我们提出 DeepSearch-Evolve,一个基于 DeepSearch-World 构建的网页代理自蒸馏框架。DeepSearch-World 是一个确定性、可验证的环境,配备可复现的搜索与页面阅读工具,包含 42 万条由实体级随机游走构造的多跳问答任务,并支持对自进化至关重要的代理认知行为,包括进度验证、有依据的反思和失败恢复。DeepSearch-Evolve 迭代执行轨迹生成、过滤、数据混合与微调,以训练更强的代理。在未借助更强模型蒸馏的情况下,DeepSearch-World-9B 取得了与开源代理相比具有竞争力的表现,在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%,表明可验证环境能够支撑长程网页代理的可扩展自进化。我们将发布环境、42 万条训练池、验证集、模型和代码,以促进自改进深度搜索代理的未来研究。

一句话总结

来自香港科技大学、腾讯和香港科技大学(广州)的研究人员提出了 DeepSearch-Evolve,一个自蒸馏框架,在可验证的 DeepSearch-World 环境中迭代生成、过滤、混合和微调轨迹,无需依赖更强的教师模型,使 DeepSearch-World-9B agent 在 BrowseComp(31.2%)、GAIA(61.5%)和 HotpotQA(93.4%)上取得具有竞争力的结果,从而展示了长时程 web agent 的可扩展自进化能力。

核心贡献

  • DeepSearch-World 被引入作为一个确定性、可验证的离线环境,用于深度搜索 agent,提供可复现的观察结果、实体级进度验证,以及基于 Wikipedia 的 420K 多跳问答任务。
  • 提出了 Scaffold 过程监督,其中教师 agent 显式地跟踪进度、证据、失败尝试和恢复,这些 scaffold 轨迹被转换为 ReAct 格式的训练数据,从而将规划、记忆跟踪、有根据的反思和失败恢复注入学生 agent。
  • DeepSearch-Evolve 是一个迭代自蒸馏框架,利用已验证的过程信号生成和过滤轨迹,然后微调 agent,从而无需从更强的模型蒸馏即可实现改进。最终得到的 DeepSearch-World-9B 在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%。

引言

作者们致力于解决一个关键挑战:使基于 LLM 的工具使用 agent 能够从自身交互中自主改进,这是可扩展自进化 agent 能够规划、搜索、浏览和利用工具推理的核心要求。先前的自改进管线在基于静态正轨迹进行微调时会饱和,强化学习中稀疏的轨迹级奖励缺乏细粒度指导,而在线策略自蒸馏中不可靠的密集监督则因工具使用场景下教师模型的步骤级分布存在噪声。为克服这些问题,作者引入了 DeepSearch-World,一个基于 Wikipedia 的确定性、可验证的离线环境,具有实体级进度验证功能,以及 DeepSearch-Evolve 框架,该框架捕获 scaffold 过程监督(规划、记忆、失败恢复)并将其转换为 ReAct 格式的数据,用于迭代训练学生 agent。这使得开源 agent 能够从已验证的工具使用经验中改进,而无需依赖更强专有模型生成的合成轨迹。

数据集

作者构建了一个大规模多跳问答数据集和一个对应的离线 Wikipedia 环境,以支持可扩展的自蒸馏。

  • 数据集组成和来源

    • 一个包含 420K 实例的 QA 池,从 Wikipedia 超链接图上的实体级随机游走中采样得到。每个实例都模糊了显式实体提及,要求 agent 通过推理、搜索查询修正和证据发现来恢复目标实体。
    • 一个离线语料库 C,包含约 1000 万条 Wikipedia 条目(标题、摘要和全文),爬取自 QA 池中出现的所有目标实体的并集。这确保了所有必需证据是自包含且可检索的。
    • 一个留出的验证集 DeepSearch-Val,包含 377 个高质量实例,由五位专家组成的专家池验证(每个实例至少三位专家)。这些实例被排除在轨迹生成和模型训练之外。
  • 各子集的关键细节

    • QA 池(420K 实例):基于 Wikipedia 图上的 H 跳随机游走构建;问题通过掩盖实体提及自动生成。除随机游走采样外,未应用显式过滤,从而产生了广泛的推理路径、失败模式和恢复模式分布。
    • 离线语料库(约 1000 万条目):爬取的 QA 池目标实体的 Wikipedia 页面。每条记录为结构化条目,包含标题、摘要和文章正文。语料库是确定性和静态的,作为环境的知识库。
    • DeepSearch-Val(377 个实例):从 QA 池中筛选,仅包含其证据完全被离线语料库覆盖且可通过提供的搜索和访问工具检索的实例。答案由多位专家独立验证,适合进行可靠的行为分析和验证。
  • 数据的使用方式

    • 完整的 QA 池(减去 DeepSearch-Val)用于实例化 DeepSearch-World 环境。agent 在此确定性离线设置中生成轨迹,这些轨迹用于自蒸馏训练。
    • 除 377 个留出实例外,未提及显式的训练/验证集划分比例;剩余的约 420K 实例构成轨迹生成的训练池。
    • 离线语料库是静态知识库;agent 通过搜索和访问工具与其交互,但语料库本身不进行划分。
  • 处理和元数据构建

    • 从 Wikipedia 超链接图中采样长度为 H 的随机游走。每条游走定义了一组目标实体链;通过模糊显式实体提及形成问题,将游走转化为多跳推理任务。
    • 对于每个 QA 实例,识别目标实体集,并爬取相应的 Wikipedia 页面构建离线语料库。语料库条目以标题、摘要和全文结构化。
    • 验证集通过筛选实例得到,要求所需证据被语料库覆盖且可通过工具访问,随后由专家验证答案(每个实例至少三位专家)。未提及进一步裁剪或数据增强。

方法

作者提出了 DeepSearch-Evolve,一个面向搜索 agent 的自蒸馏框架,旨在通过迭代自进化实现改进。该系统包含一个可验证的工具环境、一个用于生成高质量轨迹的 scaffold 教师 agent,以及一个迭代训练循环。

如框架图所示:

可验证的工具环境与数据构建 为支持可扩展的自蒸馏,作者构建了 DeepSearch-World,一个确定性离线 Wikipedia 环境。他们从 Wikipedia 超链接图 G=(V,E)\mathcal{G} = (\mathcal{V}, \mathcal{E})G=(V,E) 中采样实体级随机游走 τ=(v1,,vH)\tau = (v_1, \dots, v_H)τ=(v1,,vH),以定义 H 跳推理链。这一过程产生了 420,000 个多跳 QA 实例,其中显式实体提及被模糊处理,迫使 agent 通过推理和搜索恢复目标。该环境基于一个包含约 1000 万 Wikipedia 条目的本地语料库,确保所有必需证据可搜索且可验证。

环境暴露两个与标准 web agent 工作流对齐的离线工具。搜索工具 web_search_wiki 作为一个确定性检索函数,使用 BM25 索引返回页面标题、摘要和 URL。访问工具 visit_wiki 通过 SQLite 索引将 URL 映射到全文。

为促进从失败中学习,环境实现了基于环境的反思。对每个问题,存储一个 ground-truth 实体集。在 rollout 过程中,若工具响应匹配某个未解决的实体,则验证进度。失败的调用触发分阶段的基于规则的反思,最初提供通用的修正信号,重复失败时则提供更强指导,如规范名称。这创建了有根据的搜索、失败、反思和重试轨迹。

Scaffold 教师 Agent 为生成高质量监督数据,作者采用了一个 scaffold 教师 agent,其运行分为三个阶段:Plan、Act 和 End。此 scaffold 显式地监督轨迹生成过程中的规划、记忆和错误恢复。

如下图所示:

在 Plan 阶段,给定问题 qqq,教师初始化一个结构化的进度状态 s0s_0s0,包含已完成子目标、待处理动作、失败教训和已提取证据等字段。在 Act 阶段,教师在最大预算内执行交互步骤。在第 ttt 步,它选择一个工具调用 ata_tat,接收观察 oto_tot,并通过 st+1=U(st,at,ot,rt)s_{t+1} = \mathcal{U}(s_t, a_t, o_t, r_t)st+1=U(st,at,ot,rt) 更新状态,其中 rtr_trt 是环境提供的反思。在 End 阶段,教师基于已验证的工作记忆生成简洁的答案。

一个示例过程阐明了教师如何分解模糊的多跳问题,交替使用工具,用已验证的证据更新工作记忆,并利用基于环境的反思从失败的搜索中恢复。

如下图所示:

自进化训练循环 DeepSearch-Evolve 采用迭代循环,当前模型 πθR\pi_{\theta_R}πθR 作为教师生成轨迹,然后用于训练学生 πθR+1\pi_{\theta_{R+1}}πθR+1

首先,生成并验证轨迹。作者保留答案正确的轨迹,并应用轨迹级过滤,去除冗余证据和不一致的推理。

其次,进行 scaffold 到 ReAct 的转换。由于目标是训练一个可部署的、独立于外部规划提示的 ReAct agent,因此移除 scaffold 结构。进度状态和反思被重写入助手推理轨迹。对于每个工具使用步骤 ttt,目标思考块被构造为:

thinkt=PtRtAt\langle \text{think} \rangle_t = P_t \oplus R_t \oplus A_tthinkt=PtRtAt

其中,PtP_tPt 总结进度状态,包括已完成的子目标、待处理的目标、失败搜索的经验和已验证的证据。RtR_tRt 将环境反思重写为自我修正,AtA_tAt 保留动作 ata_tat 的理由。

最后,模型进行有监督的自蒸馏更新。作者采用进化式 SFT 以保证长时程工具使用中的稳定性。给定一个已验证的轨迹 τ~=(x,y1:T)\tilde{\tau} = (x, y_{1:T})τ~=(x,y1:T),SFT 损失最小化负对数似然:

LSFT(θ)=Eτ~D~(R)t=1TKL(δytπθ(x,y<t))\mathcal{L}_{\text{SFT}}(\theta) = \mathbb{E}_{\tilde{\tau} \sim \widetilde{\mathcal{D}}(R)} \sum_{t=1}^{T} \text{KL}(\delta_{y_t} \parallel \pi_{\theta}(\cdot \mid x, y_{<t}))LSFT(θ)=Eτ~D(R)t=1TKL(δytπθ(x,y<t))

该方法从当前 agent 采样 scaffold rollout,过滤后转换为 ReAct 轨迹,以监督规划和工具调用,而无需依赖对未验证状态的逐 token 指导。

实验

评估覆盖了七个深度搜索和推理基准,在迭代生成、过滤和蒸馏环境验证轨迹的训练设置下,将自进化的 DeepSearch-World-9B 与专有和开源 agent 进行比较。该模型仅通过自身已验证的 rollout 进行优化,取得了具有竞争力的性能,并相对于其基础骨架持续提升,展现出更长的多步交互、更强的证据基础以及更有效的工具使用策略。分析表明,大规模且多样化的数据池,结合拒绝采样和质量过滤,对于稳定的自我改进至关重要,而反思重写和状态内部化是将 scaffold 轨迹转换为高质量训练数据的关键。这些结果表明,确定性环境验证可以取代外部教师监督,通过迭代自蒸馏实现稳健的 agent 技能迁移。

DeepSearch-World-9B 完全通过自身环境验证的 rollout 优化,大幅超越其基础模型,并在深度搜索基准上达到具有竞争力的开源性能。在六个基准上 23.8 到 48.1 个百分点的提升表明,从已验证的轨迹进行自蒸馏可以学习可迁移的工具使用行为,尽管仅限英语训练限制了跨语言迁移。该模型还进行了更长、更扎实的工具使用循环,平均 18.0 轮,而基础模型仅为 4.7 轮。DeepSearch-World-9B 在 BrowseComp 上比 Qwen3.5-9B-Instruct 提升 23.8 个百分点,在 GAIA 上提升 37.6 个百分点,无需更强的教师模型或合成管线。其平均工具使用轮数保持在 18.0 轮,而基础模型仅 4.7 轮后即终止,且访问调用为 5.4 次,基础模型为 0.9 次,表明更强的证据依赖。高级能力得分(涵盖规划、记忆、推理、自我修正和证据收集)从基础模型的 19% 提升至 DeepSearch-World-9B 的 70%。

@@P2P_BLOCK_7@@

同时移除拒绝采样和质量过滤导致最低的 SearchQA 分数。仅选择答案正确的轨迹的拒绝采样提供了主要收益,而轨迹质量过滤增加了较小的改进。结合两种技术达到了最高准确率,优于 SDAR 和 Skill-SD 等替代方法,表明已验证的轨迹过滤是更有效的自蒸馏策略。单独使用拒绝采样相较于未过滤基线显著提升了 SearchQA,证实答案正确性验证是自蒸馏的关键保障。在拒绝采样之上添加轨迹质量过滤进一步提升了性能,通过过滤冗余、弱对齐或不一致的正确答案轨迹,超越了 SDAR 和 Skill-SD。

@@P2P_BLOCK_8@@

反思重写是将轨迹转换为训练数据的主导因素:移除它会导致性能降至 vanilla SFT 以下,而状态内部化则带来一致但较小的提升。同时结合两者的完整管线显著优于标准 SFT,展示了精心处理的自蒸馏轨迹的价值。反思重写至关重要:若没有它,性能降至 16.7%,甚至低于 vanilla SFT,因为原始反思包含如 [REFLECTION] token 等伪影,扭曲了推理分布。状态内部化提供了一致但适度的提升,添加了规划、记忆和进度跟踪信息;移除它会使完整管线的性能从 31.9% 降至 23.5%。完整转换管线大幅优于 vanilla SFT,将 DeepSearch-Val 从 25.0% 提升至 31.9%,显示了通过精细化轨迹处理进行进化式自蒸馏的好处。

@@P2P_BLOCK_9@@

该研究评估了 DeepSearch-World-9B,一个通过环境验证轨迹的自蒸馏改进的模型,与其基础模型在深度搜索基准上的对比,显示 23.8 到 48.1 个百分点的提升,以及平均 18.0 轮对比 4.7 轮的持续工具使用循环。消融实验表明,答案正确轨迹的拒绝采样是主要的改进因素,轨迹质量过滤提供了次要增益,而反思重写对于避免性能下降至关重要,状态内部化则带来适度的额外提升。总体而言,结合谨慎过滤和轨迹处理的完整管线大幅优于 vanilla SFT,证明精炼的自蒸馏轨迹可以教授可迁移的证据收集和推理行为。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供