Command Palette
Search for a command to run...
从闭源到开源:通过多智能体协议蒸馏弥合智能搜索中的分布鸿沟
从闭源到开源:通过多智能体协议蒸馏弥合智能搜索中的分布鸿沟
Junlin Liu Jiangwang Chen Zixin Song Shuaiyu Zhou Chunji Lv Hank Wu Kailin Jiang Jinyang Wu Bohan Yu Chenxi Zhou
摘要
智能搜索使大语言模型能够通过将多步推理与检索交替进行来解决知识密集型任务,但基于结果的强化学习(RL)优化仅提供稀疏的监督信号。知识蒸馏可以提供更密集的指导,而具备强大推理能力的先进闭源模型是很有前景的教师。尽管从闭源模型进行蒸馏可以密集化这种监督信号,但传统的逻辑值匹配因隐藏的逻辑值和分词器不匹配而无法使用,而原始自然语言轨迹模仿则传递了表面的风格痕迹,而非核心推理能力。为解决这一异构蒸馏问题并弥合分布鸿沟,我们提出了多智能体协议蒸馏(MAPD),这是一个联合蒸馏与 RL 的框架,使用结构化的、风格归一化的协议作为中间表示。一个离线多智能体系统(MAS)对每个查询进行分解,检索支持证据,修复失败的搜索,并将生成的探索轨迹转换为包含任务类型、推理计划和抽取式事实依据的 JSON 协议。在训练期间,该协议仅提供给学生策略的一个特权分支,其词元分布与稀疏的 RL 目标一起,提供了密集的蒸馏信号。在七个问答基准上的广泛评估表明,MAPD 始终优于竞争性的蒸馏和 RL 方法,在 Qwen3-1.7B 上平均成功率达到 39.4%,在 Qwen3-4B 上达到 44.4%。至关重要的是,该框架在不同闭源教师模型间展现出稳健的泛化能力,同时有效缓解了学生策略的风格漂移和冗长退化问题。
一句话总结
中国科学院大学、清华大学、北京大学、北京理工大学、华东师范大学和中国科学技术大学的研究人员提出 Multi-Agent Protocol Distillation(MAPD),一种联合蒸馏与强化学习框架,将 multi-agent 探索轨迹中的结构化 JSON 协议蒸馏到 privileged student 分支中,从而弥合面向 agentic 搜索的专有到开源分布差距,在 Qwen3-4B 上取得高达 44.4% 的成功率并缓解风格漂移。
核心贡献
- Multi-Agent Protocol Distillation(MAPD)是一种联合蒸馏与强化学习框架,通过使用结构化 JSON 协议作为中间表示,将 teacher 模型的推理策略与其语言风格解耦,从而提供密集监督,而无需访问 logit 或匹配 tokenizer。
- 一个离线 multi-agent 系统从专有 teacher 轨迹中合成这种风格归一化协议,捕获任务类型、推理计划和可抽取的支撑事实,并作为特权信息,与稀疏 RL 目标一起在训练期间引导 student 策略的 token 分布。
- 在七个知识密集型 QA 基准上的实验表明,MAPD 持续优于颇具竞争力的蒸馏和 RL 基线,在 Qwen3-1.7B 上平均成功率 39.4%,Qwen3-4B 上 44.4%,同时在不同专有 teacher 上具有稳健的泛化能力,并缓解风格漂移和冗长退化。
引言
大规模语言模型越来越多地应用于多轮 agentic 任务,如 agentic 搜索,其中策略需要将推理与检索交错进行,以回答复杂的知识密集型查询。训练此类系统通常依赖于基于结果的强化学习,该方式仅提供稀疏监督,或通过在线策略蒸馏补充该信号,在 token 级别对齐 student 与 teacher 的分布。然而,这种蒸馏需要高质量的 teacher,尽管专有模型提供强大的推理能力,从中蒸馏会引入两个核心障碍:不匹配的 tokenizer 和无法访问的 logit 使得 token 级别对齐不可行,而直接的轨迹模仿会迫使开源 student 模型模仿冗长的、teacher 特有的风格,导致分布漂移、幻觉以及策略推理的迁移效果不佳。
研究者的解决方案是引入 Multi-Agent Protocol Distillation(MAPD),一个联合框架,将在线策略自蒸馏与基于结果的强化学习相结合。MAPD 通过从基于专有 teacher 的 multi-agent 系统(仅在离线训练期间使用)合成风格归一化的 JSON 协议,来解耦认知策略与语言表面形式。在在线对齐阶段,student 模型的一个以协议为条件的分支通过密集自蒸馏对齐,补充稀疏奖励信号,无需访问 teacher 的 logit,也不会增加推理开销。
数据集
作者通过一个自动化的三阶段 multi-agent 流水线构建了一个结构化 JSON 协议的训练数据集。该数据集作为训练 student 模型的目标,其中真实答案严格对 student 隐藏。
数据集构成与来源
- 每个样本都是一个从单个问题派生的结构化 JSON 协议。
- 该流水线使用本地 Wikipedia 语料库进行检索;原始问题来源未详细说明,但假定为某个 QA 数据集。
- 生产两种协议变体:
- Succeeded Protocol – 包含完全验证的答案、逐步推理计划以及可抽取的支撑事实。
- Evidence Protocol – 当搜索失败时生成;省略确定答案,转而提供部分发现的客观总结。
- 所有协议均由一个 Protocolizer agent 自动生成,该 agent 将详尽的探索日志(子任务、查询、检索到的段落、发现)转换为 JSON 目标。
各子集的关键细节
- Succeeded Protocol 子集:包含 multi-agent 搜索收敛到正确答案的样本。协议包含经过验证的答案、无后见之明制定的推理计划,以及来自检索段落的逐字子字符串的支撑事实。
- Evidence Protocol 子集:包含搜索未收敛的样本。答案字段被替换为客观证据总结(如“已确认……,但缺乏……的可靠证据”)。推理计划和支撑事实遵循相同的严格约束。
- 流水线根据 Stage A 中的二元成功标签自动生成这两种类型。
数据处理与质量控制
- 所有生成的协议都经过质量门控,包括四项自动检查:
- 模式验证(格式正确的 JSON)
- EM 一致性(对成功的协议,答案与真实答案匹配)
- 支撑验证(事实是可抽取的子字符串)
- 泄漏检测(推理步骤中无 oracle 知识)
- 未通过任何检查的协议将被丢弃;在这些实例上,训练回退到自我 rollout 基线。
- 对三个模型上 3000 个实例的人工审查显示,产生合规协议的准确率为 99.33%。
论文如何使用该数据
- 最终的高质量 JSON 协议数据集用作 student 模型的训练目标。
- 作者未明确说明训练/验证划分或混合比例,但同时包含了 Succeeded 和 Evidence 协议,以教会模型生成答案和总结证据。
- 该数据集不用于评估;它仅为训练资源,真实答案永不暴露给 student。
方法
作者将 agentic 搜索形式化为语言模型策略与检索增强环境之间的多轮交互。策略生成推理步骤并可选择发出检索查询,接收相关段落作为观察,直到输出最终答案或达到轮次上限。每条轨迹根据最终答案的精确匹配评估获得稀疏的二元奖励。为了优化该策略,方法基于 Group Relative Policy Optimization(GRPO),该方法对每个提示采样一组 rollout,从终止奖励计算优势值,并使用带裁剪的替代目标以及相对于参考模型的 per-token KL 惩罚来更新策略。然而,GRPO 仅提供结果级别的监督,不足以完善复杂的中间推理。
为了注入更密集的 token 级别引导,作者采用 Online Policy Self-Distillation(OPSD)。在 OPSD 中,当前策略同时扮演 student 和 teacher 的角色:student 分支以标准上下文为条件,而 teacher 分支额外接收仅在训练期间可用的特权信息(PI)。通过最小化两个分支间的 per-token 反向 KL 散度并限制梯度仅流向 student,模型在无词汇不匹配问题的情况下从更丰富的 teacher 上下文中蒸馏知识。然而,标准 OPSD 从 student 自身正确的 rollout 中获取 PI,使监督质量受限于 student 的现有能力。
所提框架通过引入结构化 JSON 协议和 Multi-Agent System(MAS)生成流水线来克服这一局限,该流水线从专有 teacher 模型生成高质量特权信息,同时将认知策略与 teacher 特有的语言模式解耦。整体架构是一个联合训练方案,将 token 级别的 OPSD 蒸馏信号与稀疏的 GRPO 强化学习信号相结合。
结构化 JSON 协议将特权信息归一化为紧凑、可追溯的格式,包含五个关键字段:任务类型(single_hop、multi_hop、comparison、others)、有序的可操作子目标推理计划、从检索段落中逐字抽取的支撑事实、用于失败搜索的可选部分发现,以及带支撑性标志的答案验证。通过让 teacher 分支以这种风格归一化的协议为条件,而非使用自由形式的 teacher 文本,该方法减少了表示不匹配并缓解风格漂移与幻觉。
为了从专有 teacher 自动构建这些协议,作者设计了一个具有严格质量控制的三阶段 MAS 流水线。在 Stage A(Multi-Agent 协作搜索)中,Orchestrator agent 将问题分解为带有依赖标注的子任务,分派给并行的 Searcher agent,后者查询本地 Wikipedia 语料库并压缩结果,并跨多轮综合发现。如果与真实答案的精确匹配检查失败,Repair agent 会使用真实答案作为诊断指导(绝不暴露给 student),以识别表达或搜索问题,并触发针对性的重新分解和额外搜索。Stage B(协议生成)使用 Protocolizer agent,根据成功标签,将详尽的探索日志转换为 Succeeded Protocol(包含验证答案)或 Evidence Protocol(包含部分发现且无答案)。执行两个完整性约束:推理计划中无后见之明,以及事实的可抽取支撑。Stage C(质量门控)应用四项自动检查:模式验证、成功协议的精确匹配一致性、通过子字符串匹配的支撑验证,以及防止注入 oracle 知识的泄漏检测。未通过任何检查的协议将被丢弃,训练回退到自我 rollout 基线。人工审查确认产生合规协议的准确率为 99.33%。
最后,联合训练目标将 OPSD 损失与 GRPO 损失相结合:
L(θ)=λOPSD⋅LOPSD(θ)+LGRPO(θ),其中 LOPSD 提供来自结构化协议的 token 级别蒸馏,实现高效的逐步信用分配,而 LGRPO 通过裁剪策略梯度提供稀疏 RL 信号,以优化最终环境奖励。超参数 λOPSD 控制蒸馏引导的相对强度。这种一体化方法使 student 模型既能受益于密集、高质量的推理监督,又能通过基于结果的强化学习对下游任务进行对齐。
实验
实验在 NQ 和 HotpotQA 上训练,并在七个单跳和多跳 QA 基准上评估 MAPD,与包括 GRPO、OPSD 和 SDAR 在内的多种纯 RL 和混合蒸馏基线进行比较。MAPD 持续优于先前方法,在需要分解和证据聚合的复杂多跳任务上相对增益更大。消融实验表明,结构化协议对于防止跨模型蒸馏中的风格漂移至关重要,而 multi-agent 系统提升了协议质量和推理完整性。进一步分析表明,该方法在不同专有 teacher 骨干上均可稳健工作,并确定了最优蒸馏权重,该权重平衡了检索效率与多步推理。
MAPD 在所评估的两个模型规模上均持续优于所有基线方法,最大的增益出现在多跳问答基准上。相较于最强基线 SDAR,MAPD 在 1.7B 和 4B 模型上分别带来平均 4.8% 和 3.3% 的提升。对于复杂的多跳任务,优势尤为明显,相对增益分别达到 7.9% 和 5.1%,凸显了 multi-agent 分解和证据聚合的益处。MAPD 在 Qwen3-1.7B 和 Qwen3-4B 的所有七个基准上均取得了最高成功率。在多跳 QA 上(1.7B 为 7.9%)相对 SDAR 的提升远大于单跳 QA(2.3%),表明 multi-agent 设计特别有助于复杂推理。性能提升在不同模型规模上保持一致,1.7B 模型的平均成功率达 39.4%,4B 模型达 44.4%。
移除结构化协议会导致性能下降到比不使用专有模型的基线更低的水平,这表明原始自然语言轨迹会对 student 产生消极影响。在没有结构化协议的情况下添加 multi-agent 系统并未改善结果,甚至略有恶化,而仅使用单个 teacher 的协议虽能恢复部分增益,但仍落后于最强基线。只有结合结构化协议和 multi-agent 系统的完整 MAPD 框架才能取得最佳成功率,表明这两个组件对于有效的跨模型蒸馏至关重要。从原始专有模型轨迹(无论是否搭配 multi-agent 系统)进行蒸馏,所得平均成功率均低于完全不使用专有模型的 GRPO+OPSD 基线。在单个 teacher 下用结构化协议替换原始文本能带来显著增益,但该单 agent 协议仍不及 SDAR 基线。完整的 MAPD 配置,即将结构化协议与 multi-agent 系统配对,在两个 student 模型规模上均优于所有消融配置和基线。
三个专有 teacher 均获得类似的平均成功率(差异在 2 个百分点以内),证实结构化协议有效解耦了推理与 teacher 特有风格。OPSD 损失权重 λ=0.05 带来最佳整体表现,而 λ=0.10 则引发折衷:单跳准确率略有提升但多跳性能大幅下降,表明模型偏向于浅层检索而非多步推理。在 Claude、GPT 和 Gemini teacher 之间,平均成功率波动不到 2 个百分点(Qwen3-1.7B 上 37.9–39.4%,Qwen3-4B 上 44.0–44.6%),体现了 teacher 无关的迁移能力。将 λ 从 0.05 提升到 0.10 会提高单跳得分(如 4B 上 TriviaQA 从 62.5 升至 63.7),但导致多跳指标下降(2Wiki 从 45.7 降至 38.4),暴露出走向无推理检索的捷径。
评估使用 Qwen3-1.7B 和 Qwen3-4B student 模型在多跳问答基准上,将 MAPD 与若干基线进行比较。MAPD 取得最佳结果,尤其在复杂多跳任务上,凸显了 multi-agent 分解和证据聚合的价值。消融实验表明,结构化协议和 multi-agent 系统都至关重要,因为原始轨迹损害性能,部分配置表现不佳。teacher 无关的迁移能力和适中的 OPSD 损失权重进一步证实了框架的鲁棒性及其在检索与多步推理之间取得平衡的能力。