Command Palette
Search for a command to run...
DART-SD:面向多轮工具调用智能体自蒸馏的菱形拓扑感知检索与调优
DART-SD:面向多轮工具调用智能体自蒸馏的菱形拓扑感知检索与调优
Hangrui Xu Jiarui Wang Yang Yang Chuanbo Zhu Fangda Chen Ziqi Wu Jingming Cai Yan Song
摘要
赋予大语言模型(LLM)多轮工具调用能力是构建自主智能体的关键。然而,现有进展从根本上受限于对全长度轨迹模仿的依赖。对于包含多个顺序无关子目标的任务,最优解空间构成一个庞大的组合菱形格。将这种丰富的拓扑结构强行压缩为单一轨迹会导致严重的拓扑坍缩,不加区分地惩罚有效的替代探索路径,并严重削弱策略多样性。为解决这一问题,我们提出了 DART-SD(Diamond-topology Aware Retrieval and Tuning for Self-Distillation,菱形拓扑感知检索与调优自蒸馏),这是一个将范式从全局强制转变为拓扑引导的局部校正的新框架。DART-SD 首先将执行过程建模为一个收敛的交互状态转移图(ISTG),忠实刻画成功与失败探索路径所固有的菱形拓扑。在自主推演过程中,该框架识别关键拓扑断点(CTB),并检索由成功经验支撑的恢复参考。最后,我们引入了一种通过 CTB 引导的局部监督实现的渐进式自蒸馏范式,确保训练损失仅针对生成的恢复步骤计算,同时严格保护有效的推理前缀免受破坏性梯度更新的影响。在复杂多轮工具调用基准上的实验表明,DART-SD 显著优于传统的全轨迹基线方法。
一句话总结
字节跳动与中国科学技术大学提出 DART-SD,它是一种菱形拓扑感知的检索与调优框架,通过交互状态转移图、关键拓扑断点检索和渐进自蒸馏,用拓扑引导的局部修正取代全轨迹模仿,从而提高策略多样性,并在复杂多轮工具调用基准上超越全轨迹基线。
核心贡献
- 交互状态转移图(ISTG)对多轮工具调用任务的执行过程建模,捕获由顺序无关的有效探索形成的菱形拓扑。
- 局部修正方法识别失败轨迹中的关键拓扑断点(CTB),从 ISTG 中检索成功支撑的恢复参考,并仅对生成的恢复步骤施加监督损失,同时保留有效推理前缀。
- 渐进自蒸馏范式反复采样学生模型,识别其持续演变的能力边界,并施加 CTB 引导的局部监督,逐步扩展有效交互前缀,逐步掌握更复杂的工具使用行为。
引言
为大型语言模型配备多轮工具调用能力是构建自主 agent 的核心,但最先进的性能依赖昂贵的前沿模型,这促使将其规划与交互能力蒸馏到紧凑的开源模型中。现有蒸馏和强化学习方法通常将多轮工具使用视为孤立的线性轨迹。行为克隆和监督微调可能通过不加区分的全局损失覆盖有效探索步骤;事后方法强制执行刚性线性序列,将致命错误与无害探索混为一谈;而 GRPO 等强化学习方法因惩罚失败轨迹中的有效步骤而存在信用分配错误。由于顺序无关的子目标使不同轨迹在菱形解空间中相交,将这种结构压平成线性路径会导致拓扑坍缩。作者提出 DART-SD,该方法构建一个基于累积交互状态的交互状态转移图,通过将学生状态投影到成功可达区域来识别关键拓扑断点,检索成功支撑的恢复延续,并施加带局部监督的渐进自蒸馏。该方法仅更新恢复步骤,保留有效推理前缀,并提高 token 效率。
数据集
作者基于工具使用轨迹采样构建任务特定的交互状态图数据集。节选内容未说明原始语料规模或来源名称,而是描述了教师轨迹采样如何被处理为 ISTG。
来源与组成
- 数据由每个任务的教师工具使用轨迹采样组成,包括成功和失败的轨迹采样。
- 每条轨迹是一系列工具调用或并发调用包及其响应。
- 所有轨迹共享同一个根状态,并以成功或失败终态结束。
- 对于每个任务 x,有用的响应内容被抽象为任务特定的信息原子集合 κx。
处理与过滤
- 确定性规范化:每个工具响应被解析为字段。只有当所有字段都是状态信号、空值或占位符时,响应才是无信息的。错误和未找到消息变为无信息;至少包含一个实际负载字段的响应仍为有信息。
- 无信息响应按工具被合并为单一类别,这在不进行语义判断的情况下删除了大量语料。
- 语义原子化:对任务中保留的响应进行联合判断,条件为任务问题和一条成功轨迹采样。每个工具身份与规范化后的响应对最多映射到一个原子。
- 有信息响应获得一个单例原子;无信息或未判断的响应映射为空。
- 等价事实即使由不同工具或以不同表面形式产生,也会获得相同原子,因此获取路径可以重新汇聚。
状态与图构建
- 在步骤 t 的交互状态为 Xt=(It,Ut),其中 It 是已获取信息原子的集合,Ut 是自最近主节点以来的无用操作多重集。
- 根状态为 (∅,∅),是主节点。后续状态在步骤添加了此前未见原子时为主节点;在未添加新原子且记录无用操作时为辅助节点。
- 对于每个任务,构建有向多重图 Gx=(Vx,Ex)。顶点表示主状态或辅助状态;边表示一次工具调用或一个并发调用包。平行边被保留。
- 主节点构成信息获取骨架,辅助节点表示附着在最近主节点上的无用探索。
- 本段未给出明确的数据集大小、划分比例、裁剪策略或外部元数据构建方式。
数据使用方式
- 这些图用作共享的交互状态空间。
- 学生模型轨迹采样在相同状态更新规则下重放:
- 教师模型与学生模型的执行被嵌入同一状态空间,可以分别匹配信息获取和无用探索,而无需逐动作对应。
方法
作者提出 DART-SD 框架,通过拓扑感知恢复和渐进自蒸馏增强工具使用能力。整体流程首先从教师模型轨迹采样构建交互状态转移图(ISTG),通过成功可达投影识别失败学生模型轨迹采样的关键拓扑断点(CTB),并利用该断点生成局部恢复延续以进行有针对性的微调。
如下图所示:
为构建基础图结构,该框架引入信息原子抽象机制。对于给定任务,从工具响应中提取的有用事实被规范化为任务特定的信息原子集合 κx。该过程分两阶段进行。确定性阶段对每个工具响应进行规范化,以判断它是否携带可用数据,并将无信息响应合并为单一类别。随后语义阶段为保留下来的候选响应分配原子,确保语义等价响应共享同一原子。每一步的获取增量根据新获取的原子计算,并更新信息集。
任一步骤的交互状态表示为一个元组 (It,Ut),包含已获取信息原子集合和自最近主节点以来执行的无用操作多重集。根状态定义为主节点。后续状态如果获取新信息则分类为主节点;如果只记录无用操作而不改变信息集,则分类为辅助节点。ISTG 从所有成功和失败的教师轨迹采样中构建为有向多重图 Gx=(Vx,Ex),其中主节点构成信息获取骨架,辅助节点表示附着其上的无用探索。这种集合值信息分量允许顺序无关的获取路径在同一主信息状态重新汇聚。
在 ISTG 建立后,框架识别失败学生模型轨迹采样中的 CTB。作者基于任务特定的可达预算定义经验成功可达区域 Rx+,该区域筛选成功教师轨迹中剩余成功距离在预算范围内的节点。对于每个学生状态,应用按类型区分的状态投影。对于学生主节点,可接受的教师锚点是可达的教师主节点,其信息集包含在学生已获取信息中。对于学生辅助节点,投影比较在相应可达教师主节点之后执行的无用操作数量。CTB 被正式定义为从可投影到不可投影的学生状态的第一个转变,标志着学生最早偏离教师支撑区域的点。
在识别 CTB 后,框架应用 CTB 引导的局部监督。作者从成功和失败的教师轨迹中检索特权参考。不是直接拼接这些轨迹,而是将增强生成器以任务、CTB 前保留的学生前缀和特权参考为条件,生成恢复延续。训练轨迹通过将该延续附加到保留前缀后形成。然后使用掩码因果语言建模目标 LDART 训练模型。关键是,损失掩码定义在响应步骤上,只对 CTB 之后且最终答案步骤之前生成的助手响应步骤中的 token 赋予非零权重。这确保监督严格限制在 CTB 后的恢复行为,同时保留 CTB 前的上下文。
最后,框架采用渐进自蒸馏范式。在整个迭代自蒸馏过程中维护任务特定的 ISTG。在每次迭代中,当前学生模型生成新的轨迹采样,并被映射到共享交互状态空间以检测更新后的 CTB。随着学生策略改进,其状态在轨迹的更大部分保持可投影。因此,检测到的 CTB 跟踪当前策略首次偏离教师支撑区域的演进边界,从而引入自步课程,逐步将监督转移到当前工具使用能力之外的恢复行为。
实验
评估设置将 DART-SD 在 FTRL 数据集上训练,该数据集包含超过 2,000 个工具使用环境,具有四种任务结构,并在无思考配置下与基于蒸馏和基于强化学习的基线在域内和四个域外基准上进行测试。结果表明,DART-SD 一致优于所有比较方法,并在不同模型规模下保持较强性能,确认其拓扑感知的局部调优学习到可泛化的工具使用能力,而不是过拟合训练分布。定性分析显示,学生模型可以发现优化捷径,生成比黄金参考更短的成功轨迹,从而超过其更大的教师模型;同时,对能力边界位置的跟踪显示,首次偏离可恢复行为在迭代过程中逐步推迟。消融研究进一步验证,每个组件,包括自蒸馏、CTB 引导的局部监督、渐进迭代适应和结构化 ISTG 拓扑,都对总体有效性有贡献。
DART-SD 在 Qwen3-4B 和 Qwen3-8B 骨干上的域内和四个域外工具使用基准上,一致优于基于蒸馏和基于强化学习的方法,取得最高平均性能。它在若干任务上超过教师模型,同时学习到更高效策略,在训练迭代中减少平均工具调用次数,并保持通用推理和指令遵循能力。DART-SD 在全部五个基准上取得最强总体表现,在 Qwen3-4B 和 Qwen3-8B 骨干上均获得最高平均分数。使用 CTB 引导的局部监督进行训练,逐步缩短成功工具使用轨迹,同时提高任务成功率,表明推理更高效,而非依赖更长的链条。除工具使用外,DART-SD 在 IFEval、AIME24、AIME25 和 MMLU 上保持并提升通用能力,优于基础模型和标准 SFT。
在 FTRL 测试集上,DART-SD 的成功轨迹在渐进迭代中变短,同时 Solve-F1 稳步提升。总体平均工具调用长度最终低于黄金参考轨迹长度,表明工具使用行为更高效。并行和多步任务的收益最显著,而单步轨迹接近黄金效率。总体平均工具调用长度在迭代中下降,并在 Iter5 时低于黄金参考。Solve-F1 在相同迭代中持续提升,表明更短的轨迹与更好的任务成功率同时出现。并行多步任务显示最大的效率收益,最终低于其黄金参考长度;单步和并行单步任务保持接近黄金效率。
在渐进 SFT 迭代中,失败轨迹中的平均 CTB 位置逐渐后移,即模型在需要局部恢复前执行更长的有效前缀。这种移动在多步和并行多步任务中最强,而单步和并行单步任务保持相对较低或不一致。这支持了 CTB 引导的局部监督逐步扩展更复杂轨迹能力边界的观点。总体 CTB 位置从第一次迭代到第二次迭代大幅提升,随后在后续迭代中继续缓慢增加。多步和并行多步任务驱动总体趋势,最终在所有任务类型中具有最高的 CTB 位置。单步任务显示有限或非单调的边界移动,最终值接近或低于早期峰值。
在思考设置下,DART-SD 在全部三个报告基准上取得最高性能,超过 Qwen3-8B 基础模型和所有比较的训练基线。它在 FTRL 和 BFCL 上相比领先基线有明显提升,同时保持有竞争力的 ToolHop 分数,表明 CTB 引导的局部监督在启用显式思考时仍然有效。DART-SD 在 FTRL Solve-F1、BFCL Multi-Turn 和 ToolHop AC 上在比较方法中排名第一。与 MatchTIR 相比,DART-SD 在 FTRL 和 BFCL 上提升更大,在 ToolHop 上表现相近。可训练基线和推理时思考基础模型在全部报告的思考设置指标上始终落后于 DART-SD。
DART-SD 在全部报告的能力基准上,包括指令遵循、数学推理和通用知识,均优于预训练 Qwen3-8B 基线和标准 SFT。平均分数从基础模型的 43.92 提升到 DART-SD 的 49.89,而 SFT 仅达到 44.18。提升范围广泛,其中指令遵循的相对提升尤其大。DART-SD 在每个单独基准上取得最佳结果,并具有最高总体平均分。标准 SFT 相比基础模型仅带来轻微平均提升,并在所有指标上低于 DART-SD。DART-SD 的最大相对提升出现在指令遵循上,相比两个基线均有显著提高。
实验从工具使用基准、轨迹效率、失败边界位置、思考模式性能和通用能力基准等方面评估 DART-SD。DART-SD 在 Qwen3-4B 和 Qwen3-8B 的域内和四个域外工具使用任务上优于基于蒸馏和基于强化学习的基线,在若干任务上超过教师模型,并在提高任务成功率的同时学习到更短的成功轨迹。其 CTB 引导的局部监督还在复杂多步任务中将失败边界推迟到更晚位置,在显式思考下仍然有效,并且相比基础模型和标准 SFT,保持或提升指令遵循、数学推理和通用知识。