HyperAIHyperAI

Command Palette

Search for a command to run...

Agent
LLM

何为优质智能体数据?基于 ACE 视角审视 LLM 智能体的数据生成

摘要

大语言模型智能体日益依赖生成的交互数据来学习如何与外部环境交互。与传统的指令合成不同,智能体数据生成必须在环境、任务、交互和成功信号之间保持一致性,同时产生有用而非仅仅是大量的经验。现有工作涵盖众多智能体领域,但以领域为中心的组织方式和异构的评估标准往往掩盖了共通的生成机制,并将候选构造与验证和筛选混为一谈。本文为该领域构建了一个双层框架。首先,我们将智能体数据表示为一个通用的因子化对象 (E,q,τ,v)( E , q , \tau , v )(E,q,τ,v) ,包含环境规范、任务信号、交互实现和可选的验证器。我们根据生成范式的主要锚点和依赖结构对其进行组织,涵盖通用的前向和反向流程。其次,我们通过准确度–复杂度–多样性(ACE)视角,将生成形式化为一种受约束的分布设计。准确度确立了有依据且内部一致的数据的可行支撑集。在此支撑集内,复杂度根据已声明学习器的能力和执行配置来分配学习质量,而多样性则控制跨环境、任务和交互行为的覆盖度与冗余度。利用该框架,我们探讨了先前工作如何验证生成的经验、构建和校准难度,以及扩展行为覆盖范围。文献揭示了一种向执行依据的准确度、学习者相对的复杂度以及超越表面变化或数据集规模的多样性的转变。我们进一步通过 ACE 视角讨论了智能体数据生成领域的更广泛方向和新兴趋势,包括它们对规模扩展、数据来源、训练机制和自适应学习的影响。总体而言,核心挑战并非简单地生成更多数据,而是随着智能体和环境的演化,持续分配有效、信息丰富且非冗余的经验。

一句话总结

来自华为、上海交通大学、西北大学等机构的研究团队提出了一种两级框架,将Agent数据分解为 (E,q,τ,v)(E, q, \tau, v)(E,q,τ,v),并通过准确性–复杂性–多样性(ACE)视角来制定生成过程,将重点从数据数量转向为不断演化的LLM Agent持续分配有效、有信息量且非冗余的经验。

核心贡献

  • 将Agent数据分解为元组(环境、任务、交互、验证器)的表示方式,通过其主要锚点和依赖结构统一了生成范式,涵盖正向和逆向流水线。
  • 准确性–复杂性–多样性(ACE)视角将生成表述为受约束的分布设计:准确性定义了可行支撑集,复杂性根据学习器校准难度,多样性则控制超越表面变化的行为覆盖范围。
  • 将该框架应用于文献揭示了向基于执行的准确性、相对于学习器的复杂性以及行为多样性的转变,并将Agent数据生成重新定义为随着Agent和环境演化而持续分配有效、有信息量且非冗余经验的过程。

引言

大型语言模型Agent越来越多地被部署到环境中,通过调用工具、修改文件或与模拟世界交互来行动,这需要将决策与观察联系起来的多轮经验。大规模生成此类交互数据对于训练和评估至关重要,但核心挑战不仅仅是产生更多数据;而是确保生成的经验是准确的、对学习器而言具有适当复杂性且足够多样化的。先前的工作仍然分散,因为流水线是用特定领域的术语(API调用、GUI演示、模拟器运行)描述的,并且常常将候选数据的构建方式与验证和选择方式混为一谈,使得难以比较不同应用中的机制。作者通过引入将Agent数据统一分解为环境、任务、轨迹和验证组件的方法来解决这一问题,并提出了ACE框架(准确性、复杂性、多样性)作为塑造生成数据分布的共同目标。他们还贡献了一种面向机制的分类法,该分类法根据生成范式的主要锚点和依赖结构而非领域标签来组织它们。

数据集

作者通过组合多种来源类型并应用覆盖率引导的策展,构建了一个多样化的Agent训练数据集。该数据集并非单一的静态集合;它会随着模型的改进而增长和重新平衡,因此规模是通过有效能力的边际增加而非原始样本数量来衡量的。

数据集构成与来源

  • 真实世界轨迹:来自实际用户会话或工具使用的异构文档、交互日志和真实的长尾支持。
  • 模型生成数据:由教师模型生成的合成任务和环境,提供可控性但存在教师先验风险。
  • 程序化环境:通过代码构建的仿真就绪世界、API生态系统、可执行仓库和具身场景,支持重置和执行,但可能重复少量模板。

各子集的关键细节

  • 真实轨迹:来源于文档、仓库和用户交互;继承自然的来源不平衡;通过验证机制过滤,仅保留稳健有效的样本。
  • 合成生成:通过提示模型创建;在数量和风格上可控;经过过滤以避免重复教师模型的偏差并确保任务有效性。
  • 程序化环境:通过面向工具的流水线和软件Agent框架构建;通过执行验证;更倾向于使用经过充分测试的较小环境集合,而非更大但不可靠的集合。

论文如何使用数据

  • 该数据集用于训练Agent,没有固定的划分。相反,作者采用了一种模型自适应流水线:基于失败、不确定性或目标解决率区间,在学习器当前前沿附近生成新的经验。
  • 覆盖率引导的平衡消除冗余,针对代表性不足的因子组合,并将生成资源分配到指定的迁移缺口。
  • 分层重放和周期性广泛探索保留了较简单的锚定案例,并防止对模型短暂弱点的过拟合。

处理与策展细节

  • 来源扩展添加环境、工具、模态和验证机制以增加多样性。
  • 覆盖率引导的流水线过滤并重新平衡池:移除冗余样本,确保所有因子组合均被代表,并专门在模型遇到困难的地方生成任务。
  • 自演化循环将观察到的行为和世界模型错误反馈到任务生成中,而轨迹感知分配则明确针对覆盖不足的推理和交互结构。
  • 未提及裁剪策略;元数据构建侧重于因子组合和验证状态以指导平衡。

方法

作者将工具增强的交互建模为部分可观测马尔可夫决策过程。Agent基于可观测历史选择动作,环境返回新的观测,同时可能改变其潜在状态。为了跨领域标准化数据生成,该框架定义了一个通用数据对象 d=(E,q,τ,v)d = (E, q, \tau, v)d=(E,q,τ,v)。其中,EEE 表示包含工具、状态和规则的环境规范;qqq 是任务信号;τ\tauτ 是交互实现或轨迹;vvv 是可选的验证器或奖励接口。

这种分解阐明了Agent数据生成不仅仅是生成指令然后采样响应。相反,流水线必须在可操作的环境、有根基的任务、交互过程和可信的成功信号之间建立兼容的关系。

Agent数据生成可被视为设计环境、任务和交互实现上的联合分布。作者将生成范式分为两大类:正向生成和逆向生成。

正向生成遵循交互的自然依赖关系。它构建环境,基于该环境生成有根基的任务,然后获得轨迹。这种方法提供了强大的根基,但如果环境狭窄或不可靠,则存在级联依赖的风险。逆向生成改变了起始锚点。任务优先的流水线指定目标能力并构建必要的环境和交互。轨迹优先的方法在编写面向用户的任务之前探索环境或挖掘工作流。结构优先的生成创建中间对象,例如工具图或蓝图,以在完全实现之前稳定依赖关系。

为了塑造生成数据的可接受分布,该框架引入了ACE目标。该目标将准确性视为准入条件,而复杂性和多样性则塑造有效数据的效用。目标表述为:

maxϕEBpϕ[λC1BAdBAgz(Cz(d))+λDD(BA)]s.t.Prdpϕ[A(d)=1]α\max_{\phi} \mathbb{E}_{\mathcal{B} \sim p_{\phi}} \left[ \lambda_{C} \frac{1}{|\mathcal{B}_{A}|} \sum_{d \in \mathcal{B}_{A}} g_{z}(C_{z}(d)) + \lambda_{D} D(\mathcal{B}_{A}) \right] \quad \text{s.t.} \quad \operatorname{Pr}_{d \sim p_{\phi}}[A(d) = 1] \geq \alphaϕmaxEBpϕ[λCBA1dBAgz(Cz(d))+λDD(BA)]s.t.Prdpϕ[A(d)=1]α

其中 A(d)A(d)A(d) 是有效性决策,α\alphaα 是所需接受水平,Cz(d)C_z(d)Cz(d) 是特定执行配置下实例的难度,D(BA)D(\mathcal{B}_A)D(BA) 是批次级多样性。这种表述确保了准确性建立可行集,而复杂性和多样性决定了哪些有效数据对训练最有用。

准确性是ACE目标的前提。样本必须具有内部一致的环境、可行的任务、有效的交互轨迹和正确的验证器。作者总结了在整个数据生成流水线中确保准确性的反复出现的机制。

该过程从分层规则、模型和基于人工的检查开始,通过事后过滤和回合级审查检测明显错误。接下来,基于约束的构建通过在生成前验证蓝图、图和状态来防止无效构建。基于执行和状态的验证将数据扎根于真实执行,检查状态转换、结果和可执行目标。最后,基于反馈的修复和选择性准入允许流水线根据失败信号进行修订、重试和重新生成,仅准入最佳候选。

复杂性决定了准确数据是否提供有信息量的学习信号。它被定义为相对于模型且依赖于学习器的。

学习效用在一个可学习区间内最大化,该区间介于过于简单和冗余的任务与过于困难且超出前沿的任务之间。随着学习器的改进,这个有用的区间会移动。作者提出了几种构建和校准复杂性的机制。结构规范和组合在实现前定义依赖结构,如子目标图。任务和信息控制调整必须实现的目标或最初可用的信息,从而产生澄清和检索负担。环境和交互设计通过类型化工具依赖和持久数据库改变决策过程。完成和反馈设计通过成功的定义控制复杂性,使用以路径为中心的奖励和步骤级检查。此外,基于失败和模型感知的校准利用求解器行为将候选保留在目标成功区间附近,而双向校准和脚手架则根据需要简化或加强候选。

多样性关注准确且适当复杂的Agent数据的广度,侧重于行为上不同的环境-任务-交互关系,而非表面变化。

为了扩展多样性,流水线采用多种机制。来源和支持扩展添加新的环境、工具和模态。组合重组在现有组件之间创建新的关系,例如多工具依赖和跨应用工作流。探索和经验优先的发现遍历环境,从可达行为中推导任务。扰动和反事实变化改变选定因子,同时保持其他因子不变,以暴露特定变化。最后,覆盖率引导的平衡和适应针对代表性不足的因子组合,并将生成资源分配到指定的迁移缺口。多样性的有意义因子因领域而异,从数字Agent中的工具依赖和状态效应,到社交Agent中的伙伴策略和私有信息,再到科学领域中的材料或假设。

实验

本文基于广泛的实验证据调查,从准确性、复杂性和多样性多个维度评估了Agent数据生成流水线。关键定性发现表明,准确的数据需要同时验证环境、任务、轨迹和验证器,基于执行的根基比单纯的合理性检查提供更强的信号,但必须与语义审查相结合以避免漏洞。复杂性只有在有效性确立后才有意义,像步数或工具数量这样的结构代理指标无法可靠预测行为难度;相反,面向前沿的生成必须平衡难度与可学习性,并避免课程漂移。多样性测量不能依赖单一指标:它需要因子覆盖、行为非冗余性以及向保留设置迁移的证据,同时还要考虑与准确性、模型感知复杂性以及覆盖率随时间可持续性的权衡。

正向Agent数据生成遵循环境到任务到轨迹的依赖关系,环境来自真实或策展来源、LLM合成或程序化构建。每种来源在真实性、可扩展性、可控性和验证成本之间权衡,塑造了结果轨迹的多样性和可靠性。混合方法试图平衡这些因素,但多样性声明仍取决于环境保真度和验证器覆盖范围。真实的API集合和仓库提供了真实的动态,但继承了不稳定的依赖关系、不均匀的文档和许可限制。LLM合成的环境易于扩展并允许受控变化,但生成的接口可能规格不足或脱离合理的工作流。程序化环境支持有状态的交互、受控重置和可靠的验证,但工程和维护成本更高。通过更广泛的重组扩展多样性会增加工具不兼容和目标不可达的风险,需要基于执行的检查和验证器支持。多样性应在难度区间内报告,以防止模型在追求前沿能力时丢失基础技能。将真实规范与可执行副本相结合的混合设计提供了一种折衷方案,但其多样性声明必须在保留的真实环境中进行测试。

逆向Agent数据生成方法因流水线的锚定工件而异:任务优先的方法设计目标能力,然后合成环境和轨迹,而轨迹优先的方法挖掘交互路径以推导任务。这些范式在多样性、可执行性和与现实世界动态的对齐方面提供了互补的控制,但每种方法都引入了权衡,如有限的探索、验证器不匹配和混合干扰,需要仔细平衡。任务优先生成在构建工具和环境之前组合能力目标或多轮任务,从而能够精确控制所教授的技能。轨迹优先方法将交互逆转为任务,将指令扎根于观察到的行为以提高可执行性,但将多样性限制在探索所发现的内容。扩展逆向生成可能会将支持扩展与更密集的重复混为一谈,因此需要覆盖率控制的比较来验证真正的多样性增益。更广泛的重组增加了工具不兼容和目标不可达的风险,要求有效性检查与多样性同步扩展,以避免丢弃合法策略。真实系统提供真实的动态,但成本高且会漂移,而学习到的模拟器扩展成本低,但可能发明转换,使得混合设计成为一种实用但依赖于保真度的折衷方案。混合领域和生成器会引入格式和奖励干扰;标准化有所帮助,但可能抹去领域语义,因此可持续的多样性需要来源追踪和定期修复。

代表性的特定领域多样性方法集中在工具使用和搜索上。工具使用方法通过API覆盖、可验证的函数调用执行、工具池和动作表示变化或连贯的多轮工具依赖来实现多样化,而搜索方法则通过真实世界的研究轨迹和证据整合来实现多样化。周围的分析表明,这些多样性增益只有在与有效性检查、难度感知分配以及对不断变化的工具和环境的持续适应相结合时才有意义。代表性集合中的工具使用方法强调不同的多样性机制,从大规模真实世界API覆盖到可验证执行和结构化多轮依赖合成。面向搜索的方法侧重于多样化的真实世界研究轨迹、检索行为和证据整合,而非固定的工具调用模式。随附的分析警告说,更广泛的多样性可能会引入不兼容性,并需要验证器覆盖、难度区间报告和定期的支持修复。

特定领域的多样性因Agent类型而异。具身生成集中于通过程序化或语言引导创建场景、物体、布局和物理交互条件,而社交生成则集中于角色、目标和伙伴行为的开放式变化。更广泛的证据表明,工具使用、Web或GUI以及编程Agent使可执行状态、界面、工作流以及仓库或轨迹覆盖多样化,而非将名义上的工具或页面数量视为足够。具身方法强调程序化场景、物体、布局、日常模拟以及具有物理交互条件的仿真就绪3D世界。社交Agent生成使用开放式交互来变化角色、目标和伙伴行为。工具使用、Web、GUI和编程证据表明,多样性声明取决于可执行效果、视觉与行为变化、仓库和轨迹覆盖以及验证器或模拟器保真度。

评估比较了正向和逆向Agent数据生成范式,考察了环境来源(真实、LLM合成、程序化)如何在真实性、可扩展性和验证成本之间权衡,以及任务优先与轨迹优先流水线如何控制技能覆盖和可执行性。针对工具使用、搜索、具身和社交Agent的特定领域方法表明,多样性增益取决于有效性检查、难度感知分配以及对不断变化的工具或环境的适应,而非名义上的API或页面数量。总体而言,研究结果强调,扩展多样性存在不兼容的风险,并需要基于执行的验证器、来源追踪以及在保留的真实环境中进行测试,以确保模型在追求前沿能力的同时保留基础技能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供