HyperAIHyperAI

Command Palette

Search for a command to run...

超越简单环境扩展:面向多模态智能体学习设计高效的环境分布

Kejian Zhu Zhuoran Jin Dongqi Huang Hongbang Yuan Yupu Hao Kang Liu Jun Zhao

摘要

近期研究通过构建大规模多模态环境池来训练智能体。然而,我们发现单纯增加多模态环境的数量并非总能带来收益。我们通过一系列实验进一步分析了当前多模态环境分布的局限性。基于这些发现,我们从多样性和难度结构两个维度研究如何构建更高效的训练环境分布。在多样性方面,我们提出了能力感知环境选择(AES)方法,以获取多样化的环境集合。在难度结构方面,我们提出了层级难度课程(HDC),通过约束弱化和状态规模递进两个难度层级来组织课程学习。实验表明,AES 和 HDC 能够有效提升多模态智能体的训练效果。

一句话总结

中国科学院的研究人员提出了能力感知环境选择(AES)与层级化难度课程(HDC),通过辅助信息削弱和状态规模递进组织课程学习,构建具有优越多样性和难度结构的训练环境分布,在多模态agent学习上相比单纯扩大环境规模取得了显著提升。

核心贡献

  • 实证分析表明,仅仅增加多模态环境数量可能会降低agent表现,原因是梯度冲突加剧以及视觉状态提取和世界建模中的多模态特有瓶颈。
  • 提出了能力感知环境选择(AES)来构建多样的环境集合。
  • 提出了层级化难度课程(HDC),通过辅助信息削弱和状态规模递进组织难度;实验证明,AES和HDC能有效改善多模态agent训练。

引言

多模态agent训练越来越依赖动态环境,但作者发现简单地扩大环境数量并不能可靠地提升性能。他们的实验表明,朴素的扩展会导致不稳定性:相比于文本-符号环境,混合多模态训练会放大负迁移和梯度冲突,增加更多环境类型甚至可能降低结果。现有工作主要关注样本层面的质量,确保每个环境可执行,而忽视了分布层面的因素,如多样性和难度结构。作者从两个维度入手:提出了能力感知环境选择(AES),基于agent轨迹构建元能力画像,以选出高覆盖、低冗余的环境集合;以及层级化难度课程(HDC),通过辅助信息削弱和状态规模递进来应对多模态瓶颈。两者结合带来了显著的平均性能提升,表明设计有效的环境分布对于多模态agent训练至关重要。

数据集

作者构建了一组元能力画像来表示200个交互环境的技能需求。该数据集分三个阶段构建:

  • 轨迹采集 对每个环境,记录40条agent轨迹——20条来自Qwen3‑VL‑4B,20条来自Gemini‑3‑Flash。这两个模型能力不同,因此轨迹池中既包含成功策略也包含失败模式,从互补视角揭示了能力需求。所有环境共采集了8,000条轨迹。

  • 原子能力分割 一个强大的标注模型(GPT‑5)将每条轨迹分解成一系列原子能力——可解释的行为单元,例如"识别目标位置"。通过统一提示词配合少样本示例来控制粒度,并通过人工检查剔除低质量分割(例如过于粗糙的标签如"感知")。

  • 聚合为元能力画像 GPT‑5对给定环境的所有轨迹中的语义等价原子能力进行合并。计算每个元能力的频率以及它们之间的转移频率,形成能力图。剔除低频和不稳定的能力。最终得到一个元能力画像,列出环境的元能力、转移边及其频率。每种能力进一步被分类为核心能力(稳定、任务关键)或软能力(偶然出现或弱相关)。最终构建了200个画像,覆盖72种不同的核心元能力。

完整的画像集合用于选择一个多样的训练环境子集。通过最大化72种核心能力的覆盖度并最小化冗余,作者能够在不经人工检查环境的情况下组装出一个多样且高效的训练池。

方法

作者提出一个框架来评估并设计面向多模态agent的有效训练环境分布,重点关注两个关键维度:多样性和难度结构。整体框架如下所示。

多样性:能力感知环境选择(AES)

为确保环境集覆盖广泛的能力同时避免冗余和冲突,作者从agent能力多样性的角度来刻画环境多样性。他们首先为每个环境构建元能力画像。对每个环境,从能力水平不同的模型中采集agent轨迹,以捕捉成功策略和失败模式。随后,标注模型将这些轨迹分解成一系列原子能力,即对完成任务有意义的可解释行为单元。这些原子能力被聚合起来,为每个环境eee构建一个元能力画像PeP_ePe,包含元能力、转移边及其频率。元能力进一步分为核心能力(稳定且与任务完成直接相关)和软能力。

基于这些画像,作者提出能力感知环境选择(AES)。对于每个候选环境eee,其覆盖集C(e)C(e)C(e)由核心能力和软能力构成,核心能力被赋予更高权重。给定当前已选环境集SSS,由eee带来的新覆盖度定义为:

NewCoverage(e,S)=aC(e)C(S)wa\text{NewCoverage}(e, S) = \sum_{a \in C(e) \setminus C(S)} w_aNewCoverage(e,S)=aC(e)C(S)wa

其中waw_awa表示能力aaa的权重。

为减轻联合训练时的冗余和优化冲突,作者定义了冗余分数和冲突分数。冗余度通过元能力画像之间的相似度来度量:

Redundancy(e,S)=maxeSsim(Pe,Pe)\text{Redundancy}(e, S) = \max_{e' \in S} \text{sim}(P_e, P_{e'})Redundancy(e,S)=eSmaxsim(Pe,Pe)

冲突则通过环境间的梯度余弦相似度来估计:

Conflict(e,S)=maxeSmax(0,cos(ge,ge))\text{Conflict}(e, S) = \max_{e' \in S} \max(0, -\cos(g_e, g_{e'}))Conflict(e,S)=eSmaxmax(0,cos(ge,ge))

候选环境eee的增益计算如下:

Gain(eS)=λ1NewCoverage(e,S)λ2Redundancy(e,S)λ3Conflict(e,S)\text{Gain}(e \mid S) = \lambda_1 \text{NewCoverage}(e, S) - \lambda_2 \text{Redundancy}(e, S) - \lambda_3 \text{Conflict}(e, S)Gain(eS)=λ1NewCoverage(e,S)λ2Redundancy(e,S)λ3Conflict(e,S)

该算法迭代选择增益最高的环境,直到所有核心行为被覆盖。该过程通过一个紧凑的环境子集有效保留了广泛的能力覆盖,如下方覆盖累积曲线所示。

难度:层级化难度课程(HDC)

针对多模态agent在训练早期难以处理原始视觉输入的瓶颈,作者设计了文本辅助信息作为训练支架。这些辅助信息包括文本观测、文本状态、文本提示和规则描述,提供辅助信息帮助模型提取状态并理解规则。

作者提出层级化难度课程(HDC),沿两个难度轴组织训练:辅助信息削弱和状态规模递进。辅助削弱作为外层课程,逐步移除辅助支架,迫使模型依赖原始视觉观测。状态规模难度,指环境实例的规模复杂度,作为内层课程。

对每个环境eee,课程状态维护为一个元组(re,e,ue)(r_e, \ell_e, u_e)(re,e,ue),其中rer_ere是当前辅助信息前沿,[e,ue][\ell_e, u_e][e,ue]是状态规模采样窗口。训练期间,从环境特定的分布De(hre)D_e(h \mid r_e)De(hre)中采样辅助信息等级hhh,该分布赋予当前前沿概率pcurp_{\text{cur}}pcur,其余概率按指数衰减分配给更早的等级:

wh=exp(α(reh))w_h = \exp(-\alpha(r_e - h))wh=exp(α(reh)) De(hre)=(1pcur)whj<rewj,h<reD_e(h \mid r_e) = (1 - p_{\text{cur}}) \frac{w_h}{\sum_{j < r_e} w_j}, \quad h < r_eDe(hre)=(1pcur)j<rewjwh,h<re

类似地,状态规模等级sss从滑动窗口[e,ue][\ell_e, u_e][e,ue]中均匀采样,其中e=max(0,ueΔd)\ell_e = \max(0, u_e - \Delta d)e=max(0,ueΔd)

课程更新是层级化的。当模型达到规模推进阈值τs\tau_sτs,内层课程推进(ueue+1u_e \leftarrow u_e + 1ueue+1)。一旦达到目标状态规模等级并满足辅助推进阈值τh\tau_hτh,外层课程推进(rere+1r_e \leftarrow r_e + 1rere+1),同时重置状态规模。这确保了在每个辅助信息等级内,状态规模复杂度逐步增加;在达到足够能力后,辅助信息被削弱,规模递进重新开始。

实验

在Qwen3-VL模型上的主要实验表明,多样性感知的环境选择(AES)显著优于随机采样和使用所有环境,说明更大的环境池可能引入冗余和冲突,从而阻碍训练。将AES与难度感知课程学习(HDC)结合进一步提高了性能,表明多样性和难度是多模态环境高效训练中互补的维度。消融研究证实,冗余控制、冲突控制以及辅助信息削弱和状态规模递进对于取得稳健增益都至关重要。

混合环境训练在多模态设置下导致的性能下降比文本-符号设置下更大。文本-符号版本仅出现轻微下降,而多模态版本则遭受大幅退化,表明多模态环境更易发生负迁移。在文本-符号环境中,混合训练相比单环境模型仅使性能下降1.3%。在多模态环境中,同样的混合训练导致性能下降10.7%,是文本-符号情形下降幅度的八倍以上。即便任务逻辑不变,多模态观测也会放大环境间的优化冲突,造成更强的负迁移。

没有任何文本辅助信息时,模型仅能达到较低的成功率。提供显式的文本状态描述带来的提升最大,其次是文本观测,规则描述提升较小但仍为正向。在所有辅助类型中,单轮表现始终优于多轮。文本状态和文本观测辅助相比无辅助基线带来了最大的性能提升。所有辅助类型均优于无辅助信息,其中文本状态效果最佳。每种辅助条件下,单轮成功率始终高于多轮成功率。

使用AES方法选择出的30个环境小集合,在最大化元能力覆盖的同时控制冗余和冲突,相较使用所有环境或随机选择,在分布内和分布外成功率上均带来了显著更高的相对增益。加入难度感知课程学习(HDC)进一步提升了这些增益,AES与HDC的组合取得了最强的整体性能。改善主要体现在目标环境上,而通用视觉-语言基准的性能几乎未变。在4B模型上,AES在分布内和分布外环境上分别取得了150.6%和40.3%的相对增益,远超使用所有环境训练时的80.1%和7.5%的增益。AES与HDC结合取得了最佳结果,在分布内/分布外测试组及两种模型规模上平均相对增益达143.2%,证明多样性和难度课程互为补充。从AES中移除冲突控制后,分布外相对增益从40.3%降至仅2.8%,显示了其在稳健环境选择中的关键作用。

完整的AES方法在分布外环境上相较基模型取得了40.3%的相对增益。移除冲突控制使提升几乎消失(仅2.8%的增益),而去除冗余控制则降至25.3%。两个组件都至关重要,冲突控制对性能影响更大。去除冲突控制使相对增益从40.3%骤降至2.8%,表明过滤冲突环境不可或缺。去除冗余控制使增益降至25.3%,并导致方法选出了41个环境而非30个,说明冗余环境降低了训练效率。

对HDC两个轴的消融显示,辅助削弱和状态规模递进均能在AES基线上带来单独提升。辅助削弱带来的增益大于状态规模递进。结合两个轴取得了最高的相对增益,表明它们互为补充,共同增强了多模态训练。仅用辅助课程比仅用规模课程带来了更大的平均相对增益。组合课程取得了最佳性能,确认了这两个难度组件互为补充。

实验通过对比文本-符号和视觉观测设置、测试文本辅助支架,并提出一种选择性环境采样方法(AES)结合难度感知课程学习(HDC),来评估多模态agent训练。混合环境训练因观测驱动的冲突,在多模态设置中导致不成比例的性能下降,而提供显式文本状态描述则带来了最大的成功率提升。AES方法在最大化元能力覆盖的同时控制冗余和冲突,显著提升了分布内和分布外性能,其中冲突控制对泛化性至关重要。将环境选择与逐步削弱辅助并增加视觉复杂度的课程相结合,进一步提升了效果,表明多样性和难度课程互为补充。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供