HyperAIHyperAI

Command Palette

Search for a command to run...

BadWAM:当世界-行动模型想象正确却行动错误时

Qi Li Xingyi Yang Xinchao Wang

摘要

世界-行动模型(WAMs)正成为具身控制的一种有前景的基础:它们不仅预测行动,还学习将行动生成与未来世界预测耦合的表征。这种耦合常被视为鲁棒性、可解释性和安全性的来源,因为机器人的行动原则上可以对照其想象的未来进行检验。本文中,我们证明这一假设是脆弱的。我们引入BadWAM,一个用于建模和评估世界-行动漂移攻击的统一框架:这是一类新的WAM特异性对抗攻击,利用微小的视觉扰动破坏WAM想象与执行之间的对齐。BadWAM根据两个自然标准刻画这一攻击面:攻击强度和隐蔽性。当对手优先考虑破坏时,BadWAM实例化一种仅行动对抗攻击,直接驱使模型走向任务失败的行动。当对手还优先考虑隐蔽性时,BadWAM实例化一种保持想象的对抗攻击,旨在引发有害的行动偏移,同时使模型预测的未来接近其干净想象。这两种攻击共同捕捉了WAM特异性故障的谱系:从公开的行动劫持到更隐蔽的情况,即模型看似想象出合理的未来,却执行了不同步的行动。我们在不同变体的WAM上评估BadWAM。结果表明,我们的攻击在闭环执行下显著降低了任务成功率。例如,我们的仅行动攻击将模型性能从96.5%降至43.1%的成功率。保持想象的攻击结果进一步暴露了WAM特有的脆弱性:适度的未来保持正则化可以在减少未来想象漂移的同时维持强大的攻击性能。

一句话总结

来自新加坡国立大学和香港理工大学的研究人员提出了BadWAM,一个统一的框架,用于世界-动作漂移攻击,利用微小的视觉扰动来破坏世界-动作模型所想象的未来与其执行的动作之间的对齐,并实例化了一个仅动作攻击,将任务成功率从96.5%降低到43.1%,以及一个想象保留攻击,在保持模型干净想象的同时引入有害的动作偏移,从而揭示了具身控制安全承诺中的一个关键脆弱性。

核心贡献

  • 本文提出了BadWAM,一个统一的框架,用于建模和评估世界-动作漂移攻击,这是一种新型的对抗攻击,利用微小的视觉扰动破坏世界-动作模型所想象的未来与其执行的动作之间的对齐。
  • BadWAM实例化了两种互补的攻击:仅动作攻击,直接驱使模型执行导致任务失败的动作;以及想象保留攻击,在诱导有害动作偏移的同时,保持预测的未来接近干净想象,从而捕捉了WAM特有的多种失败模式。
  • 在多个WAM变体上的评估表明,这些攻击将闭环任务成功率从96.5%降低到43.1%,而想象保留攻击揭示,适度的未来保持正则化可以在保持攻击性能的同时减少未来漂移,暴露出基于未来的安全监控器可能忽视的脆弱性。

引言

机器人基础模型越来越多地采用世界-动作模型(WAM),这类模型将动作生成与未来世界预测相结合,使行为扎根于物理后果,并通过想象的未来提供安全信号。然而,先前的工作将未来预测视为可信的监控器,忽视了攻击者可能将模型所想象的内容与其执行的内容解耦的可能性。本文作者识别出一种新的脆弱性,即世界-动作漂移攻击,其中微小的视觉扰动可以劫持WAM的动作,同时使其预测的未来在视觉上仍然合理,从而规避基于未来的安全检查。作者提出了BadWAM,一个统一的黑盒框架,该框架在从显式动作破坏到隐蔽想象保留攻击的范围内实例化这一威胁,并在多个WAM变体上证明,此类攻击会显著降低闭环任务成功率,同时使想象的推演序列接近其干净对应物。

方法

BadWAM是一个统一的框架,用于建模和评估针对已部署的世界-动作模型(WAM)的世界-动作漂移攻击。该框架将WAM视为一个可查询的预测-动作系统,并在每个重规划步骤中对有界视觉扰动进行优化。

该系统支持两种攻击实例化,分别对应攻击强度和隐蔽性谱上的不同位置:一种优先考虑执行失败的仅动作对抗攻击,以及一种额外约束预测未来漂移的想象保留对抗攻击。

作者受到以下实证观察的启发:在WAM中,动作和想象是耦合的,但并非不可分离。在闭环跟踪中,任务失败往往表现出比成功回合更大的动作偏移,而相应的想象偏移则可以大幅重叠。

这表明安全关键的对象是动作与想象之间的对齐。BadWAM围绕两个接口级距离来制定攻击:DactD_{act}Dact衡量干净动作块与被攻击动作块之间的偏差,DimgD_{img}Dimg衡量干净想象与被攻击想象之间的漂移。从概念上讲,隐蔽的对抗攻击旨在有界视觉扰动下寻求大的动作偏差,同时将想象漂移保持在可监控的阈值以下:

maxδεDact(aδ,a)s.t.Dimg(zδ,z)τimg.\max_{\|\delta\|_\infty \leq \varepsilon} D_{act}(a^\delta, a) \quad \text{s.t.} \quad D_{img}(z^\delta, z) \leq \tau_{img}.maxδεDact(aδ,a)s.t.Dimg(zδ,z)τimg.

仅动作攻击捕捉了该框架的高强度端。它将WAM视为一个可查询的控制器,并纯粹专注于执行破坏。它不对想象的未来施加任何约束,而是搜索一个最大化干净动作块与被攻击动作块之间偏差的有界视觉扰动:

δt=argmaxδtεDact(at:t+H1δ,at:t+H1).\delta_t^\star = \arg\max_{\|\delta_t\|_\infty \leq \varepsilon} D_{act}(a_{t:t+H-1}^\delta, a_{t:t+H-1}).δt=argmaxδtεDact(at:t+H1δ,at:t+H1).

干净动作块仅用作参考,意味着攻击者在优化过程中不需要真实专家动作或任务成功标签。被诱导的偏移不是无结构的输出损坏;扰动集中在与任务相关的通道上,如平移和夹爪指令,而它们的时间集中度在不同WAM变体上有所变化。

对于将想象未来暴露给规划器或安全关卡的WAM部署,仅动作目标是不可行的。BadWAM通过求解核心目标的拉格朗日松弛来实例化想象保留攻击:

δt=argmaxδtεDact(at:t+H1δ,at:t+H1)λDimg(zt+1:t+Kδ,zt+1:t+K).\delta_t^\star = \arg\max_{\|\delta_t\|_\infty \leq \varepsilon} D_{act}(a_{t:t+H-1}^\delta, a_{t:t+H-1}) - \lambda D_{img}(z_{t+1:t+K}^\delta, z_{t+1:t+K}).δt=argmaxδtεDact(at:t+H1δ,at:t+H1)λDimg(zt+1:t+Kδ,zt+1:t+K).

系数λ\lambdaλ控制攻击强度与隐蔽性之间的权衡。当解码后的未来视频可用时,想象距离被实例化为平均帧级距离:

Dimg(vt+1:t+Kδ,vt+1:t+K)=1Kk=1Kdframe(vt+kδ,vt+k).D_{img}(v_{t+1:t+K}^\delta, v_{t+1:t+K}) = \frac{1}{K} \sum_{k=1}^K d_{frame}(v_{t+k}^\delta, v_{t+k}).Dimg(vt+1:t+Kδ,vt+1:t+K)=K1k=1Kdframe(vt+kδ,vt+k).

BadWAM不通过WAM进行反向传播,也不访问模型参数。在每个重规划步骤中,攻击者将WAM视为一个可查询的输入-输出系统,并使用零阶有限差分查询来优化攻击目标。

对于当前扰动δt\delta_tδt,攻击者采样随机方向uiu_iui,并在正负扰动的观测下评估标量目标JJJ,以估计梯度:

^J(δt)=1mi=1mJ(δt+cui)J(δtcui)2cui,\widehat{\nabla} J(\delta_t) = \frac{1}{m} \sum_{i=1}^m \frac{J(\delta_t + c u_i) - J(\delta_t - c u_i)}{2c} u_i,J(δt)=m1i=1m2cJ(δt+cui)J(δtcui)ui,

其中ccc是有限差分半径,mmm是采样方向的数量。然后更新扰动并将其投影回可行的\ell_\infty球内:

δtΠ[ε,ε](δt+η^J(δt)).\delta_t \leftarrow \Pi_{[-\varepsilon, \varepsilon]} (\delta_t + \eta \widehat{\nabla} J(\delta_t)).δtΠ[ε,ε](δt+ηJ(δt)).

这种优化是零阶的,因为它仅使用根据WAM输出计算出的目标值。对于每个重规划步骤,BadWAM保留在查询预算内找到的最佳扰动,最终对抗观测用于生成机器人执行的动作块。

实验

评估在LIBERO和RoboTwin操作基准上以闭环控制测试BadWAM攻击,比较仅动作和想象保留目标对三种WAM变体的效果。攻击导致结构化的、随时间累积的渐进性任务失败,想象保留目标能够在保持预测未来更接近干净推演的同时,仍导致成功率大幅下降。扰动在WAM变体之间可迁移,简单的预处理防御或一致性检测器无法可靠地恢复安全性,这凸显了需要监控动作-想象同步性,而不仅仅是未来的表面合理性。

BadWAM攻击导致世界-动作模型变体的闭环任务成功率大幅下降,在LIBERO上效果最强。仅动作目标在所有模型上将成功率降低超过30个百分点,想象保留变体也达到了类似的破坏效果,表明将动作生成与未来预测耦合并不能阻止对抗失败。对仅动作WAM的仅动作攻击造成的下降最大,将LIBERO成功率从96.5%降至43.1%,而联合WAM和IDM WAM的下降幅度较小,但仍很严重,为30-36个百分点。想象保留攻击几乎与仅动作攻击同样有效,在LIBERO上将联合WAM的成功率降至63.0%,IDM WAM的成功率降至68.1%,证实了看似合理的预测未来并不能保证安全的动作。

BadWAM的扰动在WAM变体之间可迁移,对于仅动作和想象保留攻击,目标任务成功率降低至59–64%。仅动作攻击的下降幅度从34到41个百分点不等,而想象保留攻击的下降幅度为35-39个百分点,源侧想象距离适中(14.3–14.9)。强大的迁移性表明该脆弱性利用的是共享的观测空间方向,而非模型特定的产物。仅动作扰动在所有配对之间迁移:目标成功率降至64.2%(仅动作WAM → 联合WAM)、59.2%(联合WAM → IDM WAM)和61.7%(IDM WAM → 联合WAM)。想象保留攻击在联合WAM和IDM WAM之间迁移,将成功率从100.0%降至60.8%,从98.3%降至63.3%,源侧想象距离分别为14.86和14.32。迁移后的下降幅度仍然很大(34.2–40.8个百分点),表明攻击并未过度拟合于单个动作头,而是影响了相关WAM变体的动作生成。

轻量级预处理防御,如高斯模糊和JPEG-噪声集成,在保持清洁性能较高的同时,恢复了想象保留攻击所损失的大部分成功率。尺寸调整-裁剪集成在操作上不实用,因为它们严重降低了清洁成功率,并且仍然使被攻击策略几乎无法使用。低误报率下的一致性检测器会漏掉大多数攻击,表明这些非自适应基线并非完整的防御手段。高斯模糊将联合WAM上的被攻击成功率提升至85.0%,IDM WAM上提升至89.2%,而清洁成功率仍保持在98.3%。JPEG-噪声集成在联合WAM上实现了89.2%的被攻击成功率,清洁成功率保持在94.2%。尺寸调整-裁剪集成将清洁成功率降至52.5%(联合WAM)和54.2%(IDM WAM),攻击成功率降至接近零,因此在操作上不切实际。在5%误报率下,基于JPEG的增强一致性检测器仅捕获了13.4%的联合WAM和21.4%的IDM WAM被攻击重规划。这些预处理所获得的收益主要表明当前攻击是非自适应的;自适应攻击者可以通过相同的变换进行优化。

实验评估了在闭环机器人操作任务中对世界-动作模型(WAM)的对抗攻击,测量在仅动作和想象保留扰动下的任务成功率。攻击导致所有模型变体的成功率大幅下降,且想象保留变体并未降低脆弱性,表明将动作生成与未来预测耦合无法阻止对抗失败。扰动在不同WAM架构之间有效迁移,揭示了脆弱性源于共享的观测空间方向,而非模型特定的产物。像高斯模糊这样的轻量级预处理防御可以部分恢复性能,但它们对自适应攻击者并不鲁棒,这凸显了需要更强防御的必要性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供