Command Palette
Search for a command to run...
SimWAM:面向端到端自动驾驶的简易世界-行动模型
SimWAM:面向端到端自动驾驶的简易世界-行动模型
Zongchuang Zhao Xin Zhou Tianyang Xu Zhengyang Sun Kaixuan Zhou Honglin Li Dingkang Liang Xiang Bai
摘要
世界-行动模型(WAM)通过将视频动态先验迁移至行动预测来改进端到端自动驾驶,但现有方法在推理时需要代价高昂的未来帧生成。我们提出 SimWAM,一种简易而有效的 WAM,它仅将视频生成用作训练信号。该方法利用联合流匹配对预训练的视频专家和一个轻量级行动专家进行协同训练。一个隔离的注意力掩码使行动预测独立于未来帧,从而在训练后可丢弃视频分支,留下一个直接预测轨迹的自包含规划器。由于两个专家不共享参数且仅通过统一的注意力接口交互,视频骨干网络可以被替换,行动专家可以独立扩展,而无需修改学习目标或推理流程。我们进一步应用强化学习来优化超越轨迹模仿的组合式驾驶奖励。SimWAM 在 NAVSIM 上达到 91.5 PDMS,以显著更低的延迟超越了当前最先进的基于 WAM 的规划器,并可零样本迁移至 nuScenes。这些结果使 SimWAM 成为一个简易而坚实的基础基线,能够直接受益于视频生成领域的进展,以实现高效的自动驾驶。代码和模型权重见 https://github.com/H-EmbodVis/SimWAM/。
一句话总结
SimWAM 是华中科技大学与东风公司提出的一个简单世界-动作模型,通过流匹配和隔离注意力掩码联合训练视频专家与动作专家,将视频生成仅用作训练信号,使得训练后丢弃视频分支即可得到一个自包含的规划器,在 NAVSIM 上达到 91.5 PDMS,以显著更低的延迟超越了当前最先进的世界-动作模型规划器,并能零样本迁移到 nuScenes。
核心贡献
- 一种训练时范式,利用联合流匹配将运动先验从预训练的视频专家迁移到轻量动作专家,使视频分支可在推理时被丢弃,得到一个自包含的规划器用于直接轨迹预测。
- 采用隔离注意力掩码且无共享参数的模块化架构,允许独立扩展和替换视频骨干网络而不改变学习目标或推理管线。
- 使用组合驾驶奖励的强化学习精调阶段,在模仿学习之外优化自包含规划器,在 NAVSIM 上获得 91.5 PDMS,延迟低于先前基于世界-动作模型的规划器,并能零样本迁移到 nuScenes。
引言
端到端自动驾驶用一个单一网络取代经典模块化管线,直接将传感器观测映射到规划轨迹,减少了误差传递,但严重依赖仅隐式捕获交通语义、用户意图和场景动态的模仿学习。视觉-语言-动作模型通过整合预训练知识来改善语义理解,而世界-动作模型则引入视频生成以显式建模环境演变。然而,现有的驾驶世界-动作模型遵循“想象再行动”的范式,将昂贵的未来帧生成耦合进实时规划循环中,显著增加了推理延迟。作者提出 SimWAM,一个精简的世界-动作模型,通过流匹配联合训练一个预训练视频专家和一个轻量动作专家,并使用隔离注意力掩码来阻止动作专家访问未来帧。训练后移除整个视频分支,将交通动态先验转移到直接轨迹预测器中,不产生测试时的生成开销,并可进一步通过强化学习精调以优化驾驶质量。
方法
作者提出 SimWAM,一个用于端到端自动驾驶的世界-动作模型。整体框架如下所示。
SimWAM 采用直接策略接口进行轨迹规划。给定前视相机观测 ot、自车状态 st 和导航指令 l,规划器在自车坐标系中预测自车轨迹 at+1:t+H。与依赖“想象再行动”分解的现有驾驶世界-动作模型不同,SimWAM 将策略表达为 pθ(at+1:t+H∣ot,st,l)=pθ(at+1:t+H∣z(ot),st,l),其中 z(ot) 是当前观测的表征。这一设计确保推理既不需要未来场景的隐变量,也不需要辅助运动模块。
该架构包含两个主要组件:一个视频专家和一个轻量动作专家。视频专家是一个从预训练模型初始化的视频 Diffusion Transformer,配备一个视频 VAE 和一个 T5 文本编码器。VAE 将驾驶帧映射为隐式 token,导航指令通过 T5 交叉注意力进行集成。当前帧作为干净条件,未来帧被加噪并通过流匹配重建。动作专家是一个轻量 Diffusion Transformer,以 c={z(ot),st,l} 为条件,通过流匹配预测轨迹速度场 vθa(at+1:t+Hτ,τ,c),其中一个小型 MLP 嵌入自车状态。
为在训练时利用视频生成,同时在推理时消除其计算开销,作者引入了一种隔离注意力掩码。在共享注意力流中,当前观测隐变量、未来帧隐变量和动作 token 一起处理。未来帧 token 和动作 token 均可关注当前观测隐变量,但彼此不可见。这种结构性修改将动作专家与视频分支解耦,使得视频 Diffusion Transformer 和未来帧解码器在训练后可被丢弃。因此,动作专家保持自包含,并直接从当前输入预测轨迹。
在联合训练阶段,两个专家仅通过共享注意力流交互。视频与轨迹模态上的联合流匹配使得未来场景预测能够影响用于规划的观测表征。联合目标定义为:
L=LFMact+λLFMvid其中 LFMact 和 LFMvid 分别是对动作轨迹和未来帧隐变量计算流匹配损失,λ 平衡两项。基础流匹配损失由下式给出:
LFM=Ex,ϵ,τ[∥vθ(xτ,τ,c)−(ϵ−x)∥22]为进一步优化轨迹生成以提升驾驶质量,作者引入强化学习。由于确定性流 ODE 缺乏多样化驾驶操作探索和可处理的转移似然所需的随机性,它被转化为一个保边缘分布的 SDE:
dxτ=[vθ(xτ,τ)+2τστ2(xτ+(1−τ)vθ(xτ,τ))]dτ+στdw,στ=a1−ττ其中 dw 是维纳增量。在 RL 阶段,对每个场景采样一组候选轨迹,并使用组合奖励函数进行评估。基于组相对优势进行裁剪策略更新,仅更新动作专家的 LoRA 适配器以保留蒸馏的运动先验。
实验
SimWAM 仅使用一个前视相机在 NAVSIM 规划基准上进行评估。其两阶段训练——与视频生成模型联合学习,然后在困难场景上进行强化学习——在无辅助运动模块的情况下获得了最先进的端到端规划性能。隔离注意力设计将动作预测与未来视频解耦,保持了高效推理,同时动作专家和视频专家的独立扩展进一步加强了结果。定性和跨数据集评估证实了更果断但安全的驾驶行为、很强的泛化能力以及非常低的碰撞率。
仅使用一个前视相机,SimWAM 在 NAVSIM navtest 基准上达到 91.5 PDMS,为学习型端到端规划设立了新的最优水平。它比最强的基于 VLM 的规划器高出 0.4 点,比图像预测增强的 ExploreVLA 高出 1.1 点,同时在世界模型方法中取得了最佳的行驶区域合规性和自车进度,并保持了有竞争力的无碰撞和碰撞时间分数。使用单个前视相机,SimWAM 达到 91.5 PDMS,超越了包括基于 VLM 和基于世界模型的所有先前学习型规划器。SimWAM 在相同传感器设置下,超出基于 VLM 的规划器 SGDrive 0.4 PDMS,超出世界模型规划器 ExploreVLA 1.1 PDMS。在世界模型规划器中,它达到了最高的行驶区域合规性和自车进度,同时保持了有竞争力的无碰撞率和碰撞时间。
从纯动作模型 86.6 PDMS 起步,加入视频联合训练后各指标全面提升,PDMS 提升至 90.3,这是因为它注入了交通动态先验。随后的强化学习通过更好地平衡进度与安全,进一步将 PDMS 提升至 91.5,累计提高 4.9 点。纯动作模型达到 86.6 PDMS。加入视频联合训练改善所有指标,将 PDMS 提升至 90.3。强化学习将 PDMS 推至 91.5,主要通过提高进度分数(EP),而碰撞时间(TTC)和合规性(NC)略有下降。视频联合训练和 RL 共同贡献了 4.9 PDMS 的提升。
隔离注意力掩码获得了最高的规划分数,同时将动作专家与未来视频 token 解耦,这与将视频分支绑定到推理的双向和动作→视频掩码不同。它在 NC 和 TTC 上取得最佳,仅在 EP 上略有取舍,表明暴露于未来视频 token 对动作分支没有可测量的益处,且更简单的依赖结构有利于高效部署。隔离注意力达到 90.3 PDMS,优于双向(90.2)和动作→视频(90.1)。隔离掩码在 NC(98.7)和 TTC(95.9)上最高,而 EP 略低为 83.9。双向和动作→视频掩码将动作预测与未来视频 token 耦合,使得视频分支在推理时必不可少,但规划分数却低于隔离设计。将动作专家与未来视频解耦,移除了部署依赖而不牺牲整体驾驶质量。
SimWAM 的统一注意力接口兼容多种预训练视频骨干网络,PDMS 得分范围从 88.7 到 90.4。在驾驶数据上预训练的骨干网络(如 Cosmos-Predict2.5)提供更强的动态先验,取得了最佳的整体规划分数,而轻量级骨干网络(LTX-Video)明显落后。结果表明该方法不依赖于特定视频模型,并能轻易吸收更高质量、领域相关的视频先验。更换视频骨干网络得到的 PDMS 得分在 88.7 至 90.4 之间,说明对预训练生成器的选择具有鲁棒性。驾驶预训练的 Cosmos-Predict2.5 取得了最高 PDMS(90.4)以及最高的 EP 和 TTC,证实领域相关先验可改善规划。轻量级 LTX-Video 骨干仅得到 88.7 PDMS,表明视频先验质量显著影响性能。Wan2.1-1.3B 和 Wan2.2-5B 分别取得了相似的高 PDMS(90.2 和 90.3),显示该框架不绑定于单一骨干。
将动作专家从 0.21B 参数扩展到 1.02B,驾驶分数从 89.9 稳步提升至 90.3 PDMS,安全与合规指标持续改善。独立双专家设计允许根据规划质量和效率需求调整动作专家规模,而更大的视频专家可在不增加部署成本的情况下增强训练监督。当动作 DiT 规模从 0.21B 增长至 1.02B 时,PDMS 从 89.9 升至 90.3。NC、DAC 和 TTC 在缩放过程中略有提升,而 EP 保持稳定,表明在进度上无取舍。解耦架构支持独立扩展,使得视频专家能在不影响推理开销的情况下改进训练先验,而动作专家则可在质量与效率之间权衡。
SimWAM 在 NAVSIM navtest 基准上使用单个前视相机进行评估,获得了最先进的端到端规划性能。消融实验显示,视频联合训练和强化学习通过注入动态先验和平衡进度与安全,逐步提升了驾驶分数。该模型的隔离注意力设计将动作专家与未来视频 token 解耦,在不损害驾驶质量的情况下去除了推理时依赖。其他研究证实了该框架在不同预训练视频骨干上的通用性及其有效扩展动作专家的能力。