HyperAIHyperAI

Command Palette

Search for a command to run...

RISE:面向世界行动模型的自适应想象力框架

Hongbo Lu Liang Yao Chenghao He Hao Han Fan Liu Wenlong Liao Tao He Pai Peng

摘要

世界行动模型(WAM)通过将未来世界演化纳入动作生成来改进规划,但现有方法为每个场景分配固定的想象力预算。我们提出 RISE(通过选择性推演精炼想象力),一种系统级自适应想象力框架,根据继续推演的预期规划收益做出序列化的推演/停止决策。在每一步,一个潜在评估器估计当前前缀所揭示的风险,以及如果想象力继续,规划能获得多大改善;同时,一个推演门控权衡这一预期收益与额外的计算成本。由于真实驾驶日志仅暴露一种已实现的未来,我们进一步构建了 CounterDrive,一个具有多样化结果和风险等级的反事实数据集,以丰富未来动态并提供局部风险监督。每个保留的样本都经过专家验证,并对轨迹有效性、事件起始点和因果类别进行标注,为安全关键的世界建模研究提供了可复用的资源。在 NAVSIM 和 nuScenes 上的实验表明,RISE 在减少不必要推演的同时取得了最佳的整体规划性能,额外的迁移结果支持其在不同 WAM 架构上的即插即用通用性。

一句话总结

来自COWARobot Co. Ltd、上海交通大学和河海大学的研究者提出RISE(Refining Imagination through SElective Rollout),一种用于World Action Models的自适应想象框架,利用Latent Evaluator和Rollout Gate基于预期规划收益做出序列化的Roll/Stop决策;同时引入CounterDrive,一个包含多样化结果和风险等级的反事实数据集,在NAVSIM和nuScenes上取得最佳整体规划性能,同时减少不必要的rollout。

核心贡献

  • 论文提出RISE,一种即插即用的自适应想象框架,利用Future Planning Gain做出序列化的roll/stop决策,实现依赖场景的rollout horizon,在规划质量和推理成本之间取得平衡。
  • 论文构建CounterDrive,一个包含多样化交互结果和风险等级的反事实驾驶数据集,为安全关键的世界建模研究提供局部风险监督和可复用资源。
  • 在NAVSIM和nuScenes上的实验表明,RISE在减少不必要rollout的同时取得最先进的规划性能,并且成功迁移至另一种WAM架构,证明了其即插即用的通用性。

引言

端到端自动驾驶越来越多地采用World Action Models(WAMs),在规划之前预测未来场景演变,使策略能够通过动作的后果来评估动作,而非仅依赖当前观测。这一点至关重要,因为相似的视觉上下文可能因自车和周围agent的交互方式不同而导致不同的结果。然而,此前的WAMs使用固定的推理调度:要么一次性想象完整的未来rollout,要么直接规划而不进行想象,要么遵循预定义的序列而不检查额外的预测步骤是否确实改进了规划。作者提出RISE,一种即插即用的自适应想象框架,用序列化决策过程替代固定深度的rollout。一个轻量级Scheduler同时估计当前规划风险和Future Planning Gain——即继续rollout所带来的规划分数的预期提升。这使得模型能够在局部决定是继续roll下一步还是停止,产生一个依赖场景的horizon,在规划质量和推理成本之间取得平衡。作者还构建了CounterDrive,一个反事实数据集,提供多样化的交互结果和风险监督,同时支持RISE训练和更广泛的安全关键世界建模。

数据集

作者从选定的NAVSIM和nuScenes场景中构建CounterDrive。它是一个配对的反事实数据集:每个保留的片段与其事实来源相关联,而非覆盖完整的源数据集。

  • 组成与来源:

    • nuScenes子集:2,432个训练片段和511个测试片段。
    • NAVSIM子集:5,013个训练片段和1,000个测试片段。
    • 未配对的事实样本仍可用于标准训练目标。
  • 生成与处理:

    • 对于每个选定的源关键帧,提示词结合了固定指令、场景描述以及指定事件位置和涉及对象的incident描述。
    • 提示词还约束相机视角、道路几何、背景和初始交通配置,以使生成的片段锚定在源场景中。
    • Wan 2.7生成一段10秒的1080p视频,以2 Hz采样为20帧。
    • OpenVO恢复逐帧的自车姿态,包括x位置、y位置和朝向,相邻姿态用于计算自车运动动作。
  • 标注与过滤:

    • 标注者验证自车运动一致性,识别第一个incident帧,标记生成失真,并将每个片段分类为正常、由非自车行为引起或由自车行为引起。
    • 当恢复的轨迹与视觉观察到的自车运动不一致时,该轨迹被标记为无效。
    • 对于自车引起的incident,标注者记录推荐的避让或停止动作作为片段级元数据。
    • 存在严重失真或不可靠运动的片段被移除。
  • 用途:

    • 被接受的片段用于监督未来预测。
    • 经验证的incident对提供时间局部化的风险排序监督。
    • 未配对的事实样本可用于标准训练目标。

方法

作者提出RISE(Refining Imagination through SElective Rollout),一种即插即用的自适应想象框架,专为World Action Models(WAM)设计。RISE不依赖每个场景的固定rollout深度,而是根据具体的驾驶上下文动态确定有效的rollout深度。该方法通过仅在有益时选择性地扩展未来世界表示,在规划风险和计算成本之间取得平衡。

如下图所示:

该框架用一个轻量级Scheduler增强标准的Encoder-Predictor-Planner WAM,Scheduler包含一个Latent Evaluator和一个Rollout Gate。Encoder采用冻结的V-JEPA 2图像编码器,以ViT-L为骨干网络,将前摄像头观测处理为latent token。Predictor是一个帧因果、以自车运动为条件的Transformer,自回归地生成未来latent步。Planner是一个扩散Transformer,以观测token和选定的未来前缀为条件,生成候选轨迹。

自适应机制的核心在于Scheduler。在每个rollout深度hhh,Latent Evaluator预测一个Risk Profile RhR_hRh和一个Future Planning Gain Profile BhB_hBh。Risk Profile总结了当前前缀所暴露的轨迹风险,而Future Planning Gain Profile估计继续rollout时规划的潜在改进。Rollout Gate随后评估这些信号以及累积计算成本和一个计算偏好参数λ\lambdaλ。它输出一个决策xhx_hxh;如果xh>0x_h > 0xh>0,Predictor追加另一个未来latent步,并重复该过程。如果xh0x_h \le 0xh0,rollout停止,选定的前缀被传递给Planner。

RISE分三个不同阶段训练,以确保稳定收敛和有效的策略学习。在第一阶段,作者使用真实和被接受的反事实序列训练Predictor和初始的可变前缀Planner。Predictor被训练以生成未来latent,而Planner学习在变化的前缀长度条件下输出轨迹。

在第二阶段,训练Latent Evaluator和一个引导式Planner。Risk Profile使用基于几何的评估器在真实数据上进行监督,并进一步使用CounterDrive中的配对事实-反事实数据进行精炼,其中反事实incident提供局部风险校准。一旦Risk Profile被学习,未来前缀通过一个小的范数约束更新进行精炼以最小化风险。Planner随后在这些风险精炼后的前缀上重新训练。Future Planning Gain Profile随后被训练以预测通过扩展rollout所实现的规划分数提升。

最后,在第三阶段,Rollout Gate被训练为一个成本感知的停止策略。通过枚举所有有效的rollout深度并计算给定偏好λ\lambdaλ下的最佳剩余成本调整增益,作者构建了一个二值继续目标。Gate被训练以预测预期的规划增益是否值得额外的计算开销,从而完成自适应想象流程。

实验

RISE在NAVSIM和nuScenes上针对多种驾驶world-action models在无感知设置下进行评估。消融实验表明CounterDrive和Scheduler是互补的:CounterDrive改进未来监督和安全关键风险评估,而Scheduler自适应地分配rollout深度,作为即插即用模块具有泛化能力,因为最优深度因场景而异。总体而言,RISE取得了最先进的规划性能,并产生符合车道、安全的轨迹。

在nuScenes上,RISE在比较方法中取得了最强的整体规划性能,具有最低的平均L2误差和最低的平均碰撞率。它在平均L2和更长horizon碰撞方面优于最近的基线DAWN,同时在一秒碰撞结果上与之持平。这些结果表明,相对于现有的驾驶world-action models,RISE具有更好的轨迹准确性和更安全的长horizon行为。RISE在所有评估方法中记录了最低的平均L2误差和平均碰撞率。RISE在平均L2和三秒碰撞方面优于DAWN,同时在一秒碰撞性能上与之持平。

在NAVSIMv1上,RISE取得了最佳的整体规划分数,达到91.5 PDMS,超过最强基线0.8分。在所列基线方法中,DreamerAD记录了最高的规划分数,其次是PWM和DriveVLA-W0。RISE还将先前最佳的EP和TTC以有意义的幅度提升。RISE以91.5 PDMS领先NAVSIMv1规划性能,超过所有列出的基线。在所列基线中,DreamerAD拥有最强的PDMS,其次是PWM和DriveVLA-W0,而领先方法的碰撞分数均为完美或接近完美。RISE将先前最佳的EP和TTC分别提升了2.9和1.9分。

该表比较了驾驶world-action models在NAVSIMv2规划指标上的表现。RISE取得了最高的整体EPDMS,并在九个分量指标中的七个上排名第一或并列第一,表明其在安全性、合规性和规划质量方面具有广泛优势。最接近的竞争方法在整体性能上落后约一分。RISE领先NAVSIMv2整体性能,次优方法落后0.9个EPDMS点。RISE在九个分量指标中的七个上排名第一或并列第一,包括无碰撞、碰撞时间和车道保持。特定基线在个别指标上领先,例如DriveFuture在可行驶区域合规性方面和EponaV2在自车进度方面,但RISE提供了最强的综合结果。

移除Scheduler和CounterDrive得到一个基线EPDMS为88.9,PDMS为89.7。单独使用CounterDrive提供了适度的提升,而单独使用Scheduler实现了更大的改进。同时使用两个组件取得了最高分数,表明反事实未来学习和自适应rollout分配是互补的。单独使用CounterDrive将EPDMS从88.9提升至89.8,PDMS从89.7提升至90.5,表明反事实未来为未来表示学习提供了有用的监督。单独使用Scheduler达到90.4 EPDMS和91.2 PDMS,优于单独使用CounterDrive,而结合两者取得了最佳的90.8 EPDMS和91.5 PDMS,显示了它们的互补作用。

反映规划增益的自适应停止优于启发式策略:学习到的scheduler以2.40的平均rollout达到90.8 EPDMS,而随机停止和latent收敛停止尽管具有不同的成本特征,但EPDMS平台期在89.5–89.7附近。这表明决定何时停止rollout应由任务收益驱动,而非固定的随机性或latent相似性。随机停止提供最低的延迟但最弱的规划性能(89.5 EPDMS)。Latent Margin平均使用最多的rollout,但仅比随机停止略有改进。Scheduler以适中的rollout和延迟成本取得最高的EPDMS,表明规划感知的停止比随机或基于收敛的标准更有效。

RISE在nuScenes和NAVSIM自动驾驶规划基准上进行评估,始终以更低的轨迹误差和碰撞率取得最佳整体性能。消融研究证实CounterDrive模块和Scheduler组件提供互补的收益,其组合取得了最高的规划分数。由规划增益驱动的学习型自适应停止策略优于随机或基于收敛的启发式方法,表明rollout分配应由任务收益而非固定标准来引导。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供