Command Palette
Search for a command to run...
特征空间流匹配用于随机世界建模
特征空间流匹配用于随机世界建模
François Porcher Nicolas Carion Karteek Alahari Shizhe Chen
摘要
世界建模需要预测不确定的未来,同时保留对下游感知有用的信息。现有的视觉世界模型往往难以同时满足这两个目标:基于VAE的随机模型在低维重建潜变量中运行,这可能限制感知性能;而使用强预训练特征的确定性预测器则将多模态未来坍缩为单一的模糊均值。在本工作中,我们提出了FlowWM,一种直接在预训练特征空间(如DINOv3)中执行流匹配的随机世界模型。这具有挑战性,因为预训练特征维度相当高,使得标准扩散方法不够理想。为解决这一问题,我们研究了特征空间流匹配所需的设计选择,并引入了一种可微的单步投影机制,该机制能够实现具有时间一致性和任务驱动目标的高效训练。我们在两个基准上评估了FlowWM:一个用于系统评估准确性和多样性的合成基准,以及一个真实世界基准FuturePerception。FlowWM提升了感知性能、模式覆盖率和时间范围鲁棒性,验证了我们为高维特征空间中的随机世界建模所提出的设计。
一句话总结
FAIR at Meta 与 Inria 提出 FlowWM,一种随机世界模型,直接在高维预训练特征空间(例如 DINOv3)中执行流匹配,并利用可微的单步投影来施加时间一致性和任务驱动目标,在合成基准和真实世界 FuturePerception 基准上均取得了更好的感知、模式覆盖和预测视界鲁棒性。
核心贡献
- FlowWM 是一种随机世界模型,直接在高维预训练视觉特征空间(例如 DINOv3)中执行流匹配,能够生成多样化的未来预测,同时为下游任务保留语义结构。
- 引入可微的单步投影机制,在训练中融入时间一致性和任务驱动目标,避免通过完整扩散轨迹进行反向传播,从而提升效率。
- 论文贡献了一个用于系统评估准确性和多样性的合成基准、真实世界 FuturePerception 基准,并表明 FlowWM 在感知性能、模式覆盖和预测视界鲁棒性上均优于先前方法。
引言
在自动驾驶和机器人领域,视觉世界模型根据过去的上下文预测未来状态,但表示的选择至关重要:预测必须为下游感知和规划保留语义与几何信息,而不仅仅是像素保真度。先前的工作要么使用针对重建而非感知优化的 VAE 潜在变量,要么依赖预训练特征空间中的确定性预测器,将多模态未来折叠为单一平均值,产生不真实的结果。作者提出 FlowWM,一种随机世界模型,直接在高维预训练特征空间(如 DINOv3)中应用流匹配。他们引入了针对高维潜在变量的架构和调度选择,以及一个可微的单步投影,能够在无需反向传播整个采样轨迹的情况下,利用时间一致性和任务驱动目标进行高效训练。FlowWM 在合成弹跳形状环境和真实世界自动驾驶基准中,相比确定性和随机基线,均提升了感知性能、模式覆盖和预测视界鲁棒性。
数据集
作者使用两个互补的基准评估潜在世界模型,一个合成和一个真实世界,旨在衡量与规划和控制相关的感知质量。
-
合成基准
-
来源: 自定义生成的受控随机环境。
-
组成: 高度结构化场景中的简单物体。
-
目的: 支持具有完整真实值的严格、可复现评估。
-
用法: 模型在预测未来帧上进行测试,并直接从生成序列中计算感知指标。
-
真实世界基准:FuturePerception
-
来源: 完全基于 Waymo Open Dataset 构建,该数据集最初用于物体跟踪。
-
组成与过滤: 未应用数据过滤;数据集保留了真实世界自动驾驶场景的自然分布。
-
视频属性: 高分辨率帧(1920×1280),10 FPS。
-
任务定义: 使用 4 个上下文帧预测接下来 12 帧,对应未来 1.2 秒。
-
处理: 未提及额外的裁剪或元数据生成;直接使用原始帧。
-
用法: 该基准仅用于评估。潜在世界模型生成未来帧预测,并通过下游感知任务评估潜在预测的质量:
-
目标检测: 在大型车辆、行人和骑行者上使用 AP_L(N)(最佳 N 次平均精度,以捕捉多模态未来)进行评估。
-
深度估计: 使用标准 RMSE 和阈值精度 δ_i 进行评估。
-
划分: 未描述明确的训练集划分;该基准作为一个固定的评估协议,衡量预测帧对感知模块的支持程度。
方法
作者提出 FlowWM,一种随机潜在空间世界模型,直接工作在预训练视觉编码器的高维潜在空间。给定视频序列,使用冻结的预训练编码器(如 DINOv3)逐帧编码初始上下文帧,得到上下文潜在变量。然后模型预测后续的潜在帧。评估时,使用冻结的解码器对预测的特征进行下游感知任务。
参考框架图:
为生成未来潜在变量,作者采用标准线性概率路径的流匹配。设 x0 表示噪声潜在变量,x1 表示以上下文潜在变量 xctx 为条件的未来帧对应的数据潜在变量。沿概率路径使用连续插值变量 τ∈(0,1),计算噪声与数据之间的线性插值: xτ=(1−τ)x0+τx1 对于此线性路径,真实速度场为 u⋆(xτ,τ)=x1−x0。训练一个神经网络 uθ(xτ,xctx,τ) 来近似该速度,学习条件分布 p(xfuture∣xctx)。采样时,从 x0∼pnoise 出发,对 ODE dτdxτ=uθ(xτ,xctx,τ) 从 τ=0 到 τ=1 进行积分。
如下图所示:
模型采用基于 Transformer 的潜在生成架构。它将带噪目标潜在变量 xτ 作为输入,并通过交叉注意力条件化于编码的上下文帧 xctx。位置嵌入分解为时间和空间分量,对两者均施加旋转位置编码(RoPE)。架构包含一个用于多模态融合的主干网络和一个用于速度预测的投影头。主干网络包含 2 个 DiT 风格的 Transformer 块(维度 256),并带有查询-键归一化。产生的特征通过 AdaLN 条件化送入一个浅而宽的投影头,该投影头由 2 个宽投影层(维度 1024)组成。这一宽投影维度确保投影头的隐藏维度超过每个 patch 的潜在维度,这对于在高维潜在空间中准确预测速度场至关重要。
训练过程涉及多个目标。标准流匹配目标优化条件期望平方误差: LFM(θ)=Ex1∼pdata,x0∼pnoise,τ∼U(0,1)[∥uθ(xτ,τ)−(x1−x0)∥22] 为确保时间一致性并避免闪烁等伪影,作者引入一个受物理信息神经网络启发的正则化项。他们不使用计算成本高昂的 ODE 积分,而是采用单步投影获得预测终点的可微估计: x~1(τ)=xτ+(1−τ)uθ(xτ,τ) 然后强制真实时间差与通过该投影获得的预测潜在变量之间的时间差对齐,从而产生辅助时间损失: Ltemporal=∑t=1T−1∥Δx~t−ΔxtGT∥2 此外,如果已知下游任务,可以融入任务驱动目标。利用单步投影获得可微估计 x~1,应用冻结的下游检测器(例如用于目标检测),并将其检测损失通过投影及世界模型反向传播,使表示朝向语义效用。
最后,为在生成张量维度增加时保持稳定的信噪比,作者应用分辨率依赖的时间步偏移。原始时间步 τ 变换为: τ′=1+(α−1)τατ 这通过一个因子 α 将扩散时间重新缩放至更嘈杂的时间步,保留端点,同时将概率质量重新分配到更大的噪声水平。
实验
评估使用合成弹跳形状基准和基于 Waymo 的真实世界 FuturePerception 基准,通过下游感知任务(如目标检测和深度估计)评估潜在世界模型预测。FlowWM 在高维语义潜在空间中的随机建模一致优于确定性以及低维 VAE 的替代方案,能更好地捕捉多模态未来,并在更长的预测视界上保持准确性。消融实验证实,宽投影头、时间一致性损失和偏移时间步调度是关键设计选择,而随着采样未来数量的增加,随机采样可持续提升性能。
FlowWM 在弹跳形状基准上取得了比确定性模型和先前随机方法大幅度更低的预测误差。F1 误差从 14 以上降至 5 以下,时间一致性损失进一步带来提升。收益来自更准确的样本和对可能未来的更好覆盖。与确定性预测器和早期随机方法相比,FlowWM 的精确率、召回率和 F1 误差均大幅降低。添加时间一致性损失进一步改善所有指标,使 F1 误差更接近 oracle。确定性模型和先前的随机基线的 F1 误差均高于 14,而 FlowWM 将其降至 5 以下,逼近 oracle 接近零的误差。
在目标检测和深度估计方面,FlowWM 一致优于所有基线,相比确定性和基于 VAE 的世界模型提升尤为显著。使用语义潜在变量相比 VAE 潜在变量具有明显优势,将 VAE 输出重新编码到语义空间也无法弥补差距,这证实了表示质量而非仅仅是预测方法驱动了下游性能。随机建模在真实世界场景中至关重要,因为 FlowWM 随时间推移性能下降更慢,并受益于采样多个未来。FlowWM 获得了最高的检测和深度分数,大幅超越确定性预测器和基于 VAE 的世界模型。将 VAE 预测重新编码到 DINOv3 空间会略微降低检测性能,表明 VAE 潜在空间缺乏感知任务所需的语义保真度。与确定性预测器相比,FlowWM 将 Fréchet Video Distance 降低了 43%,产生的未来帧在分布上更接近真实驾驶视频。确定性世界模型随时间累积误差更快,而随机模型保留了多个可能未来,从而产生更稳定的长视界预测。额外采样一致提升了 FlowWM 的检测性能,而确定性模型无法从额外样本中获益。
在弹跳形状基准和真实世界驾驶感知任务上评估,FlowWM 相比确定性和先前随机模型实现了显著的误差降低,在弹跳形状上将 F1 误差从 14 以上降至 5 以下,并接近 oracle。使用语义潜在变量对下游性能至关重要,随机建模带来更慢的误差累积,并受益于采样多个未来,使 Fréchet Video Distance 降低 43%。这些结果证实,采用语义表示的流匹配能够产生更准确且分布上更真实的未来预测。