Command Palette
Search for a command to run...
Spatial-Interactor:通过与可观测物理世界交互学习空间推理
Spatial-Interactor:通过与可观测物理世界交互学习空间推理
Kaixiang Yao Xu Wang Miao Pan Hu Xiyue Weishi Wang Daniel Dahlmeier Jintao Chen Yongliang Shen Xuhong Zhang Wenqi Zhang
摘要
空间推理对于视觉语言模型(VLM)理解物理世界并在其中行动至关重要。在动态环境中进行推理要求 VLM 感知由物体运动和视点变化引起的局部状态转移,并沿长轨迹整合这些转移,以维护更新后的空间状态。然而,现有 VLM 在这两项能力上仍存在局限。当前的空间训练主要关注关于物体属性和空间关系的静态问题,对状态转移提供的直接监督有限。相比之下,交互轨迹天然地将前一次观测、动作和后一次观测连接起来,为局部状态转移提供直接监督,而完整轨迹则揭示连续转移之间的依赖关系。因此,我们提出了 Spatial-Interactor,这是一个通过交互训练 VLM 建模物理世界状态转移的框架。我们将这一学习过程组织为一个三级课程体系,涵盖 L1 被动世界状态转移、L2 主动自我状态转移和 L3 长时程交互轨迹。相应地,我们从仿真和真实交互轨迹中构建了 Learning from Spatial Interaction 数据集(LSI-108K),其中的任务与每一级目标对齐。我们的两阶段训练策略对 L1 和 L2 应用监督微调(SFT),用于局部转移建模。随后,在线策略蒸馏(OPD)采用特权自蒸馏:一个教师分支获得片段级转移描述,监督学生的在线策略思维链(CoT),帮助学生在 L3 长轨迹上学会整合连续转移。在多个 VLM 和空间基准上的实验表明,模型在局部转移建模和长时程整合方面均获得一致提升。
一句话总结
浙江大学和SAP的研究者提出Spatial-Interactor,这是一个通过交互训练视觉语言模型以建模物理世界状态转移的框架,其采用三级课程,涵盖被动世界状态转移、主动自身状态转移和长时程交互轨迹;借助LSI-108K数据集,该框架将用于局部转移建模的监督微调与用于改进长时程整合的on-policy特权自蒸馏相结合,在多个VLM和空间基准上取得一致提升。
核心贡献
- 本文提出了Spatial-Interactor,一个以交互为中心的框架,通过使用交互轨迹作为局部转移建模和长时程整合的直接监督,训练视觉语言模型建模物理世界状态转移。
- 本文构建了Learning from Spatial Interaction数据集(LSI-108K),这是一个由模拟交互和真实世界轨迹合成的108K可验证问答对组成的三级课程,涵盖被动世界状态转移、主动自身状态转移和长时程交互轨迹。
- 两阶段训练方案将在L1和L2任务上的监督微调用于局部状态转移建模,与在L3长时程整合中使用特权段级转移描述的on-policy蒸馏相结合。跨多个视觉语言模型和空间推理基准的实验显示一致改进,包括16.4至25.0分的总体提升和4.3至10.6分的跨基准提升。
引言
视觉语言模型在图像描述和视觉理解等数字世界任务上已取得显著进展,但在动态三维环境中仍然表现挣扎,因为此类空间推理需要跟踪观测如何随视角和时间变化。作者表明,现有模型通常依赖对顺序不敏感的视觉线索,无法建模局部状态转移,也无法在长轨迹上整合连续变化,部分原因在于传统空间训练侧重于关于物体属性和关系的静态问答。为解决这一问题,他们提出了Spatial-Interactor,这是一个后训练框架,使用“观测、动作、下一观测”形式的交互轨迹作为直接监督。该框架包括LSI-108K,一个包含108K可验证问答对的三级课程,涵盖被动世界变化、主动自我运动变化和长时程轨迹,并结合用于局部转移的监督微调和用于长时程整合的on-policy蒸馏。
数据集
作者引入LSI-108K,将其作为一个基于渐进式课程构建的空间交互推理数据集。
数据集构成与来源
- 模拟agent探索可到达的场景,并执行相机运动或物体操作。
- 真实轨迹提供相机位姿、机器人末端执行器状态和物体轨迹。
- 每条记录将有序观测与已执行或几何测量的状态变化配对。
子集与课程层级
- L1,被动世界状态转移:覆盖稳定视角下的外部世界变化,包括物体位移、属性和关节变化、遮挡、可见性、相对配置、单步和多步操作、顺序及结果。
- L2,主动自身状态转移:保持环境稳定,同时相机平移、旋转和高度变化改变观测;包括自我运动推断、幅度比较、组合、时序排序、跨视图对应、基于锚点的定位、视差、可见性和运动后关系预测。
- L3,长时程转移整合:使用完整相机轨迹;全局任务恢复路径长度、终点位移和轨迹形状;关键节点任务识别转向区间和再次访问的位置,并支持反向路径推理。
处理与元数据构建
- 状态、位姿和轨迹元数据决定目标。
- 确定性模板将目标呈现为问答对。
- 过滤会移除可忽略的转移、不连续或冗余轨迹以及模糊目标。
- 冻结的视觉语言验证器会拒绝视觉上无法回答的实例,而不生成或修改其真实答案。
该数据集的使用方式
- 该课程支持每条交互记录的多尺度复用。
- 局部窗口和有序动作序列支持L1和L2。
- 完整相机轨迹支持L3。
- 可以从同一条已验证记录生成多个互补问题,在无需单独采集流程的情况下扩展任务多样性和推理视野。
- 自动流程生成LSI-108K,其构成和代表性任务见图4和图5。
- 所提供的摘录未说明具体训练划分、混合比例或裁剪策略。
方法
作者提出了一个基于空间交互中状态转移学习的动态空间推理框架。在动态环境中,视觉观测 Ot 取决于世界状态 Wt 和观察者位姿 Et。为了对此建模,作者将交互轨迹表示为局部交互记录的有序序列 T=(δ1,…,δT−1),其中每条记录 δt=(Ot,at,Ot+1) 将连续观测与物理变化 at(例如物体操作、环境事件或相机运动)对齐。这种结构使模型能够从单条记录中学习局部转移推断,并从组合序列中学习轨迹级推理。
为了系统地训练模型,作者设计了一个渐进式空间交互课程,按被更新的状态和时间跨度组织监督信号。该课程由互补的模拟和真实交互记录实例化,将已执行的交互和几何轨迹转换为可验证的转移目标和问答对。完整数据构建流程见框架图。
这一低成本自动过程包括移除可忽略的转移,并使用冻结的视觉语言验证器拒绝视觉上无法回答的实例,最终生成LSI-108K数据集。
该课程分为三个层级:
- L1(被动世界状态转移):解释稳定视角下的外部世界变化,覆盖物体位移和遮挡等场景状态转移。
- L2(主动自身状态转移):保持环境稳定,并将视觉变化归因于相机运动,结合自我运动理解与跨视图空间推断。
- L3(长时程转移整合):将监督扩展到完整相机轨迹,要求模型保持中间更新的顺序,并累积分散的证据。
如下图所示:
这里展示了数据集的构成以及这三个层级中的代表性问答示例。
对于局部状态转移建模(L1和L2),作者采用标准监督微调。给定视觉输入 V、问题 q 和目标回答 y⋆,模型在转移前后观测的条件下预测 y⋆。这种联合监督将视觉差异与其物理原因和结果配置联系起来,初始化长时程学习所需的表示。
为解决在长轨迹上排序和累积转移的挑战(L3),作者引入了On-Policy Distillation(OPD)。认识到最终答案监督无法识别哪个中间更新失败,OPD用仅在训练期间可用的特权状态转移轨迹来增强可验证的GRPO。对于每个长视频,冻结的视觉语言标注器在均匀采样的间隔上生成环境和变化的描述,形成特权轨迹 z=(z1,z2,z3,z4)。
在on-policy同前缀蒸馏期间,行为策略采样一组回答。对于每个回答,学生策略和该策略的停止梯度快照(教师)都评估相同的学生生成前缀 y<t。学生以标准输入 x=(V,q) 为条件,教师则额外以 z 为条件。这隔离了特权转移证据如何改变下一步推理。过程损失 Lprocess 定义为教师在top-k非特殊token支持上到学生的前向KL散度,仅应用于推理位置。
完整目标结合了结果优化和过程优化:
LOPD=Lanswer+βLKL−ref+λtLprocess其中 Lanswer 是基于确定性答案奖励(精确匹配或相对误差评分)的裁剪组相对策略损失,β 控制来自单独冻结SFT策略的参考策略正则化,λt 控制特权过程信号。过程权重 λt 逐渐衰减,使早期更新获得显式转移指导,而后期优化依赖策略自身的推理和可验证结果。
实验
实验在四个Qwen2.5-VL和Qwen3-VL骨干模型上评估Spatial-Interactor,覆盖视频和多视图基准,并包括额外的留出迁移和闭环交互任务。训练流程首先在局部转移数据和公开空间问答上应用监督微调,然后加入特权过程监督以强化长时程推理,同时通过受控消融分离各组件的作用。结果表明,与基础模型和匹配基线相比取得一致改进,局部转移监督改善了跨基准泛化,过程监督支持轨迹级证据整合。对训练动态和时序顺序的分析进一步表明,模型学会依赖有序视觉变化和推理轨迹,定性示例突出了更强的跨视图对应和长间隔运动解释。
Spatial-Interactor在所有评估的空间推理基准上均优于其基础模型,总体提升从16.4到25.0分不等。这些收益出现在不同代际和规模的Qwen模型上,覆盖局部空间关系、路径规划、相机位移和多视图问题。在已报告的系统中,其变体在VSI-Bench、MindCube和VSTI-Bench上领先,而SpatialLadder在SPBench-MV上仍然最强。从交互轨迹中学习在不同模型能力和起跑性能水平上带来一致的总体改进。相对距离准确率显著提高,路径规划增益较为温和,相机位移在更广泛范围内有所改善。MindCube和SPBench-MV同样受益,表明在多视图对应和超越单视图设置的推理上有所提升。8B Spatial-Interactor模型在对比系统中取得最高总分。
组合训练阶段提高了所评估骨干模型和基准上的跨基准准确率,完整SFT+OPD检查点在每个骨干模型上均取得最佳总体结果。改进同时出现在多视图对应任务和面向交互的任务上,其中SFT贡献了大部分提升,OPD则带来较小但一致的额外提升。SFT贡献了大部分跨基准改进,尤其在Qwen2.5-VL-7B骨干模型上的SAT-Real中表现出显著提升。OPD在所报告的骨干模型上在SFT基础上进一步带来一致的准确率提升,表明其可迁移到后训练中使用的长时程任务之外。
在外部空间问答数据上训练带来最大的单阶段总体提升,并建立了显著更强的空间推理基线。加入来自交互的转移监督进一步改善了所有基准平均值,最终OPD阶段取得最佳总体和指标级性能。最大提升出现在多视图、位移和相对距离基准上,表明对空间推理具有广泛收益。外部数据SFT在训练阶段中带来最大的总体增益,使模型显著高于基础结果。加入来自交互的L1和L2数据改善了每个基准平均值,在视频和多视图任务上取得一致提升。最终的Full SFT + OPD配置取得最高总分,并在多视图和位移指标上实现最大绝对改进。
Spatial-Interactor相对于基线在WalkerBench上提高了闭环成功率,在角度、高度和导航任务上提升更为明显。它还在每个任务上使用显著更少的已执行动作达到这些结果。距离和可见性任务对两个模型来说仍未解决。Spatial-Interactor在角度、高度、导航和总体成功率上显示出相对提升,同时每个任务使用的动作少得多。距离和可见性任务在基线和Spatial-Interactor上均未成功。
Spatial-Interactor在所有八个闭环ESI-Bench类别上均优于基础模型。总体成功率从约33%提高到约41%,已解决的回合平均需要更少的交互轮次。改进范围广泛,在agent观测、稳定性和遮挡方面增益相对较大。Spatial-Interactor在每个报告类别上均提高成功率,包括视角、距离和动作顺序。已解决的回合平均需要更少的交互轮次,从约12.3轮下降到10.6轮。最大增益出现在agent观测、稳定性和遮挡方面,表明在变化观测下闭环推理更强。
实验在开放式空间推理基准、多视图和面向交互的任务以及WalkerBench和ESI-Bench等闭环具身基准上评估Spatial-Interactor。在这些设置中,该模型均优于其基础骨干模型,完整的SFT加OPD训练流程带来最大且最一致的提升,尤其在多视图、相机位移、相对距离和agent观测方面。在闭环评估中,Spatial-Interactor在需要更少已执行动作或交互轮次的同时取得更高的成功率,但距离和可见性任务仍未解决。总体而言,结果表明来自交互的监督和分阶段后训练可跨模型规模和任务格式泛化。