Command Palette
Search for a command to run...
Self-Geometry:面向几何一致三维视觉基础模型的无真值即插即用测试时自适应方法
Self-Geometry:面向几何一致三维视觉基础模型的无真值即插即用测试时自适应方法
Seokhyun Youn Dahyeon Kye Sung-Ho Bae Jihyong Oh
摘要
近期视觉基础模型(VFMs)能够在单次前向传播中预测深度、相机位姿和点图,无需逐场景优化,展现出强大的泛化能力。然而,显式施加多视图几何一致性(例如通过光束法平差)计算代价高昂,因此在 VFM 预训练阶段并未采用,导致此类不一致性可能出现。针对这一问题,现有工作在测试时利用模型输出(如点图、特征)中隐含的自一致性信号,但其性能提升本质上有限,尤其是在预训练 VFM 精度很低的场景中。与这种隐式信号不同,我们提出 Self-Geometry,一种即插即用的测试时自适应流程,它利用二维像素对应作为伪真值,直接施加显式多视图几何约束。我们提出的 Self-Geometry 包含:几何解耦优化,它将多视图一致性损失和极线一致性损失与梯度解耦相结合,以防止梯度冲突;帧角近邻采样器,一种基于 SO(3) 测地距离的视图采样器,用于轻量地施加这些约束;以及轻量级测试时自适应,通过 LoRA 对 VFM 进行自适应。我们的方法在六种 VFM(VGGT、π3、DA3-Giant/Large/Base/Small)和四个基准数据集(7Scenes、ETH3D、ScanNet++、HiRoom)上,均实现了位姿和几何估计的一致提升。
一句话总结
来自 CMLab、韩国中央大学和庆熙大学的研究人员推出 Self-Geometry,一种无需 GT、即插即用的测试时自适应流程,它利用 2D 像素对应作为伪真值,通过结合几何解耦优化、基于 SO(3) 测地距离的 Frame Angular-Neighbor 视图采样器和轻量级 LoRA 自适应,施加显式多视图几何约束;其中几何解耦优化使用多视图一致性与极线一致性损失,并通过梯度解耦防止梯度冲突,在六个视觉基础模型(VGGT、π3、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上持续改善位姿和几何估计。
核心贡献
- Self-Geometry 是一种即插即用的测试时自适应流程,它使用二维像素对应作为伪真值,对预训练视觉基础模型施加显式多视图几何约束,无需 GT 标注或教师蒸馏。
- 该流程由几何解耦优化、Frame Angular-Neighbor 视图采样器和轻量级 TTA 组成;其中几何解耦优化结合多视图一致性与极线一致性损失,并通过梯度解耦避免梯度冲突;Frame Angular-Neighbor 是基于 SO(3) 测地距离的视图采样器;轻量级 TTA 通过 LoRA 自适应模型。
- 在六个预训练视觉基础模型(VGGT、π3、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上的实验显示,位姿和几何估计均得到持续改善,单个 NVIDIA RTX PRO 6000 GPU 上每个场景的自适应在两分钟内完成。
引言
多视图三维重建旨在从多视图图像中恢复相机位姿和稠密场景几何,近年来的视觉基础模型(Vision Foundation Models, VFMs)如 VGGT、π³ 和 Depth Anything 3 提供前馈零样本深度、位姿和点图预测,无需逐场景优化。然而,这些模型在预训练时未施加显式多视图几何约束,因为强制执行光束法平差代价较高,因此其预测可能违反几何一致性;已有的测试时自适应方法往往依赖隐式自一致性、微调数据、教师蒸馏或特定架构,从而限制了精度和通用性。作者提出 Self-Geometry,一种不依赖真值且即插即用的测试时自适应流程,它使用外部匹配器获得的二维像素对应作为伪真值,施加显式多视图几何监督。该流程结合点对点损失与点对线损失、梯度解耦、SO(3) 引导的视图采样器和轻量级 LoRA 自适应,在约每场景两分钟内改善六个预训练 VFM 和四个数据集上的位姿与几何估计。
方法
预训练视觉基础模型(VFM)在训练时未强制执行显式多视图几何一致性,这可能导致生成的点图不一致。如下图所示,隐式自一致性方法难以实质改善相机位姿和深度,而所提出的 Self-Geometry 直接施加显式多视图几何约束,从而带来一致改善。
推动该方法的关键洞察是,二维像素对应本身为预训练 VFM 的预测定义了显式多视图几何监督。为解决不一致性,作者提出 Self-Geometry,一个无需 GT 且即插即用的测试时自适应(TTA)流程。
如下图所示,Self-Geometry 由三个互补部分组成:几何解耦优化(GDO)、Frame Angular-Neighbor(FAN)和轻量级测试时自适应(Lightweight TTA)。
GDO 通过结构化优化过程施加显式多视图几何约束。首先,场景初始化使用外部特征匹配器从输入视图提取伪对应。给定输入视图集合 T={Ii}i=1N,预训练 VFM 预测相机位姿 P={Pi}i=1N、深度图 D={Di}i=1N 和点图 X={Xi}i=1N。伪对应集合定义为:
M={(xim,xjm)}m=1M.其次,伪对应过滤通过依次应用基于极线一致性(EC)损失的过滤器和基于多视图一致性(MVC)损失的过滤器,去除误匹配的伪对应,以确保监督可靠。
第三,多视图一致性损失(Lmvc)形式化点对点重投影约束:
Lmvci(P,D;M)=∣M∣1(xim,xjm)∈M∑∥x^im−xim∥2.该损失联合监督相机位姿和深度,但继承位姿-深度歧义。
第四,为解决这种歧义,极线一致性损失(Lec)引入与深度无关的点对线约束:
Leci(P;M)=∣M∣1(xim,xjm)∈M∑dSampson(x~im,x~jm;Fi←j).该损失以与深度无关的方式监督相机位姿。
第五,梯度解耦(GD)通过将 ∇Lmvc 投影到 ∇Lec 的正交补上来防止两个损失在相机位姿上发生梯度冲突:
∇Lmvc←∇Lmvc−∥∇Lec∥22⟨∇Lmvc,∇Lec⟩∇Lec.该投影确保两个损失在梯度层面互补地发挥作用。
为了高效应用这些约束,FAN 使用场景尺度不变的 SO(3) 测地距离对输入视图进行采样。视图 i 和 j 之间的 SO(3) 测地距离计算公式为:
θij=cos−1(2tr(RiRj⊤)−1).几何丰富视图选择(GRV)通过最大化 SO(3) 区间熵选择目标视图:
v∗=argv∈VmaxH(v),H(v)=−b=1∑Bpb(v)logpb(v).随后,角度近邻采样(ANS)从每个 SO(3) 区间采样源视图,以确保均匀的场景覆盖,而无需启发式的逐场景归一化。
轻量级 TTA 在无需额外训练数据的情况下使预训练 VFM 适配目标场景,同时保留预训练阶段学到的几何先验。它采用插入到注意力块 QKV 权重中的基于 LoRA 的适配器,保持预训练 VFM 冻结,仅更新 LoRA 参数。这种参数高效策略使得在单个 GPU 上每场景自适应可在两分钟内完成。
实验
本工作在 7Scenes、ETH3D、ScanNet++ 和 HiRoom 上评估 Self-Geometry 在多个预训练视觉基础模型(包括 VGGT、π3 和 DA3)上的位姿和几何估计,并在 DA3 协议下与 Free-Geometry 和 TCO 进行比较。该方法持续改善平均位姿和几何结果,在 π3 上 TCO 失效时仍保持稳健,并显示出深度误差的定性降低和更干净的表面重建。消融实验确认,将极线一致性和多视图一致性损失与几何解耦结合是必要的,伪对应过滤提高精度,并且 Frame Angular-Neighbor 采样器对超参数具有稳健性。复杂度分析显示,LoRA 自适应仅增加 0.7% 到 3.4% 的额外参数,并在实际可行的时间内完成每场景自适应。
该比较从无真值自适应、无教师运行、即插即用和显式几何四个方面评估多视图三维视觉基础模型。冻结式和基于微调的方法通常不是无真值的,并且提供的显式几何或即插即用支持有限。测试时自适应方法可分为:TCO 无教师、即插即用且显式几何,但并非无真值;TTT3R 和 Online3R 等方法无真值且无教师,但不是即插即用。冻结式和基于微调的模型如 VGGT、π3 和 DA3 不是无真值的,并且缺乏显式几何支持。在测试时自适应方法中,TCO 独特地同时具备无教师、即插即用和显式几何支持,但仍非无真值;TTT3R 和 Online3R 无真值且无教师,但不是即插即用。
在 ETH3D 上使用 VGGT 时,GDO 消融显示,损失组件和梯度解耦策略的选择对位姿和几何指标产生混合影响。去掉极线一致性损失的变体给出最强的几何性能和较高的位姿精度,而去掉多视图一致性损失的变体削弱了若干指标。梯度解耦提高了最严格的位姿指标,但相对于不解耦,降低了较宽松的位姿精度和未 pacing 的几何指标,表明这是一种偏向精度的权衡。去掉极线一致性损失的变体在有 pacing 时取得最佳 F1,并在无 pacing 时并列最佳 AUC@30 和 F1。与去掉极线一致性损失相比,去掉多视图一致性损失降低了位姿和几何指标。相对于无解耦设置,梯度解耦提高了 AUC@1,但降低了 AUC@3、AUC@30 和无 pacing 的 F1。基线在某些指标上仍具有竞争力,并非每个消融变体都一致优于基线。
过滤伪对应可提高精度以及下游位姿和几何性能,其中结合 L_ec 与 L_mvc 的过滤器获得最佳整体下游性能。未过滤的原始变体保留所有匹配,但精度和下游分数低得多,而仅使用 L_mvc 的变体在过滤变体中具有最强 F1。结果表明,来自互补过滤阶段的精度增益对自适应的意义大于保留召回率。结合 L_ec 与 L_mvc 的过滤变体在过滤消融中取得最高精度和最佳下游位姿与几何指标。原始伪对应具有完美召回率,但精度低得多且下游性能显著更差,而仅使用 L_mvc 的变体在各变体中提供最强 F1。
FAN 变体在 ETH3D 上相对于基线改善了位姿 AUC 和几何 F1。SO(3) 区间宽度和源视图顺序对性能只有适度影响,表明这些采样选择具有稳健性。目标视图选择是主导因素,静态全局选择的目标视图提供最强的报告增益,而动态更新表现不佳。SO(3) 区间宽度和源视图顺序影响有限:15 度、30 度和 45 度设置以及不同顺序均表现相近。目标视图选择是主导因素:GRV 相较于固定目标视图有显著改善,而动态 GRV 不如 GRV。
在六个预训练 VFM 上,Self-Geometry 仅增加少量 LoRA 参数开销,从不足百分之一到百分之几。初始化和 FAN 阶段对每场景自适应时间贡献很小,而 GDO 阶段占主导地位并随模型规模扩展。在 ETH3D 和其他数据集上,总每场景时间仍保持实用,较小的 DA3 模型比较大的模型自适应更快。所有模型的 LoRA 参数开销都不大,保持在预训练 VFM 参数的 4% 以下。初始化时间约为 0.3 分钟,几乎不随模型规模变化,FAN 时间可忽略。GDO 占自适应时间的大部分并随模型规模增长,而较小的 DA3 变体比较大的模型自适应快得多。在 ETH3D、7Scenes、ScanNet++ 和 HiRoom 上,每场景总自适应仍保持实用,最小模型最快。
实验从无真值自适应、无教师和即插即用运行以及显式几何等方面评估多视图三维基础模型,将 Self-Geometry 与冻结式、微调式和测试时自适应方法进行定位。ETH3D 上的消融显示,伪对应过滤对下游位姿和几何至关重要,结合极线和多视图过滤可获得最佳精度,而损失组件选择和梯度解耦产生混合的偏向精度的权衡。FAN 研究表明目标视图选择是主导因素,而 SO(3) 区间宽度和源视图顺序仅有适度影响。在六个预训练模型上,Self-Geometry 增加少量 LoRA 开销和实用的每场景自适应时间,其中基于梯度的阶段占主要成本。