Command Palette
Search for a command to run...
基于 RGBD 图像的室内分割与支撑关系推断
基于 RGBD 图像的室内分割与支撑关系推断
Nathan Silberman Derek Hoiem Pushmeet Kohli Rob Fergus
摘要
我们提出了一种从单张 RGBD 图像中解读室内场景主要表面、物体及其支撑关系的方法。现有大多数工作忽略了物理交互,或仅适用于整洁的房间和走廊。我们的目标是将典型且通常杂乱的室内场景解析为地面、墙壁、支撑表面和物体区域,并恢复其支撑关系。我们主要关注点之一是更好地理解三维线索如何最有效地为结构化的三维解读提供信息。我们还贡献了一种新颖的整数规划公式,用于推断物理支撑关系。我们提供了一个包含 1449 张 RGBD 图像的新数据集,该数据集捕捉了 464 个多样化的室内场景,并带有详细的标注。实验证明了我们在复杂场景中推断支撑关系的能力,并验证了我们的三维场景线索和推断出的支撑关系能够带来更优的物体分割。
一句话总结
来自纽约大学、伊利诺伊大学厄巴纳-香槟分校和微软剑桥研究院的研究人员提出了一种 RGBD 场景解析方法,利用 3D 线索将典型且通常杂乱的室内场景分解为地面、墙壁、支撑表面和物体区域,采用新颖的整数规划公式推断物理支撑关系,并引入一个包含 1,449 张 RGBD 图像、覆盖 464 个多样化室内场景的数据集,证明 3D 场景线索和推断的支撑关系能显著改善物体分割。
核心贡献
- 一种场景解析方法从单张杂乱室内场景的 RGBD 图像中恢复地面、墙壁、支撑表面和物体区域,利用与房间对齐的 3D 线索、结构类别和表面拟合处理遮挡与缺失表面。
- 一种新颖的整数规划公式推断表面与物体之间的物理支撑关系,能够在图像区域之间进行全局推理,并在支撑区域不可见时仍能稳健推断。
- 一个包含 1,449 张 RGBD 图像、覆盖 464 个多样化室内场景的新数据集提供了详细的物体和支撑标注,实验表明推断的支撑关系和 3D 场景线索改善了物体分割。
引言
作者致力于解决为机器人学和场景理解生成物理场景解析的问题,仅仅标注物体并不足够。抓取、导航和交互等任务需要将场景划分为表面和物体,并推理它们如何相互支撑。此前工作通常依赖 2D 启发式规则、需要人工标注,或集中于室外环境;现有 RGB-D 方法停留在物体识别阶段,没有建模支撑关系。作者提出一种全自动方法,通过结合基于深度的平面拟合、结构物体类别(地面、永久结构、家具和道具)以及学习到的物理约束先验,联合估计 3D 房间几何、分割物体并推断支撑关系。作者还贡献了一个大规模、带标注的杂乱室内场景 RGB-D 数据集,即使在支撑表面不可见或被严重遮挡时也能实现稳健的支撑推断。
数据集
作者引入了一个用于室内场景理解的大型 Kinect RGBD 数据集,其设计目标比此前数据集更多样、更全面。
-
组成与来源 数据集包含 1,449 张 RGBD 图像,采集自 26 个场景类别的 464 个室内场景。数据收集自美国三个不同城市的多种商业和住宅建筑,确保真实环境多样化。
-
各子集的关键细节
- 图像:1,449 个 RGBD 帧。
- 场景:464 个独立室内场景。
- 标签:通过 Amazon Mechanical Turk 获得密集的逐像素语义标注。
- 实例级标注:如果一个类别的多个实例出现在场景中,每个实例获得唯一实例标签(例如“cup 1”和“cup 2”)。
- 物体统计:35,064 个不同物体,覆盖 894 个不同类别。
- 支撑标注:每张图像提供人工添加的支撑元组,形式为 [Ri,Rj,type],其中 Ri 是被支撑区域,Rj 是支撑区域,type 表示“从下方”(例如杯子在桌上)或“从后方”(例如画挂在墙上)。除原始采集外,没有描述显式过滤或裁剪。
-
论文如何使用该数据 该数据集是训练和评估室内场景理解模型的主要实验资源,任务包括语义分割、实例标注和支撑关系推断。所提供描述未指定特定的训练/验证划分或混合比例;数据集被整体用于评估所提出方法。
-
处理与元数据构建 除原始 RGBD 采集外,主要处理是人工标注流程:逐像素类别标签、实例 ID 和支撑三元组。数据集构建细节中未报告图像裁剪或其他增强策略。
方法
作者利用一个完整的室内场景理解流程,先进行结构建模,再分割物体,最后推断支撑关系。
室内场景结构建模 初始的场景表面推断被视为对齐与分割问题。给定已配准的 RGB 和深度图像,作者首先计算每个像素处的 3D 表面法线。为了将 3D 测量对齐到房间坐标,他们依赖曼哈顿世界假设,从 RGB 图像中提取直线,并计算表面法线的均值漂移模式,以找到三个主导正交方向。主方向候选根据其与表面法线和直线方向的对齐程度进行评分:
S(v1,v2,v3)=j=1∑3[NNwNi∑NNexp(σ2−(Ni⋅vj)2)+NLwLi∑NLexp(−σ2(Li⋅vj)2)]得分最高的一组候选被选出,用于形成旋转矩阵,以对齐场景。该对齐步骤显著改善场景地面的垂直朝向。
对齐后,作者使用 RANSAC 过程生成可能的墙、地面、支撑和天花板平面。为了确定每个平面的像素对应关系,他们使用 alpha 扩展的图割方法求解分割问题。能量函数最小化一元项和二元项,其中一元项编码 3D 位置和法线匹配,并依据深度测量置信度加权;二元项执行对梯度敏感的平滑。
分割 为了分类物体并解释关系,图像被分割为对应单个物体或表面实例的区域。初始过分割使用应用于 Pb 边界的 分水岭算法生成,并强制与 3D 平面区域一致。对于层次分割,区域对基于学习到的相似性被迭代合并。一个提升决策树分类器预测边界强度,以判断两个区域是否属于同一物体实例,同时使用标准 2D 特征以及由深度和表面朝向得到的 3D 特征。
支撑关系建模 作者对分割区域之间的物理支撑关系进行建模。每个区域被赋予一个支撑关系变量 Si(由另一个区域、隐藏物体或地面支撑)、一个支撑类型 Ti(从下方或从后方),以及一个结构类别 Mi(地面、家具、道具或结构)。目标是通过最小化能量函数来推断最可能的联合赋值,该能量函数结合了训练分类器得到的似然项,以及编码转移概率、支撑一致性和地面一致性的先验项。
最大后验推断问题被表述为整数规划,使用布尔指示变量表示未观测变量。目标函数编码支撑似然、结构类别似然和转移先验。约束确保每个区域被分配单一的支撑、类型和结构标签,同时保持一致性和边缘化。整数约束被松弛,将问题作为线性规划求解,分数解通过选择最可能的赋值来解决。
训练局部分类器来计算似然项。一个逻辑回归分类器使用几何、形状和位置特征预测支撑关系。另一个逻辑回归分类器使用 SIFT 特征、表面法线直方图、边界框尺寸和颜色直方图预测结构类别。
实验
实验评估分割、支撑推断和结构类别预测。融合 RGB 和深度特征并结合中间支撑与结构线索后,分割精度提高。支撑推断受益于基于全局能量的模型,通过推理支撑类型和非局部上下文,优于基于规则的基线,但地面和结构的误分类仍会导致级联错误。结构类别预测从全局优化中仅获得小幅提升,性能受噪声深度和分割不准确性的限制。
将 RGB 和深度特征结合所产生的分割重叠显著优于单独使用任一模态,面积加权分数比仅 RGB 和仅深度分别提高约 10 和 7 个百分点。加入支撑分类器特征可带来进一步的小幅提升,再加入结构类别特征带来的额外增益更小。未加权分数趋势相同,但低于面积加权分数。RGBD 特征使面积加权分割精度比仅 RGB 提高约 10 个百分点,比仅深度提高约 7 个百分点。在 RGBD 分割中加入支撑特征获得 0.7 个加权点的轻微提升,再加结构类别特征仅增加 0.5 个点。未加权重叠分数始终低于加权分数,但特征组合的相对顺序相同。
简单的基于规则的方法在真值区域上可获得合理的支撑推断精度,但在分割区域上急剧下降,突出其对分割误差的敏感性。能量最小化方法始终优于所有基线,尤其在类型感知精度上表现明显,说明将全局推理与判别式推断相结合的价值。正确识别支撑类型(下方与后方)对所有方法仍然困难,类型感知分数始终低于与类型无关的分数。Image Plane Rules 在真值区域上的类型无关精度从 63.9% 下降到分割区域上的 22.1%,表明其对完美分割的高度依赖。Structure Class Rules 在真值类型无关精度上优于 Support Classifier(72.0% 对 70.1%),但 Support Classifier 在真值上的类型感知精度更高(63.4% 对 57.7%)。Energy Min (LP) 在真值区域(72.6%)和分割区域(54.5%)上均获得最高的类型感知精度,在每种区域上均大幅领先次优方法。Energy Min 在真值区域和分割区域之间的类型感知精度差距最小(18.1 个百分点),Image Plane Rules 差距最大(31.3 个百分点),表明对分割质量的鲁棒性更好。所有方法从类型无关指标到类型感知指标均有明显下降,证实区分支撑类型比推断支撑关系是否存在更难。
分割实验表明,融合 RGB 和深度模态可大幅改善区域重叠,优于单独使用任一模态;加入支撑和结构类别特征仅带来有限的进一步增益。支撑推断评估显示,简单的基于规则的方法在真值区域上精度尚可,但在自动分割区域上表现崩溃,突出其对分割误差的极度敏感。结合全局推理的能量最小化方法始终优于基线,尤其在区分支撑类型这一更难任务上,并且在从真值输入切换到分割输入时精度下降最小,表明对不完美分割具有更强的鲁棒性。