Command Palette
Search for a command to run...
SceneFun3D 3D 场景功能交互数据集
SceneFun3D 是由 Voxel51 于 2024 年发布的 3D 场景功能交互数据集,聚焦于微小交互部件(如把手、旋钮、开关等)的细粒度理解,涵盖部件定位、 Gibsonian 功能推理、运动参数估计及自然语言任务描述,相关论文成果为 SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes 。 该数据涵盖 710 个高分辨率真实室内场景,包含 14,867 个功能交互元素标注、 9 类功能类别、 14,279 个运动参数以及 10,913 余个自然语言任务指令。数据集基于高分辨率 Faro 激光扫描点云与 iPad 视频序列构建,整体划分为 545 个场景的训练集、 80 个场景的验证集、以及 85 个场景的测试集。该版本从每个分类中采样 10 个场景作为基准测试集;其中,测试集的功能标注已作隐藏处理。
数据集构成:
- 场景分组:数据集采用分组结构(Grouped Dataset),每组对应一个独立场景,以 vistit_id 作为标识。
- 3D 点云数据:提供经下采样(5 mm 体素)的 FARO 激光扫描点云,并包含功能交互元素标注、 ARKit 房间级物体框及任务描述。
- 视频序列数据:每个场景配有 2-3 段 iPad Pro 录制的高分辨率 RGB 视频序列(分辨率 1920 x 1440, 约 10 FPS),同时包含逐帧深度图、相机位姿与内参。
数据字段:
- laser_scan 切片:包含 functional_elements(3D 功能元素检测框及属性)、 objects_3d(ARKit 物体框)、 tasks(自然语言任务列表)。
- ipad_N 切片:包含逐帧 depth(深度热力图)、 intrinsics(相机内参)、 camera_pose(相机位姿)、以及 projected_elements/projected_objects(3D 元素/物体在 2D 帧中的投影检测框与关键点)。
- 功能元素属性:每个 3D 检测框包含 label(9 类功能类别)、 motion_type(平移/旋转)、 motion_dir(运动方向)、 motion_origin(运动原点)和 descriptions(任务指令)。
Citation
@inproceedings{delitzas2024scenefun3d,
title={{SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes}},
author={Delitzas, Alexandros and Takmaz, Ayca and Tombari, Federico and Sumner, Robert and Pollefeys, Marc and Engelmann, Francis},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}