Command Palette
Search for a command to run...
SceneFun3D 3D Szenenfunktions-Interaktionsdatensatz
SceneFun3D ist ein von Voxel51 im Jahr 2024 veröffentlichter Datensatz zur funktionalen Interaktion in 3D-Szenen. Er konzentriert sich auf das detaillierte Verständnis kleiner interaktiver Elemente (wie Griffe, Knöpfe und Schalter) und umfasst die Lokalisierung von Elementen, Gibsonsches funktionales Schließen, Schätzung von Bewegungsparametern und die Beschreibung von Aufgaben in natürlicher Sprache. Zugehörige Forschungsarbeiten wurden unter dem Titel „SceneFun3D“ veröffentlicht. Feingranulares Verständnis von Funktionalität und Affordanz in 3D-Szenen . Dieser Datensatz umfasst 710 hochauflösende, reale Innenraumszenen mit 14.867 funktionalen Interaktionselement-Annotationen, 9 Funktionskategorien, 14.279 Bewegungsparametern und über 10.913 natürlichsprachlichen Aufgabenanweisungen. Er basiert auf hochauflösenden Faro-Laserscanning-Punktwolken und iPad-Videosequenzen und ist in einen Trainingsdatensatz mit 545 Szenen, einen Validierungsdatensatz mit 80 Szenen und einen Testdatensatz mit 85 Szenen unterteilt. Diese Version verwendet jeweils 10 Szenen aus jeder Kategorie als Benchmark-Testdatensatz; die funktionalen Annotationen im Testdatensatz wurden ausgeblendet.
Zusammensetzung des Datensatzes:
- Szenengruppierung: Der Datensatz verwendet eine gruppierte Datensatzstruktur, wobei jede Gruppe einer unabhängigen Szene entspricht, die durch visit_id identifiziert wird.
- 3D-Punktwolkendaten: Liefert heruntergerechnete (5 mm Voxel) FARO-Laserscan-Punktwolken, einschließlich Annotationen funktionaler interaktiver Elemente, ARKit-Raum-Objektbegrenzungsrahmen und Aufgabenbeschreibungen.
- Videosequenzdaten: Zu jeder Szene gehören 2-3 hochauflösende RGB-Videosequenzen (1920 x 1440 Pixel, ca. 10 FPS), die auf einem iPad Pro aufgenommen wurden und auch Einzelbild-Tiefenkarten, Kamerapositionen und intrinsische Parameter enthalten.
Datenfelder:
- laser_scan slices: contain functional_elements (3D functional element detection boxs and attributes), objects_3d (ARKit object boxs), and tasks (natural language task list).
- ipad_N slice: enthält die Tiefe (Tiefen-Heatmap) von Frame zu Frame, intrinsische Kameraparameter, camera_pose (Kamerapose) und projected_elements/projected_objects (projizierte Begrenzungsrahmen und Schlüsselpunkte von 3D-Elementen/Objekten in 2D-Frames).
- Funktionale Elementattribute: Jedes 3D-Erkennungsfeld enthält eine Bezeichnung (9 funktionale Kategorien), motion_type (Translation/Rotation), motion_dir (Bewegungsrichtung), motion_origin (Bewegungsursprung) und Beschreibungen (Aufgabenanweisungen).
Zitat
@inproceedings{delitzas2024scenefun3d,
title={{SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes}},
author={Delitzas, Alexandros and Takmaz, Ayca and Tombari, Federico and Sumner, Robert and Pollefeys, Marc and Engelmann, Francis},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.