Command Palette
Search for a command to run...
DynPose-100K : Vidéos Avec Poses De Caméra Dynamiques
Date
URL du document
Licence
Other
DynPose-100K est un ensemble de données à grande échelle publié par NVIDIA en 2025, comprenant 100 000 vidéos dynamiques variées avec leurs annotations précises de caméra. Le résultat de recherche associé est « Dynamic Camera Poses and Where to Find Them », visant à résoudre les défis de l'estimation précise des paramètres intrinsèques et de la pose de la caméra dans les vidéos dynamiques, en sélectionnant des vidéos adaptées à l'estimation de la caméra et en améliorant les algorithmes d'estimation de caméra pour vidéos dynamiques, fournissant ainsi un support de données de haute qualité pour la recherche en vision par ordinateur.
Cet ensemble de données a été sélectionné parmi 3,2 millions de vidéos candidates, contenant des clips vidéo au contenu dynamique riche, et toutes les vidéos sont annotées avec les poses de caméra monde-vers-caméra et les paramètres intrinsèques de la caméra.
Composition de l'ensemble de données
L'ensemble de données comprend principalement les parties et champs suivants :
- Données vidéo : environ 100 000 vidéos au format MP4, avec une résolution de 1280×720 (720p), pour une taille totale d'environ 200 Go.
- Données de frames : frames extraites des vidéos au format JPG, à une cadence de 12 images par seconde, pour une taille totale d'environ 400 Go.
- Données d'annotations de caméra : fichiers au format PKL, comprenant les champs suivants :
- poses : matrices de pose de caméra (N',3,4)
- intrinsics : matrices de paramètres intrinsèques de caméra (3,3)
- frame_idxs : liste des indices de frames correspondants
- mean_reproj_error : erreur moyenne de reprojection
- num_points : nombre de points de reprojection
- num_frames : nombre total de frames de la vidéo
- Fichiers de métadonnées :
- metadata.csv : contient les identifiants vidéo, URL, horodatages, descriptions, etc., utilisés pour télécharger les vidéos et extraire les frames.
- uid_mapping.csv : fichier de correspondance des UID.
- Ensemble de référence Lightspeed : contient de courts clips vidéo avec des poses de caméra réelles, utilisé pour valider la méthode d'annotation de DynPose-100K, pour une taille totale d'environ 8,1 Go.
Citation
@inproceedings{rockwell2025dynpose,
author = {Rockwell, Chris and Tung, Joseph and Lin, Tsung-Yi and Liu, Ming-Yu and Fouhey, David F. and Lin, Chen-Hsuan},
title = {Dynamic Camera Poses and Where to Find Them},
booktitle = {CVPR},
year = 2025
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.