HyperAI
Command Palette
Search for a command to run...
DynPose-100K: 動的カメラ姿勢ビデオ
DynPose-100K は、NVIDIA が 2025 年に公開した、10 万本の多様な動的ビデオとその正確なカメラ注釈を含む大規模データセットです。関連する論文成果は「Dynamic Camera Poses and Where to Find Them」であり、動的ビデオにおけるカメラ内部パラメータと姿勢の正確な推定という課題を解決することを目的としています。カメラ推定に適したビデオを選別し、動的ビデオのカメラ推定アルゴリズムを改善することで、コンピュータビジョン研究に高品質なデータサポートを提供します。
このデータセットは、320 万本の候補ビデオから厳選されたもので、動的コンテンツが豊富なビデオクリップを含み、すべてのビデオにはワールドからカメラへのカメラ姿勢(poses)とカメラ内部パラメータ(intrinsics)が注釈されています。
データセット構成
データセットは主に以下の部分とフィールドで構成されています:
- ビデオデータ:約 10 万本の MP4 形式ビデオ、解像度は 1280×720 (720p)、総サイズは約 200 GB。
- フレームデータ:ビデオから抽出された JPG 形式のフレーム、フレームレートは 12 fps、総サイズは約 400 GB。
- カメラ注釈データ:PKL 形式のファイルで、以下のフィールドを含みます:
- poses:カメラ姿勢行列(N',3,4)
- intrinsics:カメラ内部パラメータ行列(3,3)
- frame_idxs:対応するフレームインデックスリスト
- mean_reproj_error:平均再投影誤差
- num_points:再投影点の数
- num_frames:ビデオの総フレーム数
- メタデータファイル:
- metadata.csv:ビデオ ID、URL、タイムスタンプ、説明などの情報を含み、ビデオのダウンロードとフレーム抽出に使用されます。
- uid_mapping.csv:UID マッピングファイル。
- Lightspeed ベンチマークテストセット:真のカメラ姿勢を持つ短いビデオクリップを含み、DynPose-100K の注釈方法を検証するために使用され、総サイズは約 8.1 GB。
Citation
@inproceedings{rockwell2025dynpose,
author = {Rockwell, Chris and Tung, Joseph and Lin, Tsung-Yi and Liu, Ming-Yu and Fouhey, David F. and Lin, Chen-Hsuan},
title = {Dynamic Camera Poses and Where to Find Them},
booktitle = {CVPR},
year = 2025
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。