Command Palette
Search for a command to run...
深度推定
深度推定は、2次元画像や動画からシーンの3次元構造情報を推測するコンピュータビジョン技術です。その目的は、画像内の各ピクセルに対応する深度値、すなわち物体の表面とカメラ間の距離を予測することです。深度情報は、機械がシーン内の空間的な関係を理解するのに役立ち、3D再構成、ロボット知覚、自動運転、拡張現実などの分野における重要な基盤技術となっています。
深度推定技術は、従来の幾何学的手法から深層学習手法へと発展してきた。初期の手法は主にステレオビジョン、構造化光、LiDARなどのセンサーに依存し、視差計算やアクティブ測距によって深度情報を取得していたが、これらは通常、追加のハードウェアサポートを必要とした。深層学習の発展に伴い、研究者たちは単一画像を用いて深度を直接予測する単眼深度推定手法の研究を開始した。2014年、ニューヨーク大学のDavid Eigenらは、論文を発表した。マルチスケール深層ネットワークを用いた単一画像からの深度マップ予測 本論文では、マルチスケール畳み込みニューラルネットワークに基づく単眼深度予測手法を提案する。グローバルなシーン情報とローカルな詳細特徴を組み合わせることで、単一画像から深度マップを予測することが可能となり、深層学習に基づく深度推定に関する今後の研究の重要な基盤となる。
深度推定技術は、主に2次元視覚情報における空間スケールの欠如に対処するものです。入力方法に応じて、このタスクは一般的に単眼深度推定、両眼深度推定、およびマルチビュー深度推定に分類できます。単眼方式は、通常の画像入力のみに依存し、物体のサイズ、テクスチャ、遮蔽関係、シーン構造などの視覚的手がかりを学習することで深度を推測します。一方、両眼方式は、複数のカメラ間の視差関係を利用して空間距離を計算します。
近年、大規模な混合データセットを用いたトレーニングや視覚基盤モデルの開発により、単眼深度推定モデルのゼロショット汎化能力は大幅に向上しました。トレーニング中に一度も遭遇したことのないシーンに直面した場合でも、比較的信頼性の高い深度予測を提供できるようになりました。関連技術は、自動運転における環境認識、ロボットナビゲーション、3D再構成、仮想現実(VR)、拡張現実(AR)などのシナリオで幅広く応用され、機械が3D世界を獲得し理解するための重要なサポートを提供しています。