Command Palette
Search for a command to run...
Estimation De La Profondeur
Date
URL du document
L'estimation de profondeur est une technique de vision par ordinateur permettant de déduire les informations structurelles tridimensionnelles d'une scène à partir d'images ou de vidéos bidimensionnelles. Son objectif est de prédire la valeur de profondeur correspondant à chaque pixel d'une image, c'est-à-dire la distance entre la surface de l'objet et la caméra. Les informations de profondeur aident les machines à comprendre les relations spatiales au sein d'une scène et constituent une technologie fondamentale dans des domaines tels que la reconstruction 3D, la perception robotique, la conduite autonome et la réalité augmentée.
Le développement de l'estimation de profondeur a évolué des méthodes géométriques traditionnelles aux méthodes d'apprentissage profond. Les premières méthodes s'appuyaient principalement sur des capteurs tels que la vision stéréoscopique, la lumière structurée et le LiDAR pour obtenir des informations de profondeur par calcul de disparité ou télémétrie active, mais elles nécessitaient généralement du matériel supplémentaire. Avec l'avènement de l'apprentissage profond, les chercheurs ont commencé à explorer des méthodes d'estimation de profondeur monoculaires qui prédisent directement la profondeur à partir d'une seule image. En 2014, les chercheurs David Eigen et al. de l'Université de New York ont publié un article…Prédiction de carte de profondeur à partir d'une seule image à l'aide d'un réseau profond multi-échelle Cet article propose une méthode de prédiction de profondeur monoculaire basée sur des réseaux de neurones convolutifs multi-échelles. En combinant les informations globales de la scène avec les détails locaux, elle permet de prédire des cartes de profondeur à partir d'une seule image, constituant ainsi une base importante pour les recherches ultérieures sur l'estimation de profondeur par apprentissage profond.
Les techniques d'estimation de profondeur pallient principalement le manque d'échelle spatiale dans les informations visuelles bidimensionnelles. Selon la méthode d'entrée, on distingue généralement l'estimation de profondeur monoculaire, binoculaire et multivue. Les méthodes monoculaires s'appuient uniquement sur une image classique et infèrent la profondeur en apprenant des indices visuels tels que la taille des objets, leur texture, les occlusions et la structure de la scène. Les méthodes binoculaires, quant à elles, exploitent les relations de parallaxe entre plusieurs caméras pour calculer la distance spatiale.
Ces dernières années, grâce au développement de modèles d'apprentissage sur des ensembles de données mixtes à grande échelle et de modèles de visualisation de base, la capacité de généralisation sans exemple des modèles d'estimation de profondeur monoculaires a été considérablement améliorée. Même face à des scènes jamais rencontrées lors de l'apprentissage, ces modèles peuvent fournir des prédictions de profondeur relativement fiables. Les technologies associées sont largement utilisées dans des domaines tels que la perception de l'environnement pour la conduite autonome, la navigation robotique, la reconstruction 3D, la réalité virtuelle (RV) et la réalité augmentée (RA), apportant un soutien essentiel aux machines pour l'acquisition et la compréhension du monde 3D.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.