Command Palette
Search for a command to run...
Tiefenschätzung
Tiefenschätzung ist eine Technik der Computer Vision, mit der dreidimensionale Strukturinformationen einer Szene aus zweidimensionalen Bildern oder Videos abgeleitet werden. Ziel ist es, den Tiefenwert jedes Pixels in einem Bild vorherzusagen, also den Abstand zwischen der Oberfläche des Objekts und der Kamera. Tiefeninformationen helfen Maschinen, räumliche Beziehungen innerhalb einer Szene zu verstehen und sind eine entscheidende Basistechnologie in Bereichen wie 3D-Rekonstruktion, Roboterwahrnehmung, autonomes Fahren und Augmented Reality.
Die Entwicklung der Tiefenschätzung hat sich von traditionellen geometrischen Methoden hin zu Deep-Learning-Verfahren weiterentwickelt. Frühe Methoden nutzten hauptsächlich Sensoren wie Stereosehen, Strukturlicht und LiDAR, um Tiefeninformationen durch Disparitätsberechnung oder aktive Entfernungsmessung zu gewinnen. Diese erforderten jedoch in der Regel zusätzliche Hardware. Mit der Entwicklung des Deep Learning begannen Forscher, monokulare Tiefenschätzungsverfahren zu erforschen, die die Tiefe direkt anhand eines einzelnen Bildes vorhersagen. Im Jahr 2014 veröffentlichten Forscher David Eigen et al. von der New York University eine Arbeit…Tiefenkartenvorhersage aus einem Einzelbild mithilfe eines Multi-Scale Deep-Learning-Netzwerks Diese Arbeit stellt eine Methode zur monokularen Tiefenvorhersage auf Basis multiskaliger Convolutional Neural Networks vor. Durch die Kombination globaler Szeneninformationen mit lokalen Detailmerkmalen können Tiefenkarten aus einem einzelnen Bild vorhergesagt werden. Dies bildet eine wichtige Grundlage für die nachfolgende Forschung zur Tiefenschätzung mittels Deep Learning.
Tiefenschätzungsverfahren beheben primär den Mangel an räumlicher Skala in zweidimensionalen visuellen Informationen. Je nach Eingabemethode lässt sich diese Aufgabe in monokulare, binokulare und Mehransicht-Tiefenschätzung unterteilen. Monokulare Verfahren basieren ausschließlich auf herkömmlichen Bilddaten und leiten die Tiefe aus visuellen Hinweisen wie Objektgröße, Textur, Verdeckungsverhältnissen und Szenenstruktur ab. Binokulare Verfahren hingegen nutzen die Parallaxenbeziehungen zwischen mehreren Kameras, um die räumliche Distanz zu berechnen.
In den letzten Jahren konnte dank der Entwicklung umfangreicher Trainingsdatensätze und visueller Grundlagenmodelle die Generalisierungsfähigkeit monokularer Tiefenschätzungsmodelle deutlich verbessert werden. Selbst bei Szenen, die während des Trainings nicht erfasst wurden, liefern sie relativ zuverlässige Tiefenvorhersagen. Entsprechende Technologien finden breite Anwendung in Bereichen wie autonomes Fahren, Umgebungserkennung, Roboternavigation, 3D-Rekonstruktion, Virtual Reality (VR) und Augmented Reality (AR) und leisten einen entscheidenden Beitrag dazu, dass Maschinen die dreidimensionale Welt erfassen und verstehen können.
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.