Command Palette
Search for a command to run...
深度估计(Depth Estimation)是一类用于从二维图像或视频中推断场景三维结构信息的计算机视觉技术,其目标是预测图像中每个像素对应的深度值,即物体表面与摄像机之间的距离。深度信息能够帮助机器理解场景中的空间关系,是三维重建、机器人感知、自动驾驶和增强现实等领域的重要基础技术。
深度估计的发展经历了从传统几何方法到深度学习方法的演进过程。早期方法主要依赖双目视觉(Stereo Vision)、结构光、激光雷达等传感器,通过视差计算或主动测距获取深度信息,但通常需要额外硬件支持。随着深度学习的发展,研究人员开始探索利用单张图像直接预测深度的单目深度估计(Monocular Depth Estimation)方法。 2014 年,纽约大学研究人员 David Eigen 等人在论文Depth Map Prediction from a Single Image using a Multi-Scale Deep Network 中提出基于多尺度卷积神经网络的单目深度预测方法,通过结合全局场景信息与局部细节特征,实现了从单幅图像预测深度图,为后续基于深度学习的深度估计研究提供了重要基础。
深度估计技术主要解决二维视觉信息缺少空间尺度的问题。根据输入方式不同,该任务通常可以分为单目深度估计、双目深度估计以及多视角深度估计。其中,单目方法仅依赖普通图像输入,通过学习物体大小、纹理、遮挡关系和场景结构等视觉线索推断深度;双目方法则利用多个摄像机之间的视差关系计算空间距离。
近年来,得益于大规模混合数据集训练和视觉基础模型的发展,单目深度估计模型的零样本泛化能力明显提升——即便面对训练时从未接触过的场景,也能给出较为可靠的深度预测。相关技术已广泛应用于自动驾驶环境感知、机器人导航、三维重建、虚拟现实(VR)和增强现实(AR)等场景,为机器获取和理解三维世界提供了重要支持。