Command Palette
Search for a command to run...
目标检测(Object Detection)是一类计算机视觉任务,用于在图像或视频中识别目标类别,并同时确定目标所在的位置。该技术结合目标分类与空间定位能力,不仅需要判断图像中「有什么」,还需要回答「在哪里」,通常通过预测目标类别、边界框(Bounding Box)或其他空间信息实现对视觉场景的结构化理解,是计算机视觉领域的重要基础任务之一。
目标检测的发展建立在图像分类、目标定位和传统计算机视觉等多个领域的长期研究基础之上。早期方法主要依赖滑动窗口(Sliding Window)、人工设计特征(如 Haar 、 HOG)以及分类器组合完成目标搜索,但计算效率和复杂场景适应能力有限。随着深度学习的发展,研究人员开始利用卷积神经网络自动学习视觉特征。 2014 年,加州大学伯克利分校研究人员 Ross Girshick 等人在论文 Rich Feature Hierarchies for Accurate Object Detection and Semantic Segmentation 中提出 R-CNN 方法,将深度卷积特征引入目标检测任务,显著提升了检测性能,成为深度学习目标检测领域的重要代表性研究之一。
现代目标检测系统通常基于卷积神经网络(CNN)、 Transformer 和视觉基础模型等技术,对图像中的目标进行分类和定位。根据检测方式不同,可分为两阶段检测方法(如 Faster R-CNN)和单阶段检测方法(如 YOLO 、 SSD)等方向,并广泛应用于自动驾驶、智能监控、机器人感知、工业检测和医学影像分析等场景。近年来,检测范式也在发生变化:以 DETR 为代表的端到端 Transformer 检测器省去了锚框设计和非极大值抑制等手工后处理步骤;结合视觉-语言模型的开放词汇检测(Open-Vocabulary Detection)方法则让系统能够识别训练时未见过的目标类别,进一步拓宽了目标检测的应用边界。