HyperAIHyperAI

Command Palette

Search for a command to run...

Détection d'objets

Date

Organisation

UC Berkeley

URL du document

1311.2524

La détection d'objets est une tâche de vision par ordinateur utilisée pour identifier les catégories d'objets dans des images ou des vidéos et déterminer simultanément leur emplacement. Cette technique combine classification d'objets et localisation spatiale, nécessitant de déterminer non seulement « ce qui se trouve dans » une image, mais aussi « où cela se trouve ». Elle permet généralement une compréhension structurée des scènes visuelles en prédisant les catégories d'objets, leurs cadres de délimitation ou d'autres informations spatiales, et constitue l'une des tâches fondamentales en vision par ordinateur.

Le développement de la détection d'objets repose sur des recherches de longue haleine dans de multiples domaines, notamment la classification d'images, la localisation d'objets et la vision par ordinateur traditionnelle. Les premières méthodes utilisaient principalement des fenêtres glissantes, des caractéristiques conçues manuellement (telles que Haar et HOG) et des combinaisons de classificateurs pour effectuer la recherche d'objets, mais leur efficacité de calcul et leur adaptabilité aux scènes complexes étaient limitées. Avec l'avènement de l'apprentissage profond, les chercheurs ont commencé à utiliser des réseaux neuronaux convolutifs pour apprendre automatiquement les caractéristiques visuelles. En 2014, les chercheurs Ross Girshick et al. de l'Université de Californie à Berkeley ont publié un article… Hiérarchies de caractéristiques riches pour une détection d'objets et une segmentation sémantique précises La méthode R-CNN a été proposée, qui introduit des caractéristiques de convolution profonde dans la tâche de détection d'objets, améliorant considérablement les performances de détection et devenant l'une des études représentatives importantes dans le domaine de la détection d'objets par apprentissage profond.

Les systèmes modernes de détection d'objets s'appuient généralement sur des technologies telles que les réseaux de neurones convolutifs (CNN), les Transformers et les modèles de vision de base pour classifier et localiser les objets dans les images. Selon la méthode de détection, on distingue les méthodes à deux étapes (comme Faster R-CNN) et les méthodes à une seule étape (comme YOLO et SSD). Ces systèmes sont largement utilisés dans des domaines tels que la conduite autonome, la surveillance intelligente, la perception robotique, le contrôle industriel et l'analyse d'images médicales. Ces dernières années, le paradigme de la détection a également évolué : les détecteurs Transformers de bout en bout, représentés par DETR, éliminent les étapes de post-traitement manuel telles que la conception des boîtes d'ancrage et la suppression des non-maxima ; les méthodes de détection à vocabulaire ouvert, combinées à des modèles vision-langage, permettent au système d'identifier des catégories d'objets non rencontrées lors de l'entraînement, élargissant ainsi le champ d'application de la détection d'objets.

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp