HyperAIHyperAI

Command Palette

Search for a command to run...

Reconnaissance De Texte De Scène

Date

Organisation

Huazhong University of Science and Technology

URL du document

1507.05717

La reconnaissance de texte de scène (Scene Text Recognition, abrégé STR) est une technologie de vision par ordinateur destinée à la reconnaissance du contenu textuel dans des images de scènes naturelles, visant à détecter et reconnaître automatiquement le texte dans des environnements complexes tels que les paysages urbains, les panneaux publicitaires, les panneaux de signalisation et les emballages de produits. Contrairement à l'OCR traditionnel qui traite principalement des documents numérisés et des textes imprimés, la STR doit faire face à des problèmes réels tels que les variations d'éclairage, les changements de police, les distorsions de perspective, les interférences de fond et les formes de texte irrégulières.

Le développement de la reconnaissance de texte de scène repose sur des technologies telles que l'OCR, la détection de texte et la reconnaissance de séquences. Les méthodes précoces s'appuyaient généralement sur des caractéristiques conçues manuellement (comme HOG, SIFT, etc.) combinées à des classificateurs pour la reconnaissance de caractères, mais leur capacité de généralisation était limitée dans des environnements naturels complexes. En 2015, des chercheurs de l'Université des sciences et technologies de Huazhong ont proposé dans leur article An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition. le modèle CRNN (Convolutional Recurrent Neural Network), qui utilise des réseaux de neurones convolutifs (CNN) pour l'extraction de caractéristiques d'image, des réseaux de neurones récurrents (RNN) pour la modélisation de séquences, et combine la classification temporelle connexionniste (CTC) pour réaliser une reconnaissance de texte de bout en bout, devenant ainsi un travail de recherche important dans le domaine de la reconnaissance de texte de scène.

L'objectif principal de la STR est de prédire la séquence de caractères correspondante à partir d'images de texte dans des scènes naturelles. Contrairement aux méthodes traditionnelles basées sur l'ingénierie manuelle des caractéristiques, les modèles STR modernes apprennent généralement automatiquement la forme des caractères et les informations contextuelles dans les images grâce à des réseaux de neurones profonds, et sont évalués sur des ensembles de données de texte régulier (tels que IIIT5K, SVT, IC13) ainsi que sur des ensembles de données de texte irrégulier (tels que IC15, SVTP, CUTE80). Avec le développement de l'apprentissage profond et des modèles de base de vision, la reconnaissance de texte de scène a progressivement évolué d'architectures CNN-RNN vers des méthodes de reconnaissance basées sur Transformer, et a en outre intégré les capacités des modèles de langage visuel, améliorant ainsi la compréhension des modèles pour les polices complexes, les textes longs et les images de faible qualité. Actuellement, la technologie STR est largement appliquée dans des domaines tels que les transports intelligents, la recherche d'images, l'analyse de documents, la vision robotique et les systèmes d'assistance visuelle, constituant une direction technologique importante pour la compréhension par vision par ordinateur des informations textuelles du monde réel.

[JIALIU_0]

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp