HyperAIHyperAI

Command Palette

Search for a command to run...

Szenentext-Erkennung

Datum

Organisation

Huazhong University of Science and Technology

Paper-URL

1507.05717

Szenentext-Erkennung (Scene Text Recognition, kurz STR) ist eine Computer-Vision-Technologie zur Erkennung von Textinhalten in natürlichen Szenenbildern. Das Ziel besteht darin, Text in komplexen Umgebungen wie Straßenansichten, Werbetafeln, Verkehrsschildern und Produktverpackungen automatisch zu erkennen und zu identifizieren. Im Gegensatz zur traditionellen OCR, die hauptsächlich gescannte Dokumente und gedruckten Text verarbeitet, muss STR mit Problemen wie Beleuchtungsänderungen, Schriftvarianten, perspektivischen Verzerrungen, Hintergrundstörungen und unregelmäßigen Textformen in der realen Welt umgehen.

Die Entwicklung der Szenentext-Erkennung basiert auf Technologien wie OCR, Texterkennung und Sequenzidentifikation. Frühe Methoden verließen sich in der Regel auf manuell gestaltete Merkmale (wie HOG, SIFT usw.) in Kombination mit Klassifikatoren zur Texterkennung, hatten jedoch in komplexen natürlichen Umgebungen nur eine begrenzte Generalisierungsfähigkeit. Im Jahr 2015 schlugen Forscher der Huazhong University of Science and Technology in der Arbeit An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition das CRNN-Modell (Convolutional Recurrent Neural Network) vor, das Convolutional Neural Networks (CNN) zur Bildextraktion, Recurrent Neural Networks (RNN) zur Sequenzmodellierung und CTC (Connectionist Temporal Classification) für die End-to-End-Texterkennung kombiniert – eine bedeutende Forschungsarbeit im Bereich der Szenentext-Erkennung.

Das Kernziel von STR besteht darin, die entsprechende Zeichensequenz aus Textbildern in natürlichen Szenen vorherzusagen. Im Gegensatz zu traditionellen Methoden, die auf manueller Merkmalsentwicklung basieren, lernen moderne STR-Modelle in der Regel automatisch die Textformen und Kontextinformationen in Bildern durch tiefe neuronale Netze und werden auf Benchmark-Aufgaben wie regulären Textdatensätzen (z. B. IIIT5K, SVT, IC13) sowie unregelmäßigen Textdatensätzen (z. B. IC15, SVTP, CUTE80) evaluiert. Mit der Entwicklung von Deep Learning und visuellen Basismodellen hat sich die Szenentext-Erkennung allmählich von CNN-RNN-Architekturen zu Transformer-basierten Erkennungsmethoden weiterentwickelt und integriert zudem Fähigkeiten von visuell-sprachlichen Modellen, wodurch das Verständnis komplexer Schriftarten, langer Texte und qualitativ minderwertiger Bilder verbessert wird. Derzeit wird STR-Technologie in Bereichen wie intelligentem Verkehr, Bildabruf, Dokumentenanalyse, Roboter-Vision und visuellen Assistenzsystemen weit verbreitet eingesetzt und stellt eine wichtige technologische Richtung für das Verständnis realer Textinformationen in der Computer Vision dar.

[JIALIU_0]

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp