HyperAIHyperAI

Command Palette

Search for a command to run...

Optische Zeichenerkennung

Datum

vor 6 Stunden

Paper-URL

1507.05717

Die optische Zeichenerkennung (OCR) ist eine Technologie, die mithilfe von Computer Vision und Algorithmen Text in Bildern wie Papierdokumenten, Scans oder Fotos automatisch erkennt und in bearbeitbaren und durchsuchbaren elektronischen Text umwandelt. Die Entwicklung dieses Konzepts verlief schrittweise: Bereits 1914 bzw. 1929 erfanden der Physiker Emanuel Goldberg und der Ingenieur Gustav Tauschek frühe mechanische, vorlagenbasierte Zeichenerkennungsgeräte und legten damit den Grundstein für die Technologie. In den 1950er-Jahren brachte IMR, gegründet von David H. Shepard, das erste kommerziell erhältliche OCR-Gerät „Gismo“ auf den Markt, und in der Folge… IBM im Jahr 1959Bei der Vermarktung kommerzieller Scan- und Zeichenerkennungssysteme wurde die Technologie offiziell benannt... Optische Zeichenerkennung (OCR)Dies hat dazu geführt, dass es sich um einen weltweit anerkannten Branchenstandard handelt.

Im Zuge der technologischen Entwicklung haben mehrere wegweisende Veröffentlichungen die OCR von regelbasierten Vergleichen hin zum Zeitalter des Deep Learning und groß angelegter Modelle geführt. 1998 veröffentlichten Yann LeCun et al. eine Arbeit bei den AT&T Bell Labs… Gradientenbasiertes Lernen angewendet auf die Dokumentenerkennung Ray Smith entwickelte das LeNet-5-Netzwerk und den MNIST-Datensatz und legte damit den Grundstein für die Anwendung von Convolutional Neural Networks in der Zeichenerkennung; 2007 veröffentlichte Ray Smith... Ein Überblick über die Tesseract OCR-Engine Diese Arbeit beschreibt detailliert die Architektur und die Mechanismen der Open-Source-Engine Tesseract und setzt damit einen neuen Maßstab im Open-Source-Bereich. Im Jahr 2017 veröffentlichten Baoguang Shi et al. von der Huazhong University of Science and Technology… Ein durchgängig trainierbares neuronales Netzwerk zur bildbasierten Sequenzerkennung Es wurde eine CRNN+CTC-Architektur vorgeschlagen, die das End-to-End-Erkennungsproblem von Texten variabler Länge und kursiven Zeichen löst; im Jahr 2023 veröffentlichten Minghao Li et al. von Microsoft Research Asia... TrOCR: Transformatorbasierte optische Zeichenerkennung mit vortrainierten Modellen Die Einführung von Vision Transformer in die OCR markiert eine neue Phase in der umfassenden Weiterentwicklung von Erkennungsparadigmen hin zu Selbstaufmerksamkeitsmechanismen und intelligentem Dokumentenparsing.

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp