Command Palette
Search for a command to run...
광학 문자 인식(OCR)
광학 문자 인식(OCR)은 컴퓨터 비전과 알고리즘을 사용하여 종이 문서, 스캔본, 사진 등의 이미지에서 텍스트를 자동으로 인식하고 편집 및 검색 가능한 전자 텍스트로 변환하는 기술입니다. 이 개념의 발전은 점진적이었습니다. 1914년과 1929년에 물리학자 에마누엘 골드버그와 엔지니어 구스타프 타우셰크는 각각 초기 기계식 템플릿 기반 문자 인식 장치를 발명하여 이 기술의 기계적 프로토타입의 토대를 마련했습니다. 1950년대에는 데이비드 H. 셰퍼드가 설립한 IMR이 최초의 상용 OCR 장치인 "Gismo"를 출시했고, 그 이후로… 1959년의 IBM상용 스캐닝 및 문자 인식 시스템을 홍보할 당시, 해당 기술은 공식적으로 다음과 같은 이름으로 불렸습니다... 광학 문자 인식(OCR)이로 인해 해당 용어는 전 세계적으로 통용되는 업계 표준 용어가 되었습니다.
기술 발전 과정에서 여러 획기적인 논문들이 OCR을 규칙 기반 비교 방식에서 딥러닝 및 대규모 모델 시대로 이끌었습니다. 1998년, 얀 르쿤(Yann LeCun) 외 연구진은 AT&T 벨 연구소에서 논문을 발표했습니다... 문서 인식에 적용된 경사 기반 학습 레이 스미스는 LeNet-5 네트워크와 MNIST 데이터셋을 제안하여 합성곱 신경망을 문자 인식에 적용하는 토대를 마련했습니다. 2007년, 레이 스미스는 관련 논문을 발표했습니다... Tesseract OCR 엔진 개요 본 논문은 오픈 소스 엔진 테서랙트(Tesseract)의 아키텍처와 메커니즘을 상세히 설명하며, 오픈 소스 분야의 새로운 기준을 제시합니다. 2017년, 화중과학기술대학교의 바오광 시(Baoguang Shi) 연구팀은 이 연구를 발표했습니다... 이미지 기반 시퀀스 인식을 위한 엔드투엔드 학습 가능 신경망 가변 길이 텍스트와 필기체 문자의 엔드투엔드 인식 문제를 해결하기 위해 CRNN + CTC 아키텍처가 제안되었으며, 2023년 마이크로소프트 리서치 아시아의 Minghao Li 외 연구진이 이를 발표했습니다. TrOCR: 사전 학습된 모델을 사용하는 트랜스포머 기반 광학 문자 인식 OCR에 Vision Transformer를 도입함으로써 자기주의 메커니즘과 지능형 문서 분석을 향한 인식 패러다임의 포괄적인 발전에 새로운 장이 열렸습니다.