Command Palette
Search for a command to run...
GOT-OCR-2.0 세계 최초의 범용 엔드투엔드 OCR 모델

프로젝트 소개
GOT-OCR-2.0 본 프로젝트는 일반 OCR 이론을 기반으로 광학 문자 인식(OCR)의 정확성과 효율성을 향상시키는 데 중점을 둔 통합 엔드투엔드 모델입니다. StepFun, Megvii Technology, 중국과학원대학교, 칭화대학교 연구팀이 공동으로 수행했으며, 관련 논문은 다음과 같습니다. 일반 OCR 이론: 통합 엔드투엔드 모델을 통한 OCR-2.0으로의 전환GOT-OCR 2.0은 장면 텍스트 인식 및 문서 인식과 같은 다양한 응용 시나리오에 적합합니다. 통합 아키텍처를 채택하여 텍스트의 다양성과 복잡성을 효율적으로 처리할 수 있습니다. 또한 장면 텍스트 인식은 물론 여러 페이지로 구성된 문서도 처리할 수 있어 OCR 분야에 더욱 뛰어난 유연성을 제공합니다.
GOT-OCR-2.0 특징은 다음과 같습니다.
- 강력한 다재다능함: 일반적인 OCR 이론을 기반으로 장면 텍스트와 표, 수식과 같은 복잡한 문서 구조를 처리할 수 있습니다.
- 엔드투엔드 모델: 통합된 엔드투엔드 아키텍처는 이미지 입력을 텍스트 출력으로 통합하여 전체 OCR 프로세스를 단순화합니다.
- 효율적인 성능: 통합된 Flash-Attention 기술로 인식 속도와 성능이 향상되었습니다.
- 다중 플랫폼 지원: CUDA 가속을 지원하고 GOT-OCR2.0 플랫폼과 통합되어 사전 학습된 모델을 로드합니다.
- 폭넓게 사용 가능: 여러 페이지 문서나 장면 텍스트 등 다양한 적용 시나리오에 적합합니다.