Command Palette
Search for a command to run...
光学字符识别 Optical Character Recognition
光学字符识别(Optical Character Recognition,简称 OCR)是指将纸质文档、扫描件或照片等图像中的文字,通过计算机视觉与算法自动识别并转化为可编辑、可搜索的电子文本的技术。该概念的发展是一个渐进的演进过程:早在 1914 年与 1929 年,物理学家埃马努埃尔·戈德堡(Emanuel Goldberg)和工程师古斯塔夫·陶舍克(Gustav Tauschek)便分别发明了早期机械式与模板比对的字符识别装置,奠定了该技术的机械雏形;到了 1950 年代,戴维·谢泼德(David H. Shepard)创办的 IMR 公司推出了首款商业化 OCR 设备 “Gismo”,随后 IBM 于 1959 年在推广商业扫描与字符识别系统时,正式将该技术统一定名为 Optical Character Recognition(OCR),使其成为全球通行的行业标准术语。
在技术演进的过程中,多项里程碑式的论文成果推动了 OCR 从规则比对走向深度学习与大模型时代。 1998 年,Yann LeCun 等人在 AT&T 贝尔实验室发表的论文 Gradient-based learning applied to document recognition 提出了 LeNet-5 网络和 MNIST 数据集,奠定了卷积神经网络用于字符识别的基础;2007 年,Ray Smith 发表的 An Overview of the Tesseract OCR Engine 详细阐述了开源引擎 Tesseract 的架构与机制,成为了开源领域的标杆;2017 年,华中科技大学 Baoguang Shi 等人发表的 An End-to-End Trainable Neural Network for Image-Based Sequence Recognition 提出了 CRNN + CTC 架构,解决了不定长文本与连笔字符的端到端识别难题;到了 2023 年,微软亚洲研究院 Minghao Li 等人发表的 TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models 则将 Vision Transformer 引入 OCR,标志着识别范式全面迈入自注意力机制与文档智能解析的新阶段。