HyperAIHyperAI

Command Palette

Search for a command to run...

场景文本识别 Scene Text Recognition

日期

组织

华中科技大学

论文 URL

1507.05717

场景文本识别(Scene Text Recognition,简称 STR)是一类面向自然场景图像中文本内容识别的计算机视觉技术,目标是在街景、广告牌、交通标识、商品包装等复杂环境中自动检测并识别文本。与传统 OCR 主要处理扫描文档、印刷文本不同,STR 需要面对真实世界中的光照变化、字体变化、透视畸变、背景干扰以及文本形态不规则等问题。

场景文本识别的发展建立在 OCR 、文本检测和序列识别等技术基础之上。早期方法通常依赖人工设计特征(如 HOG 、 SIFT 等)结合分类器完成文字识别,但在复杂自然环境下泛化能力有限。 2015 年,华中科技大学的研究人员在论文An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition。中提出 CRNN(Convolutional Recurrent Neural Network)模型,将卷积神经网络(CNN)用于图像特征提取,将循环神经网络(RNN)用于序列建模,并结合 CTC(Connectionist Temporal Classification)实现端到端文本识别,成为场景文本识别领域的重要研究工作。

STR 的核心目标是从自然场景中的文本图像中预测对应字符序列。与传统依赖人工特征工程的方法不同,现代 STR 模型通常通过深度神经网络自动学习图像中的文字形态和上下文信息,并在规则文本数据集(如 IIIT5K 、 SVT 、 IC13)以及不规则文本数据集(如 IC15 、 SVTP 、 CUTE80)等基准任务中进行评估。随着深度学习和视觉基础模型的发展,场景文本识别逐渐从 CNN-RNN 架构发展到基于 Transformer 的识别方法,并进一步融合视觉语言模型能力,提高了模型对复杂字体、长文本和低质量图像的理解能力。目前,STR 技术已广泛应用于智能交通、图像检索、文档分析、机器人视觉以及视觉辅助系统等领域,是计算机视觉理解现实世界文本信息的重要技术方向。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供