HyperAIHyperAI

Command Palette

Search for a command to run...

光学文字認識

光学文字認識(OCR)は、コンピュータビジョンとアルゴリズムを用いて、紙文書、スキャン画像、写真などの画像内のテキストを自動的に認識し、編集・検索可能な電子テキストに変換する技術です。この概念の発展は段階的な進化を遂げてきました。1914年と1929年には、物理学者のエマニュエル・ゴールドバーグとエンジニアのグスタフ・タウシェクがそれぞれ初期の機械式テンプレートベースの文字認識装置を発明し、この技術の機械的な基礎を築きました。1950年代には、デビッド・H・シェパードが設立したIMRが、初の市販OCR装置「Gismo」を発売し、その後… IBM、1959年商用スキャンおよび文字認識システムを宣伝する際、この技術は正式には次のように名付けられました... 光学文字認識(OCR)これにより、これは世界的に認められた業界標準用語となった。

技術の進化の過程で、いくつかの画期的な論文がOCRをルールベースの比較からディープラーニングと大規模モデルの時代へと押し上げた。1998年、ヤン・ルカンらはAT&Tベル研究所で論文を発表した。 文書認識に適用された勾配ベース学習 レイ・スミスはLeNet-5ネットワークとMNISTデータセットを提案し、文字認識における畳み込みニューラルネットワークの応用の基礎を築きました。2007年、レイ・スミスは… Tesseract OCRエンジンの概要 本論文は、オープンソースエンジンTesseractのアーキテクチャとメカニズムを詳細に解説し、オープンソース分野におけるベンチマークを確立するものである。2017年、華中科技大学のBaoguang Shiらは、… 画像ベースのシーケンス認識のためのエンドツーエンド学習可能なニューラルネットワーク CRNN + CTCアーキテクチャが提案され、可変長テキストと筆記体の文字のエンドツーエンド認識問題を解決しました。2023年、Microsoft Research AsiaのMinghao Liらが発表しました... TrOCR:事前学習済みモデルを用いたTransformerベースの光学文字認識 Vision TransformerのOCRへの導入は、自己注意機構とインテリジェントな文書解析に向けた認識パラダイムの包括的な進歩における新たな段階を示すものです。

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています