Command Palette
Search for a command to run...
التعرف على النص في المشهد
التعرف على النص في المشاهد (Scene Text Recognition، ويُختصر إلى STR) هو فئة من تقنيات الرؤية الحاسوبية موجهة للتعرف على محتوى النص في صور المشاهد الطبيعية، ويهدف إلى اكتشاف النص والتعرف عليه تلقائيًا في البيئات المعقدة مثل مشاهد الشوارع واللوحات الإعلانية واللافتات المرورية وتغليف المنتجات. على عكس OCR التقليدي الذي يتعامل بشكل أساسي مع المستندات الممسوحة ضوئيًا والنصوص المطبوعة، يجب أن يواجه STR التغيرات في الإضاءة وتنوع الخطوط والتشوه المنظوري والتداخل الخلفي والأشكال النصية غير المنتظمة في العالم الحقيقي.
يعتمد تطوير التعرف على النص في المشاهد على أسس تقنيات مثل OCR واكتشاف النص والتعرف على التسلسلات. اعتمدت الطرق المبكرة عادةً على الميزات المصممة يدويًا (مثل HOG و SIFT وغيرها) مع المصنفات لإتمام التعرف على النص، لكن قدرتها على التعميم في البيئات الطبيعية المعقدة كانت محدودة. في عام 2015، قدم باحثون من جامعة هواتشونغ للعلوم والتكنولوجيا في ورقتهم البحثية An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition نموذج CRNN (الشبكة العصبية التكرارية الالتفافية)، حيث استُخدمت الشبكات العصبية الالتفافية (CNN) لاستخراج ميزات الصورة، والشبكات العصبية التكرارية (RNN) لنمذجة التسلسلات، مع دمج التصنيف الزمني الاتصالي (CTC) لتحقيق التعرف على النص من البداية إلى النهاية، مما أصبح عملًا بحثيًا مهمًا في مجال التعرف على النص في المشاهد.
الهدف الأساسي لـ STR هو التنبؤ بتسلسل الأحرف المقابل من صور النص في المشاهد الطبيعية. على عكس الطرق التقليدية التي تعتمد على هندسة الميزات اليدوية، تتعلم نماذج STR الحديثة عادةً أشكال النص والمعلومات السياقية في الصور تلقائيًا عبر الشبكات العصبية العميقة، ويتم تقييمها في مهام معيارية مثل مجموعات بيانات النص المنتظم (مثل IIIT5K و SVT و IC13) ومجموعات بيانات النص غير المنتظم (مثل IC15 و SVTP و CUTE80). مع تطور التعلم العميق والنماذج الأساسية للرؤية، تطور التعرف على النص في المشاهد تدريجيًا من بنية CNN-RNN إلى طرق التعرف القائمة على المحولات (Transformer)، ودمج قدرات نماذج اللغة البصرية بشكل أكبر، مما حسّن فهم النماذج للخطوط المعقدة والنصوص الطويلة والصور منخفضة الجودة. حاليًا، تُستخدم تقنية STR على نطاق واسع في مجالات مثل النقل الذكي واسترجاع الصور وتحليل المستندات ورؤية الروبوتات والأنظمة البصرية المساعدة، وهي اتجاه تقني مهم لفهم معلومات النص في العالم الحقيقي ضمن الرؤية الحاسوبية.
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.