HyperAIHyperAI

Command Palette

Search for a command to run...

EPIC-Fusion: ربط الزمني السمعي البصري للاعتراف بالحركة الذاتية

Kazakos Evangelos ; Nagrani Arsha ; Zisserman Andrew ; Damen Dima

الملخص

نركز على دمج الأوضاع المتعددة لتمييز الأنشطة من وجهة نظر الشخص الأول، ونقترحهندسة معمارية جديدة للربط الزمني للأوضاع المتعددة، أي الجمع بين الأوضات ضمن نطاق من الاختلافات الزمنية. نقوم بتدريب هذه الهندسة المعمارية باستخدام ثلاثة أوضات -- RGB (الصورة)، التدفق (Flow) والصوت (Audio) -- ونجمعها مع دمج مستويات الوسط إلى جانب عينات زمنية نادرة من التمثيلات المدمجة. على عكس الأعمال السابقة، يتم دمج الأوضات قبل التجميع الزمني، مع وزن مشترك للأوضات والدمج عبر الزمن. الهندسة المعمارية المقترحة تُدرب بشكل شامل من البداية إلى النهاية، وتتفوق على الأوضات الفردية وكذلك الدمج المتأخر للأوضات. نوضح أهمية الصوت في الرؤية من وجهة نظر الشخص الأول، بناءً على كل فئة بشكل منفصل، لتحديد الأنشطة وكذلك الكائنات التفاعلية. يحقق طرحنا نتائجًا رائدة في المجال على كل من مجموعتي الاختبار المعروفة وغير المعروفة في أكبر مجموعة بيانات للرؤية من وجهة نظر الشخص الأول: EPIC-Kitchens، باستخدام جميع المؤشرات الموجودة في لوحة الترتيب العامة.


بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp