HyperAIHyperAI

Command Palette

Search for a command to run...

Aria-UI: التأصيل البصري للتعليمات الرسومية للمستخدم

Yuhao Yang; Yue Wang; Dongxu Li; Ziyang Luo; Bei Chen; Chao Huang; Junnan Li

الملخص

الوكلاء الرقميون المخصصون لتمكين التلقية في مهام عبر منصات مختلفة عن طريق التلاعب المباشر بالواجهات الرسومية (GUIs) يكتسبون أهمية متزايدة. ومع ذلك، فإن تحديًا كبيرًا لا يزال يواجه هذه الوكلاء، وهو ربط التعليمات اللغوية بالعناصر المستهدفة بسبب الاعتماد على مدخلات HTML أو AXTree. في هذا البحث، نقدم Aria-UI، وهو نموذج متعدد الأوضاع ذو حجم كبير تم تصميمه خصيصًا لربط الواجهة الرسومية (GUI grounding). يتبنى Aria-UI نهجًا بصرى خالصًا، مما يجعله غير معتمد على المدخلات المساعدة. للتكيف مع تعليمات التخطيط المتنوعة، نقترح أنبوب بيانات قابل للتوسع ينتج عينات تعليمات متنوعة وعالية الجودة لعملية الربط. لمعالجة السياقات الديناميكية أثناء أداء المهام، يتم دمج سجلات الأنشطة النصية والنص-صورة المتداخلة في Aria-UI، مما يمكنه من إجراء استدلال مستند إلى السياق بشكل قوي لعملية الربط. حقق Aria-UI نتائج جديدة تتفوق على أفضل ما هو موجود في المقاييس المرجعية للوكلاء الجاهزين والمتصادفين عبر الإنترنت، حيث تفوق على أساسيات الرؤية فقط وأساسيات الاعتماد على AXTree. لقد أطلقنا جميع بيانات التدريب ونقاط التحقق من النموذج لتشجيع المزيد من الأبحاث في https://ariaui.github.io.


بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp
Aria-UI: التأصيل البصري للتعليمات الرسومية للمستخدم | مستندات | HyperAI