HyperAIHyperAI

Command Palette

Search for a command to run...

يقيس معيار جديد استدلال الذكاء الاصطناعي السريري

كشف باحثون في كلية طب جامعة ييل عن إطار عمل تقييمي جديد يُعرف باسم MedicalAgentsBench، يهدف إلى قياس دقة النماذج اللغوية الكبيرة في دعم القرارات السريرية، ومقارنة منهجين رئيسيين في تطوير الذكاء الاصطناعي الطبي. يقود البحث الأستاذ مارك جيرشتاين، الباحث الرئيسي في المعهد، إلى جانب يانجون شاو وشيانغرو تانغ، ونُشرت النتائج في مجلة Patterns. يعتمد العمل السريري الحديث عادةً على استشارات فرق متعددة التخصصات. وفي سياق الذكاء الاصطناعي، انقسم التطور إلى نمطين: الأول يعتمد على وكلاء لغويين متعددين يتواصلون بشكل خارجي لمحاكاة اللجان الطبية، والثاني يعتمد على نموذج لغوي مفرد مدرب على معالجة الخطوات الاستدلالية داخلياً قبل تقديم الإجابة. وعلى الرغم من الجدل المستمر حول تفوق أحدهما على الآخر، تعاني أدوات التقييم الحالية من ظاهرة تشبع الدقة، حيث تعتمد النماذج المتقدمة على حفظ الإجابات بدلاً من إثبات قدرتها على الاستدلال المعقد. لعب هذه الفجوة، طور الفريق معيار MedicalAgentsBench باستخدام ثماني مجموعات بيانات طبية معتمدة، مما أنتج أكثر من ثمانمائة سؤال طبي يتطلب تفكيراً متعدد الخطوات. أظهرت التجارب أن الكفاءة لا ترتبط بنهج واحد حصرياً، بل إن دمج النمطين الداخلي والخارجي يعزز الأداء بشكل ملحوظ، مما يؤكد تكاملهما في السياقات الطبية الصعبة. يأتي إطلاق هذا المعيار في ظل قيود صارمة على الخصوصية تمنع المؤسسات الصحية من الاعتماد المباشر على النماذج العامة المتاحة للجمهور. يوفر MedicalAgentsBench أداة قياسية تتيح للمستشفيات ومزودي الرعاية الصحية تقييم الفعالية والأداء التقني قبل تطوير أنظمة خاصة داخلية، مما يخفض تكاليف التجربة ويضمن موثوقية المدخلات السريرية. يؤكد الباحثون أن الإطار الجديد يُمهد الطريق لاعتماد أكثر دقة للذكاء الاصطناعي في دعم القرارات الطبية، مع التركيز على قابلية التخصيص والمراجعة المستقلة للأداء السريري.

الروابط ذات الصلة

يقيس معيار جديد استدلال الذكاء الاصطناعي السريري | القصص الشائعة | HyperAI