دراسة: أدوات الذكاء الاصطناعي للبرمجة ترتكب أخطاءً بنسبة 25%
أظهرت دراسة جديدة من جامعة واترلو أن أدوات البرمجة القائمة على الذكاء الاصطناعي ترتكب أخطاءً تصل نسبتها إلى واحدة من كل أربع مرات، مما يثير شكوكًا حول موثوقيتها في المهام الأساسية لتطوير البرمجيات. ومع تزايد اعتماد النماذج اللغوية الكبيرة في سير العمل البرمجي، يواجه المطورون صعوبة في التأكد من دقة وتناسق المخرجات التي ينتجها الذكاء الاصطناعي وسهولة دمجها في الأنظمة الأكبر. تتناول الدراسة التي بعنوان "StructEval" قدرات النماذج اللغوية في توليد مخرجات هيكلية محددة مسبقًا، وهي صيغة تفرض على النماذج الالتزام بأشكال محددة مثل JSON أو XML أو Markdown بدلاً من الرد باللغة الطبيعية الحرة. وقد تم تقديم هذا البحث في مجلةTransactions on Machine Learning Research وسيتم عرضه في مؤتمر ICLR لعام 2026. وعلى الرغم من أن شركات كبرى مثل OpenAI وGoogle وAnthropic سعت لتحسين هذه المخرجات لتسهيل قراءتها ومعالجتها آليًا، فإن النتائج تشير إلى أن التكنولوجيا لا تزال غير موثوقة بالقدر الذي توقعه المطورون. في الاختبارات التي شملت 11 نموذجًا لغويًا عبر 18 صيغة هيكلية و44 مهمة، حقق أكثر النماذج تقدمًا دقة حوالي 75% فقط، بينما تراوحت دقة النماذج مفتوحة المصدر حوالي 65%. لم تقيس الدراسة مجرد صحة التركيب النحوي للكود، بل فحصت أيضًا دقة المخرجات الفعلية للمهام المختلفة. كما أوضح الدكتور Dongfu Jiang، الباحث الرئيسي في الدراسة، أن النماذج أداؤها مقبول في المهام النصية، لكنها تواجه صعوبات كبيرة في المهام التي تتطلب توليد صور أو مقاطع فيديو أو مواقع إلكترونية. جاءت الدراسة نتيجة تعاون بين جامعة واترلو وعدة باحثين، بما في ذلك طلاب ودكاترة، وقد اعتمدت على تقييمات من 17 باحثًا إضافيًا حول العالم. وأشار الباحثون إلى أن هذا النوع من المشاريع يبرز دور الطلاب في البحث والتقييم الفعلي للذكاء الاصطناعي، لا مجرد استخدامه. ومع ذلك، فإن النتائج تؤكد أن الأنظمة الحالية ليست ناضجة بما يكفي للعمل بمفرد دون إشراف بشري دقيق. يعتقد الباحثون أن المطورين لا يزالون بحاجة إلى مراقبة مستمرة للوكلاء الآليين الذين يعملون نيابة عنهم، خاصة مع استمرار ارتفاع نسبة الأخطاء في بعض المهام الحرجة. ورغم أن هذه النماذج تمثل قفزة في تطوير البرمجيات، إلا أن الاعتماد الكلي عليها قبل تطويرها أكثر دقة قد يؤدي إلى مشاكل كبيرة في جودة البرمجيات وسلامتها. لذا، فإن الاستخدام المسؤول لهذه الأدوات يتطلب توازنًا بين كفاءة الأتمتة والرقابة البشرية لضمان الموثوقية والدقة في بيئة العمل البرمجي المعقدة.
