HyperAIHyperAI

Command Palette

Search for a command to run...

اقترح مختبر أرغون الوطني في الولايات المتحدة برنامج ChemGraph، الذي يستخدم 13 اختبارًا معياريًا لتقييم قيمة العوامل في مجال الكيمياء الحاسوبية.

Featured Image

في السنوات الأخيرة، أدى التطور السريع للذكاء الاصطناعي، وخاصة التقدم المحرز في نماذج اللغة الكبيرة (LLM)، إلى فتح آفاق جديدة للبحث العلمي الآلي.تم بالفعل تطوير العديد من البرامج القائمة على LLM لمساعدة المستخدمين في إكمال مهام مختلفة متعلقة بالكيمياء.على سبيل المثال، قام بران وآخرون بتطوير ChemCrow، وهو عامل كيميائي مدفوع بنموذج لغوي كبير، والذي يمكنه أداء مهام التخليق الكيميائي لمجموعة متنوعة من الجزيئات؛ قام ماكناوتون وآخرون بتطوير CACTUS، وهو عامل نموذج لغوي كبير يدمج أدوات المعلوماتية الكيميائية، والتي يمكن أن تساعد الباحثين على إكمال مهام مثل التنبؤ بالخصائص الجزيئية، والبحث عن التشابه، وتقييم تشابه الأدوية؛ اقترح وايت وزملاؤه MDCrow، وهو مساعد عامل LLM يمكنه أداء سير عمل الديناميكا الجزيئية (MD).
وفي هذا السياق،اقترح فريق بحثي من مختبر أرغون الوطني في الولايات المتحدة نظام ChemGraph، وهو نظام وكيل ذكي مدفوع بنموذج لغوي كبير.تم تصميمه لتنفيذ عمليات محاكاة الجزيئات في مجال الكيمياء الحاسوبية.
قيّم الباحثون أداء ChemGraph على 13 مهمة معيارية. وأظهرت النتائج أنه في المهام البسيطة التي لا تتطلب سوى عدد قليل من الأدوات، حققت نماذج اللغة الصغيرة ذات الحجم الكبير (مثل GPT-4o-mini وClaude-3.5-haiku) دقة واستقرارًا عاليين. مع ذلك، ومع ازدياد تعقيد المهمة، انخفض أداء هذه النماذج بشكل ملحوظ، بينما حافظ النموذج الكبير (GPT-4o) على أداء قوي. ومن خلال تقسيم المهام المعقدة استراتيجيًا إلى مهام فرعية أصغر وأكثر قابلية للإدارة، حتى مع النماذج الأصغر حجمًا، أمكن تحسين أداء ChemGraph ليُضاهي، بل ويتفوق في بعض الحالات، على أداء GPT-4o.
تم نشر نتائج البحث ذات الصلة، بعنوان "ChemGraph كإطار عمل فعال لسير العمل في الكيمياء الحاسوبية"، في المجلة الفرعية Nature Communications Chemistry.

أبرز الأبحاث:

يستفيد برنامج ChemGraph من النماذج القائمة على الشبكات العصبية البيانية لتحقيق حسابات دقيقة وفعالة، مع الجمع بين فهم اللغة الطبيعية وتخطيط المهام وقدرات التفكير العلمي لبرنامج LLM، مما يوفر واجهة مستخدم بديهية وتفاعلية.

يمكن لبرنامج ChemGraph أداء مجموعة من المهام، بدءًا من إنشاء سلاسل SMILES والهياكل الجزيئية وصولاً إلى تحسين الهندسة والتحليل الاهتزازي والحسابات الكيميائية الحرارية.

يدعم برنامج ChemGraph المستخدمين في استخدام مجموعة متنوعة من أساليب المحاكاة الجزيئية، بما في ذلك الأساليب شبه التجريبية، ووظائف الجهد للتعلم الآلي، ونظرية الكثافة الوظيفية (DFT).

عنوان الورقة:

https://www.nature.com/articles/s42004-025-01776-9

تُؤسس ثلاثة عشر تجربة معيارية نظام تقييم للوكلاء الأذكياء في الكيمياء الحاسوبية.

على الرغم من وجود بعض الأطر المعيارية لتقييم العوامل، إلا أنه لا يوجد حتى الآن معيار موحد لتقييم العوامل في مجال الكيمياء الحاسوبية. لذلك، صمم الباحثون 13 تجربة معيارية لتقييم قدرات برنامج ChemGraph.تهدف هذه التجارب إلى اختبار قدرة ChemGraph على إنجاز المهام باستخدام ست أدوات متكاملة، بما في ذلك استدعاءات الأدوات الفردية واستدعاءات سلسلة الأدوات.
استنادًا إلى أنواع مدخلات المستخدم المختلفة، قُسّمت هذه المهام إلى ثلاث فئات: (1) الاسم الجزيئي؛ (2) سلسلة SMILES؛ (3) التفاعل الكيميائي. يلخص الجدول أدناه 360 تقييمًا مستقلًا أُجريت في 13 تجربة.

*جدول ملخص التجارب المعيارية المستخدمة لتقييم برنامج ChemGraph*

في التجارب الإحدى عشرة الأولى، تمحورت المهام بشكل أساسي حول أسماء الجزيئات أو سلاسل SMILES، حيث تطلبت كل مهمة أربع استدعاءات للأدوات كحد أقصى أو أربع مهام فرعية. في المقابل، ركزت التجربتان الأخيرتان على حساب الخصائص الكيميائية الحرارية للتفاعلات الكيميائية، مما زاد من التعقيد بشكل ملحوظ وتطلب من 9 إلى 12 استدعاءً للأدوات اعتمادًا على عدد المتفاعلات والنواتج. تطلبت هذه المهام إجراء حسابات كيميائية حرارية لكل مادة على حدة، ثم بناء خصائص على مستوى التفاعل استنادًا إلى النتائج التي تم الحصول عليها سابقًا.

ChemGraph، إطار عمل للوكلاء الأذكياء مدعوم بنموذج لغوي كبير

ChemGraph هو إطار عمل للوكلاء الأذكياء مدعوم بنموذج لغوي ضخم، مصمم لأتمتة عمليات محاكاة الجزيئات من خلال استدعاءات أدوات منظمة وقدرات استدلالية. وهو مبني على LangGraph ويتبع إطار عمل ReAct.

يقدم LangGraph نموذج تنفيذ قائم على الرسوم البيانية مصمم لتعزيز التعاون بين عدة وكلاء. يتكون سير عمل LangGraph النموذجي من ثلاثة أجزاء:

  • ولايةالحالة هي بنية بيانات مشتركة تمثل الحالة الحالية للنظام.
  • العقدالعقدة هي دالة في لغة بايثون تُحدد منطق الوكيل. تأخذ الحالة الحالية كمدخلات وتُعيد الحالة المُحدثة. يمكن أن تكون العقدة نموذجًا لغويًا كبيرًا أو دالة تُنفذ عملية مُحددة.
  • الحوافالحافة هي دالة تتحكم في تدفق الرسائل، وتحدد العقدة التي سيتم تنفيذها تالياً. يمكن تقسيم الحواف إلى حواف موجهة وحواف مشروطة؛ تمثل الحواف الموجهة نقلًا ثابتًا أحادي الاتجاه للرسائل من عقدة إلى أخرى؛ في المقابل، توفر الحواف المشروطة مرونة أكبر، مما يسمح بتدفق الرسائل إلى عقد مختلفة بناءً على شروط محددة.

يوضح الرسم البياني أدناه البنية العامة لـ ChemGraph: أولًا، يستقبل وكيل نموذج اللغة الكبير مجموعة من الأدوات المُعرَّفة مسبقًا. وبناءً على توجيهات المستخدم، يُحدد الوكيل الأداة التي سيستخدمها. بعد كل استخدام للأداة، يستقبل نموذج اللغة الكبير النتيجة ويُحدد ما إذا كان هناك حاجة لاستخدام أداة أخرى. بمجرد اكتمال جميع استخدامات الأدوات، يُمكن مواصلة إرسال الرسالة عبر أحد مسارين.

*نظرة عامة على برنامج CHEMGraph*

في المسار الأول، يُعيد ChemGraph، على غرار نموذج اللغة التقليدي واسع النطاق، استجابةً شبيهةً باستجابة الإنسان تتضمن نتائج استدعاءات الأدوات. أما في الوضع الثاني، فتُحال الرسالة إلى وكيل نموذج لغة واسع النطاق آخر، والذي يُولّد مخرجات مُهيكلة (بتنسيق JSON مُحدد مسبقًا) مباشرةً استجابةً لطلب المستخدم. يدعم هذا التصميم ثنائي الوضع كلاً من التفاعل باللغة الطبيعية والتقييم المنهجي، مما يُمكّن ChemGraph من تلبية كلٍ من حالات الاستخدام النموذجية وسير عمل التقييم.

يوضح الرسم التخطيطي التالي بشكل أكبر كيف يستدعي برنامج ChemGraph الأدوات وينسق مخرجاتها لإنجاز مهام الكيمياء الحاسوبية:

*مثال على تفاعل الإنسان مع برنامج ChemGraph (عامل واحد) عند تنفيذ مهمة react2enthalpy باستخدام GPT-4o-mini* 

في هذا المثال، يطلب المستخدم من برنامج ChemGraph حساب إنثالبي تفاعل احتراق الميثان عند 400 كلفن باستخدام طريقة GFN2-xTB. يقوم برنامج ChemGraph (المجهز بوحدة GPT-4o-mini) أولاً بتحويل الاسم الكيميائي لكل جزيء في التفاعل إلى سلسلة SMILES (استدعاءات الأداة من 1 إلى 4). ثم، بناءً على سلاسل SMILES هذه، يُنشئ البرنامج إحداثيات ذرية في بنية بيانات AtomsData (استدعاءات الأداة من 5 إلى 8). وأخيرًا، يُجري برنامج ChemGraph حسابات الديناميكا الحرارية باستخدام الإحداثيات الذرية المُنشأة والمعلمات التي يُحددها المستخدم (مثل نوع الآلة الحاسبة ودرجة الحرارة، إلخ).

يمكن لبنية متعددة العوامل أن تحسن أداء النموذج بشكل كبير

قام فريق البحث بتقييم أداء برنامج ChemGraph بشكل منهجي في مهام الكيمياء الحاسوبية ذات التعقيد المتفاوت من خلال اختباره على 13 مهمة معيارية:

تقييم العامل الواحد

في البداية، قيّم الباحثون أداء برنامج ChemGraph أحادي العامل في 13 مهمة تجريبية باستخدام ثلاثة نماذج لغوية كبيرة هي: GPT-4o-mini وClaude-3.5-haiku وQwen-2.5-14B. بالنسبة لـ GPT-4o، تم تقييم أدائه في المسألتين الأخيرتين فقط (react2enthalpy وreact2gibbs). يوضح الشكل التالي دقة النماذج المختلفة في المهام المختلفة:

*خريطة حرارية لدقة مخطط ChemGraph أحادي العامل* 

يخرج مهمة name2smiوسطلم يستدعِ برنامج Claude-3.5-haiku أداة molecule_name_to_smiles بشكلٍ منتظم. بل حاول أحيانًا إنشاء سلسلة SMILES يدويًا باستخدام معلوماته الكيميائية الداخلية، أو رفض استخدام الأداة تمامًا. ونتيجةً لذلك، كان لدى Claude-3.5-haiku أقل متوسط لعدد استدعاءات الأداة لكل جزيء بين النماذج الثلاثة في هذه المهمة. تمكن GPT-4o-mini من إكمال التجربة بدقة وتوليد الإجابة الصحيحة. تمكن Qwen-2.5-14B عمومًا من توليد استدعاءات دقيقة للأداة، بما في ذلك أسماء الأدوات والمعلمات الصحيحة؛ ومع ذلك، فقد حدثت أخطاؤه بشكل رئيسي أثناء استخراج النتائج من مخرجات الأداة.

يخرج مهام name2xyz و name2opt و name2vibوسط—الشرط هو أن تقوم نماذج اللغة الكبيرة ليس فقط باستدعاء الأدوات بدقة، بل أيضاً بتوليد نتائج إخراج صحيحة ومنظمة. وقد حقق كل من GPT-40-mini وClaude-3.5-haiku أداءً جيداً في هذا الصدد، حيث تجاوزت دقتهما 83%.

يخرج مهمة تحويل smi2xyz إلى smi2fileوسطحافظت كل من Claude-3.5-haiku و GPT-4o-mini على أداء قوي ومستقر، حيث حقق كلاهما دقة تزيد عن 83%؛ كما أظهر Qwen-2.5-14B أداءً محسّنًا في هذه المجموعة من المهام، مع حد أدنى من الدقة يبلغ 77%.

يخرج react2enthalpy و react2gibbs مهمةوسط— كان أداء Qwen-2.5-14B هو الأضعف، بدقة أقل من 20%؛ حقق GPT-4o-mini نتائج متوسطة، بدقة 40% و49% على التوالي؛ تفوق Claude-3.5-haiku على نماذج اللغة الكبيرة الأخرى صغيرة الحجم، محققًا دقة 67% و69% على التوالي؛ حقق GPT-4o أعلى أداء، بمتوسط دقة يتجاوز 83% في كلتا المهمتين.

التقييم متعدد العوامل

قام الباحثون كذلك بتقييم أداء ChemGraph متعدد العوامل باستخدام GPT-4o-mini و Claude-3.5-haiku و Qwen-2.5-14B و GPT-4o (انظر الشكل أدناه) وقارنوا النتائج بأداء العامل الواحد.

*متوسط دقة برنامج ChemGraph في مهام react2enthalpy و react2gibbs عند استخدام نماذج لغوية كبيرة مختلفة*

وتظهر النتائج أنتعمل أنظمة الوكلاء المتعددين على تحسين دقة النماذج المختلفة بشكل كبير.في مهمة react2enthalpy، حسّن GPT-4o-mini دقته من 401 TP3T إلى 871 TP3T، كما حسّن Claude-3.5-haiku دقته من 671 TP3T إلى 871 TP3T، وكلا النتيجتين هما متوسط ثلاث تجارب مستقلة. والجدير بالذكر أن كلا النموذجين تفوقا على الأداء الأساسي لـ GPT-4o أحادي العامل البالغ 831 TP3T. ولوحظ اتجاه مماثل في المهمة الأخيرة، react2gibbs: حيث تحسّنت دقة GPT-4o-mini من 491 TP3T إلى 871 TP3T، وتحسّن أداء Claude-3.5-haiku من 691 TP3T إلى 931 TP3T. في المقابل، لم يحقق Qwen-2.5-14B سوى تحسّن محدود، ويعود ذلك أساسًا إلى أخطاء استدعاء الأدوات المتكررة، مما حدّ من قدرة العامل المُجمّع على توليد إجابات دقيقة.

في النهاية، في وضع الوكلاء المتعددين، حقق GPT-4o دقة مثالية، حيث أكمل مهمتين (react2enthalpy و react2gibbs) بمعدل نجاح 100%.

الكلمات الأخيرة

يُظهر نظام ChemGraph، وهو نظام ذكي قائم على نموذج لغوي ضخم مُصمم خصيصًا للكيمياء الحاسوبية وعلوم المواد، إمكانات الذكاء الاصطناعي في أتمتة سير العمل البحثي العلمي. وأوضح فريق البحث أنهم سيعملون على توسيع نطاق تطبيقات ChemGraph لتشمل مهام المحاكاة واسعة النطاق، وذلك من خلال دمج المزيد من الأدوات، وتحسين بنية النظام، وتعزيز دعم الحوسبة عالية الأداء. وفي الوقت نفسه، يستخدم النظام حاويات Docker لضمان أمان التشغيل، ويعمل باستمرار على تحسين موثوقية النظام.

من المهم الإشارة إلى أن برنامج ChemGraph ليس بديلاً عن برامج الكيمياء الحاسوبية التقليدية، بل هو بمثابة طبقة تعاون ذكية تربط الباحثين بأدوات المحاكاة من خلال التفاعل باللغة الطبيعية. ومع تطوير نماذج مفتوحة المصدر واسعة النطاق، يُتوقع أن يُسهم ChemGraph في خفض تكلفة تطبيقات أبحاث الذكاء الاصطناعي، وتمكين الأنظمة العلمية الذكية من لعب دور أكبر في مجالات مثل اكتشاف المواد وتصميم الجزيئات.

مراجع:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9