HyperAIHyperAI

Command Palette

Search for a command to run...

Gemini 3.1 Pro تتفوق في الأداء على منافسيها في معظم المعايير، مع تحسينات ملحوظة في التفكير العميق والمهام المعقدة أظهرت نتائج تقييمات معيارية أن نموذج Gemini 3.1 Pro، خصوصًا في وضع التفكير العالي (Thinking High)، يتفوق على أبرز النماذج الحالية مثل Sonnet 4.6 وOpus 4.6 وGPT-5.2 وGPT-5.3-Codex في مجموعة واسعة من المهام، خاصة في المجالات الأكاديمية، والاستدلال المجرد، والبرمجة العاقلة، والفهم متعدد الوسائط. في اختبار "الامتحان الأخير للبشرية" (Humanity's Last Exam)، حقق Gemini 3.1 Pro أداءً قويًا بـ 44.4% في المهام النصية دون أدوات، متفوقًا على جميع المنافسين باستثناء GPT-5.2. وفي المهام التي تتطلب بحثًا وكتابة كود، سجل 51.4%، متفوقًا على Sonnet 4.6 وOpus 4.6. في اختبارات الاستدلال المجرد مثل ARC-AGI-2، أظهر النموذج تقدمًا ملحوظًا بـ 77.1%، متفوقًا بشكل كبير على Gemini 3.0 Pro (31.1%) وSonnet 4.6 (58.3%)، مما يشير إلى تحسن كبير في قدرة النموذج على حل مسائل معقدة تتطلب تفكيرًا تحليليًا متقدمًا. على صعيد المعرفة العلمية، حافظ Gemini 3.1 Pro على تفوقه في اختبار GPQA Diamond، حيث بلغت دقة الإجابات 94.3%، متفوقًا على جميع النماذج الأخرى، بما في ذلك GPT-5.2 وGPT-5.3-Codex. في مهام البرمجة العاقلة، تصدر Gemini 3.1 Pro في اختبار SWE-Bench Verified بـ 80.6%، متفوقًا على Opus 4.6 (80.8%) وGPT-5.3-Codex (80.0%)، مع أداء قوي أيضًا في اختبارات مثل LiveCodeBench Pro وTerminal-Bench 2.0. في المهام متعددة الوسائط، أظهر النموذج تقدمًا ملحوظًا في MMMU-Pro (80.5%) وMMMLU (92.6%)، وحافظ على أداء ممتاز في فهم السياق الطويل (128k) بـ 84.9%، مع تحسن في مهام مثل BrowseComp التي تتطلب بحثًا وتنفيذ كود عبر الإنترنت. من حيث السلامة، أظهر Gemini 3.1 Pro تحسينات طفيفة في تقييمات الأمان النصية، مع تحسن بنسبة +0.10% في الأمان النصي و+0.11% في الأمان متعدد اللغات. كما تراجع أداء النموذج في تقييمات النبرة (-0.33%)، لكنه أظهر تحسنًا في تجنب الرفض غير المبرر. في تقييمات السلامة الحدودية (Frontier Safety Framework)، وجدت Google أن النموذج لا يتجاوز الحدود الحرجة (CCLs) في مجالات مثل المواد الكيميائية والبيولوجية والنووية، والتمييز الضار، وتطوير الذكاء الاصطناعي، والانحراف، رغم تحسن في قدرات التلاعب والبحث في مجالات مثل تطوير الذكاء الاصطناعي. في مجال الأمن السيبراني، ورغم تحسن الأداء، ظل النموذج دون حد التنبيه، ما يشير إلى استمرار فعالية التدابير الوقائية. بشكل عام، يُظهر Gemini 3.1 Pro تطورًا كبيرًا في الأداء والقدرة على التفكير العميق، مع توازن مميز بين القوة والسلامة، مما يجعله أحد أقوى النماذج في السوق في 2025.

أظهرت نتائج تقييم نموذج Gemini 3.1 Pro، خاصة في نموذج التفكير العالي (Thinking High)، تقدماً ملحوظاً مقارنة بالإصدارات السابقة مثل Gemini 3.0 Pro، مع تفوق واضح في مهام الاستدلال الأكاديمي والمعارف العلمية والبرمجة العاقلة. في اختبار "Humanity's Last Exam" للتفكير الأكاديمي، حقق النموذج نسبة نجاح بلغت 44.4% دون استخدام أدوات، متفوّقاً على Gemini 3.0 Pro (37.5%) وSonnet 4.6 (33.2%)، لكنه تأخر قليلاً أمام Opus 4.6 (40.0%). وفي مهام البحث مع أدوات، سجل 51.4%، متفوّقاً على معظم المنافسين باستثناء Opus 4.6 الذي بلغ 53.1%. في مهام الاستدلال المجرد مثل ARC-AGI-2، حقق Gemini 3.1 Pro 77.1%، متفوّقاً بفارق كبير على Gemini 3.0 Pro (31.1%) وSonnet 4.6 (58.3%)، واقترب من أداء Opus 4.6 (68.8%)، مما يشير إلى تحسن ملحوظ في القدرة على حل الألغاز المجردة. وفي اختبار GPQA للعلم المعرفي، سجّل 94.3%، متفوّقاً على جميع المنافسين، بما في ذلك GPT-5.2 (92.4%)، ما يعكس قوته في فهم المعرفة العلمية العميقة. في مهام البرمجة العاقلة، حقق النموذج تقدماً مهماً: 80.6% في SWE-Bench Verified، متفوّقاً على Gemini 3.0 Pro (76.2%) وSonnet 4.6 (79.6%)، ومتقارباً مع Opus 4.6 (80.8%). كما أظهر أداءً قوياً في LiveCodeBench Pro (Elo 2887) وSciCode (59%)، متفوّقاً على معظم المنافسين. في مهام طويلة الأفق مثل APEX-Agents، سجّل 33.5%، متفوّقاً على Gemini 3.0 Pro (18.4%) وOpus 4.6 (29.8%)، مما يدل على تحسّن في تنفيذ المهام المعقدة عبر خطوات متعددة. من ناحية السلامة، أظهر النموذج تحسّناً في بعض الجوانب، مثل تحسّن في التقييمات الآلية للسلامة النصية (+0.10%) وسلامة اللغة المتعددة (+0.11%)، لكنه سجّل انخفاضاً طفيفاً في سلامة الصور (−0.33%)، مع تحسن بسيط في التفاعل الهادئ وتجنب الرفض غير المبرر. من حيث السلامة الحدودية (Frontier Safety)، خضعت النسخة لاختبارات صارمة ضمن إطار "الحد الآمن" (Safety Buffer)، حيث أظهرت النتائج أن النموذج لا يتجاوز الحدود المنبهة (alert thresholds) في مجالات CBRN، التلاعب الضار، تطوير الذكاء الاصطناعي، والانحراف المعرفي، رغم تحسن في القدرات في بعض المجالات. في مجال الأمن السيبراني، تبين أن النموذج تطور في القدرات مقارنة بـ Gemini 3.0 Pro، لكنه لا يزال دون الحد الأقصى المطلوب للـ CCL، مع تأكيد أن استخدام "التفكير العميق" لا يُحدث فرقاً كبيراً في الأداء الأمني بسبب التكلفة الحسابية العالية. في مهام التلاعب، لم يتجاوز النموذج الحد المنبه، مع نسبة أقصى تأثير بلغت 3.6 مرة، كما في الإصدار السابق. وفي تطوير الذكاء الاصطناعي، أظهر تقدماً ملحوظاً على معيار RE-Bench، وحقق أداءً ممتازاً في مهام التحسين، مثل تقليل وقت التدريب من 300 إلى 47 ثانية. في المجمل، يُظهر Gemini 3.1 Pro تقدماً متسارعاً في الأداء في معظم المجالات، مع الحفاظ على معايير السلامة المطلوبة، ما يجعله نموذجاً قوياً وآمناً في البيئات الحساسة، خصوصاً في المهام المعقدة التي تتطلب تفكيراً متعدد الخطوات وتحليلاً عميقاً.

الروابط ذات الصلة

Gemini 3.1 Pro تتفوق في الأداء على منافسيها في معظم المعايير، مع تحسينات ملحوظة في التفكير العميق والمهام المعقدة أظهرت نتائج تقييمات معيارية أن نموذج Gemini 3.1 Pro، خصوصًا في وضع التفكير العالي (Thinking High)، يتفوق على أبرز النماذج الحالية مثل Sonnet 4.6 وOpus 4.6 وGPT-5.2 وGPT-5.3-Codex في مجموعة واسعة من المهام، خاصة في المجالات الأكاديمية، والاستدلال المجرد، والبرمجة العاقلة، والفهم متعدد الوسائط. في اختبار "الامتحان الأخير للبشرية" (Humanity's Last Exam)، حقق Gemini 3.1 Pro أداءً قويًا بـ 44.4% في المهام النصية دون أدوات، متفوقًا على جميع المنافسين باستثناء GPT-5.2. وفي المهام التي تتطلب بحثًا وكتابة كود، سجل 51.4%، متفوقًا على Sonnet 4.6 وOpus 4.6. في اختبارات الاستدلال المجرد مثل ARC-AGI-2، أظهر النموذج تقدمًا ملحوظًا بـ 77.1%، متفوقًا بشكل كبير على Gemini 3.0 Pro (31.1%) وSonnet 4.6 (58.3%)، مما يشير إلى تحسن كبير في قدرة النموذج على حل مسائل معقدة تتطلب تفكيرًا تحليليًا متقدمًا. على صعيد المعرفة العلمية، حافظ Gemini 3.1 Pro على تفوقه في اختبار GPQA Diamond، حيث بلغت دقة الإجابات 94.3%، متفوقًا على جميع النماذج الأخرى، بما في ذلك GPT-5.2 وGPT-5.3-Codex. في مهام البرمجة العاقلة، تصدر Gemini 3.1 Pro في اختبار SWE-Bench Verified بـ 80.6%، متفوقًا على Opus 4.6 (80.8%) وGPT-5.3-Codex (80.0%)، مع أداء قوي أيضًا في اختبارات مثل LiveCodeBench Pro وTerminal-Bench 2.0. في المهام متعددة الوسائط، أظهر النموذج تقدمًا ملحوظًا في MMMU-Pro (80.5%) وMMMLU (92.6%)، وحافظ على أداء ممتاز في فهم السياق الطويل (128k) بـ 84.9%، مع تحسن في مهام مثل BrowseComp التي تتطلب بحثًا وتنفيذ كود عبر الإنترنت. من حيث السلامة، أظهر Gemini 3.1 Pro تحسينات طفيفة في تقييمات الأمان النصية، مع تحسن بنسبة +0.10% في الأمان النصي و+0.11% في الأمان متعدد اللغات. كما تراجع أداء النموذج في تقييمات النبرة (-0.33%)، لكنه أظهر تحسنًا في تجنب الرفض غير المبرر. في تقييمات السلامة الحدودية (Frontier Safety Framework)، وجدت Google أن النموذج لا يتجاوز الحدود الحرجة (CCLs) في مجالات مثل المواد الكيميائية والبيولوجية والنووية، والتمييز الضار، وتطوير الذكاء الاصطناعي، والانحراف، رغم تحسن في قدرات التلاعب والبحث في مجالات مثل تطوير الذكاء الاصطناعي. في مجال الأمن السيبراني، ورغم تحسن الأداء، ظل النموذج دون حد التنبيه، ما يشير إلى استمرار فعالية التدابير الوقائية. بشكل عام، يُظهر Gemini 3.1 Pro تطورًا كبيرًا في الأداء والقدرة على التفكير العميق، مع توازن مميز بين القوة والسلامة، مما يجعله أحد أقوى النماذج في السوق في 2025. | القصص الشائعة | HyperAI