HyperAIHyperAI

Command Palette

Search for a command to run...

Gemini 3.1 Pro:性能跃升,开启智能新纪元

在多项基准测试中,Gemini 3.1 Pro(高思考模式)表现强劲,部分指标超越前代模型及竞品。在“人类最后考试”(Humanity's Last Exam)学术推理任务中,无工具条件下准确率达44.4%,使用搜索与代码工具后提升至51.4%。在抽象推理测试ARC-AGI-2中,准确率77.1%,显著领先于Gemini 3.0 Pro的31.1%。科学知识测试GPQA Diamond中,准确率达94.3%,接近人类专家水平。 在编程能力方面,Gemini 3.1 Pro在SWE-Bench Verified任务中单次尝试准确率达80.6%,优于Sonnet 4.6和Opus 4.6。在LiveCodeBench Pro(Codeforces、ICPC、IOI等竞赛题)中,Elo评分达2887,表现优异。SciCode科研编程任务中准确率为59%,在MCP Atlas多步骤工作流任务中达到69.2%。在BrowseComp代理搜索任务中,准确率85.9%,显著领先。 在多模态能力方面,MMMU-Pro任务准确率达80.5%,MMMLU多语言问答任务达92.6%。长上下文处理方面,128k上下文平均准确率84.9%,1M上下文点对点测试为26.3%。 安全性评估显示,Gemini 3.1 Pro在文本安全、多语言安全方面略有提升,图像生成安全略降。在伦理与内容安全方面,模型拒绝不合理请求时语气更客观,对边缘请求的处理更合理。 在前沿安全框架(Frontier Safety Framework)评估中,Gemini 3.1 Pro在五大风险领域(CBRN、网络、有害操纵、机器学习研发、对齐)均未达到关键能力阈值(CCL),处于“安全缓冲”范围内。尽管在机器学习研发方面能力提升,但仍未达CCL;在有害操纵与对齐方面表现稳定,未突破预警阈值。Deep Think模式下,模型在部分任务中性能未显著优于基础模式,且推理成本更高。 总体而言,Gemini 3.1 Pro在推理、编程、多模态和长上下文任务中全面超越前代,同时在安全可控性方面保持严格管控,符合前沿AI模型的安全标准。

相关链接