HyperAIHyperAI

Command Palette

Search for a command to run...

Gemini 3.1 Proの実力解剖:トップクラスの推論性能と安全対策の現状

Googleの最新モデル「Gemini 3.1 Pro」の性能と安全性に関する詳細な評価が公開された。このモデルは、高レベルの思考能力(Thinking High)を備え、複数のベンチマークで顕著な成果を示している。特に「Humanity's Last Exam」の学術的推論テスト(テキスト+マルチモーダル)では44.4%の正解率を達成し、GPT-5.2やOpus 4.6を上回る性能を発揮。科学知識テスト「GPQA Diamond」では94.3%と、AIモデルの中でもトップクラスの正確性を示した。コード生成能力においても、SWE-Bench Verifiedで80.6%の正解率を記録し、GPT-5.3-Codexと同等以上の実力を確認。また、長文処理能力(128kトークン)では84.9%の正確性を維持しており、長文理解の信頼性も高い。 マルチモーダル能力においてはMMMU-Pro(80.5%)やMMMLU(92.6%)で優れた性能を発揮。さらに、複数ステップの作業を自動で遂行する能力(MCP Atlas)や、ウェブ検索とコード実行を組み合わせたタスク(BrowseComp)でも、他モデルを上回る結果を示している。一方で、一部のベンチマークではGPT-5.2やCodexに及ばない結果も見られ、特に競技プログラミング(LiveCodeBench Pro)では2887のEloレートにとどまるなど、専門的タスクではまだ差が顕著に残っている。 安全性面では、Gemini 3.1 Proは前バージョンと比較して、テキスト安全性と多言語安全性でわずかな向上を示した。ただし、画像からテキスト生成時の安全性は0.33%低下。また、人間の意図に反して拒否するケース( unjustified-refusals)は減少傾向にある。前線安全フレームワーク(Frontier Safety Framework)による評価では、CBRN、有害な操作、機械学習研究開発、ミスアライメントの4つのCCL(Critical Capability Level)はいずれも「警戒レベルに達していない」と判定された。特にサイバー攻撃能力についても、Deep Thinkモードを含めてもCCLに到達せず、引き続き対策を実施している。 総合的に、Gemini 3.1 Proは性能と安全性のバランスに優れ、特に学術的推論とマルチモーダル処理で強みを発揮しているが、極限のコード生成や高度な自律的タスクではまだGPT-5系モデルに差をつけていない。Googleは今後も能力の向上と、リスク管理の強化を継続する方針である。

関連リンク

Gemini 3.1 Proの実力解剖:トップクラスの推論性能と安全対策の現状 | 人気の記事 | HyperAI超神経