HyperAIHyperAI

Command Palette

Search for a command to run...

AIがW杯予想で新ベンチマーク開始

AI評価の新指標として、スタートアップObsideが国際サッカーワールドカップを題材とした実世界予測ベンチマークを実施した。本実験では、ChatGPTやGemini、Claude、Grok、Mistral、DeepSeek、Kimiなどの主流モデルを対象に、予測プラットフォームPolymarketのライブオッズを用いて架空の1万ドルを賭ける形式を採用した。各モデルは試合開始1時間前にエージェントモードを起動し、チーム情報や怪我の状況などの公開データを統合解析した上で、最適と判断する賭け金額を自動決定する仕組みである。 準決勝終了時点の集計では、オープンソース系のMistralが首位に立ち、OpenAIのGPT-5.5とDeepSeek V4がこれに続いた。一方、AnthropicのClaude Opusは唯一の赤字モデルとして最下位に留まった。この結果は、従来のベンチマークでは測定が困難な不確実性下の意思決定能力と、公開情報の収集から経済的予測への転換能力を明確に浮き彫りにしている。モデルごとのリスク許容度や判断ロジックの違いが如実に示された同実験は、生成AIの実務適用におけるリサーチと予測精度の評価手法として、業界から注目を集めている。

関連リンク