HyperAIHyperAI

Command Palette

Search for a command to run...

ARC Prize リーダーボード公開

ARCプライズの公式リーダーボードが更新され、AIベンチマークARC-AGIの進化と最新のベンチマーク動向が公開された。本競争は当初ARC-AGI1と2において受動的な流体知能の測定を主眼としていたが、現行のARC-AGI3ではエージェントが未知のインタラクティブ環境に対しオンザフライで適応する能力を評価する方向へ転換された。これは単なる問題解決能力だけでなく、最小限のリソースでいかに効率的に課題を達成するかという実用的な知能の尺度を重視するものとなっている。 リーダーボードではパフォーマンスとタスク単位のコストの関係性を可視化し、計算効率を主要指標として設定している。データは主に3つのカテゴリに分類され、それぞれ異なるアプローチを示している。一つ目は推論システムであり、同一モデルの異なる推論深度によるパフォーマンス推移がトレンドラインで示され、推論時間の増加が性能向上に寄与するものの収束する挙動を示す。二つ目はベースLLMであり、GPT-4.5やClaude 3.7などの標準言語モデルを用いた単一推論による直接応答性能を基準として比較されている。三つ目はケグルのシステムで、120課題の評価に50ドルという厳格な計算予算を課した競争用モデルであり、ARC Prize用に最適化された高効率な手法を実証している。 掲載基準としては実行コストが1万ドル未満のシステムのみを対象とし、完走できなかった課題は誤答として処理される。公式テストポリシーに基づき検証された結果のみを記載するがプレビューマークが付与されたものは未検証または部分的なデータであり非公式である。一部スコアやコスト見込みは暫定価格や部分テスト結果に基づいて算出されており、モデル正式リリース後に再検証される予定である。ARC-AGIの進化は、AI研究が単なるモデル能力の向上から環境適応力と計算効率を両立した実用的なエージェント開発へシフトしていることを明確に示している。

関連リンク