HyperAIHyperAI

Command Palette

Search for a command to run...

ナノGPTで18フロンティアAIの速度比較

技術ベンチマークプラットフォームModelHarnessは、先進AIモデルを対象とした自律型最適化評価nanoGPT Speedrun Frontierの結果を発表した。同ベンチマークでは、18社の最先端言語モデルに対し合計153回の自動実行テストを実施し、コード生成能力と自律的な問題解決効率を定量的に比較した。 評価結果は性能面で明確な階層構造を示している。AnthropicのOpus 5やSonnet 5、OpenAIのGPT5.6シリーズ、DeepSeekのV4 Pro、Qwenの3.8 Maxなどが対象となった。総合スコアではFable 5が約2920点、実行成功率約81.7%で首位に立った。続くOpus 5も約2920点、成功率53.6%で競合する。上位モデルは推論に約800Mから3,000Mトークンを要し、高度な思考プロセスと複数ツールの連携を安定して実行できる特性を持つ。 一方、スコアが3,100点を超えると処理能力の低下が顕著になる。多くのモデルは成功率が20%から10%台に急落し、完了コストも26Mから41Mトークンに削減される傾向にある。これはモデルの規模や価格帯が高いほど自律コーディングに優れるという単純な正比例関係ではなく、推論アーキテクチャやツール利用の最適化度が成否を分けることを示唆している。 ModelHarnessは評価プロセスで記録された41件の完全なエージェント履歴を公開している。これにはサブエージェントの分業構造、外部ツールの呼び出し順序、中間計算のスクラッチパッドが含まれており、開発者はモデルの判断ロジックを詳細に検証可能だ。同プラットフォームは自律型AIの開発効率と信頼性を測定する標準指標として活用が拡大しており、今後は継続的なモデル更新と動的ベンチマークの採用により、AIエンジニアリングのパイプライン最適化基準をさらに精緻化していく予定だ。

関連リンク