HyperAIHyperAI

Command Palette

Search for a command to run...

AIエージェントDB状態検証ベンチ「ThinkingBox」公開

マイクロソフトとHugging FaceはAIエージェントの信頼性を評価する新ベンチマーク「ThinkingBox-Bench」を公開した。従来の生成テキストの妥当性やツール呼出の構文検証に加え、バックエンドデータベースの最終状態とシステムへの副作用を直接格付けする点が最大の特徴である。評価方式は各タスクを同一の初期状態から20回反復実行し、一貫性と再現性を厳密に測定する形式を取る。 507のステートフルなビジネスワークフローを対象としたテストでは、最先端プロプライエタリモデルの単発成功率は概ね60%台にとどまった。Kimi-K3は約94%のタスクを一度は解決する広範な対応力を示したが、20回全成功率は13%程度に留まり再現性の低さが顕著となった。一方、Claude Opus 5.5とGPT-5.4は単発精度と反復成功率のバランスで上位に位置し、実務投入可能な基準値を提示した。 コスト効率の分析では、単発成功あたりの推定コストが最も安かったモデルほど、20回全成功する信頼可能なタスクあたりのコストが急増する結果となった。これは低コストモデルほど状態更新のエラーに弱く、安定運用には反復検証コストの割り当てが不可欠であることを示している。失敗原因の詳細分析では、約8割が推論欠陥ではなく、ツールエラーの recovery や予期せぬ状態変更などの操作処理に起因していたことが確認された。 本ベンチマークはHugging FaceとOpenEnv上でオープンソース公開され、MITライセンスおよびCDLAライセンスのもと評価フレームワークが提供されている。マイクロソフトCopilot Studioチーム主導で開発されたこの環境は、エンタープライズ用途におけるAIエージェントの実際の動作検証を促進し、単なる生成精度の競争から「状態管理と一貫性」を重視する評価基準への転換を推進している。

関連リンク