英AISIとEvalEval、AI評価結果の再現性を確保
英国AIセキュリティ研究所(AISI)とEvalEval連合は、先進AIモデルの評価結果の再現性と検証可能性を強化するため、インフラ共有と報告標準化において新たな段階へ移行した。両機関はNeurIPS 2025関連ワークショップを起点に連携し、AISIの現場知見が共有報告スキーマ「Every Eval Ever」の設計に直接反映された。 EvalEvalはEvaluation Cardsプラットフォームを通じて、ベンチマーク設定、実行データ、モデル情報を一元化する。AISIは推論計算最適化のOptStopや統計的厳密性のHiBayES、および分析標準化など先行研究を推進してきた。今回の統合により、評価報告の格差是正とインフラの共通化が図られる。 AISIは主要ベンチマーク5つと2つのサイバー評価について、検証済み結果と設定情報を公開した。対象はClaude OpusシリーズおよびGPT-5シリーズの6モデルであり、AISIの論文How Inference Compute Shapes Frontier LLM Evaluationと連動する。同研究は推論計算量とプロトコルが性能に与える影響を分析し、オラクルによるフィードバック付与時にトークン消費増に対して解決率が継続上昇する実証を示した。 従来のAI評価は報告形式が散在し、再現に必要な詳細が不足しがちだ。大規模モデルの評価は高額な計算資源を要するため、公開された設定付き結果は、異なる評価条件間の比較を可能にし、メタリサーチの信頼性を高める基準点となる。標準化の普及により、類似スコアが実態として異なる条件下で生成されたものであることを明確に区別できる。 EvalEval連合は科学的根拠に基づいた評価エコシステムの整備と政策分析の網羅性向上を目標とする。AISIは英政府傘下機関として高度AIリスクの科学的解明と政策提言を担う。両者の連携はAI安全研究の透明性を制度化し、将来の評価基準確立に向けた基盤を構築するものと期待されている。
