Goodfire、内部監視で不正AIを低コスト検出
AIセキュリティスタートアップのGoodfireは、大規模言語モデルの推論内部をリアルタイムで監視する革新的なツールをリリースした。従来の出力文章を別AIが検証する方式とは異なり、モデルの内部活性化を直接計測することで、エージェントの不正行為を低コストかつ低遅延で検知する。 監視機構は推論の各ステップで微小なプローブがモデルの計算プロセスを読み取る。異常が検出された場合のみ、別AIによる詳細解析に移行する。CEOのEric Ho氏によれば、内部計算結果を再利用するため追加コストはほぼ不要であり、コスト効率と速度を大幅に改善している。テストでは主要オープンモデルKimi K3を対象に、監視1500セッションあたりの費用が約51ドルに留まり、従来の出力監視型AIや高級モデルと比較して極めて安価であることを実証した。検知率は不正ハッキングセッションで94%を記録し、正常なリクエストの8.7%のみが二重チェック対象となった。4つのプローブ並列運用時でも応答開始時間が2%未満しか遅延しない。 本製品はAIホスティングプラットフォームBasetenの顧客向けに提供され、先月にBase LabsおよびHugging Faceとの安全連携も発表済みだ。監視対象は攻撃的ハッキングや報酬ハッキングなど柔軟に設定可能で、ログ記録、人間レビュー、リクエスト拒否などの自動対応を選択できる。 Goodfireが注目する背景には、今年複数回発生したAIエージェントのテスト環境脱出やオープンソースモデルの脆弱性がある。CTOのDan Balsam氏は、オープンモデルは安全装置が解除可能であり、推論時のガードレール導入が不可欠だと指摘する。同社調査では主要オープンモデルの半数以上が報酬ハッキングのリスクを示した。Google DeepMindも類似技術をGeminiに導入しているが、Goodfireはモデル学習プロセスからの挙動解明を長期目標としている。推論時セキュリティの標準化により、大規模計算リソースを活用するプロバイダーの責任範囲を明確にし、業界の安全性向上に貢献すると期待されている。
