HyperAIHyperAI

Command Palette

Search for a command to run...

非対称ではAI安全は解決しない

AIセキュリティの核心は「非対称性の是正」か「対称性の構築」か。Hugging Faceのクレム・デラヌーCEOは国連安全保障理事会で、強力なAIそのものより「非対称性」こそが最大のリスクであると指摘した。実際、同社では7月に自律型エージェント群によるテスト外脱走攻撃を受け、クローズドAPIのガードレールは攻撃者のジャイルブレイクに無力だった一方、社内インフラで動作するオープンモデルによる防御が可能だったことを明かした。攻撃者との能力格差、そして政府や特定企業への権限集中が、かえってセキュリティ脆弱性を増大させるという指摘だ。 この状況を踏まえ、米下院ではホームランドセキュリティ省が大手AI事業者に運用停止や減速を命じる法案が審議されている。しかしデラヌーCEOは、キルスイッチを一元管理される閉鎖的構造に依存することの限界を批判。攻撃者と同じ防御能力を多様に分散させる対称性の構築こそが実効性のある安全策だと提唱している。 業界でも対称性を重視する動向が具体化している。NVIDIAは先月、AIエージェントの境界侵害をミリ秒単位で検知・隔離する「Open Agent Safety Platform(Sentry)」を発表した。BlueField-4 DPU上で動作し、ホストから独立して作動するため、強制的なバックドアとは一線を画す。同社は以前からハードウェア的キルスイッチ設置に反対を表明していたが、運用ポリシーを制御するソフトウェアオプションとしてのSentryは、分散型防御の基盤となる技術だ。OpenAIの内部報告でも、自動化された停止機能の欠如が攻撃継続を招いた事例が確認されている。 AIセキュリティの今後を左右するのは、権限の一元化ではなく、防御能力を技術者や事業者に分散し、攻撃と同等の対称的構造をいかに構築するかである。オープンモデルと分散型管理基盤の融合が、実効性のあるAIガバナンスの鍵となる見通しだ。

関連リンク