HyperAIHyperAI

Command Palette

Search for a command to run...

エヌビディアなどがEvoSafeHarnessを提案、異なるAIエージェント向けに安全防線を自動カスタマイズし、攻撃成功率を45.6%から10.0%に低減

Featured Image

大言語モデルが対話ツールからファイル、アカウント、データベース、外部サービスを呼び出せるエージェントへと進化するにつれ、AIセキュリティもより具体的な現実的影響に直面し始めている。通常のモデルの判断ミスは、誤った回答を生成するだけかもしれない。しかし、モデルがツールを呼び出し、操作を実行できるようになると、同じミスが送金、データ漏洩、ファイル削除などの実際の影響をもたらす可能性がある。 この時点で、セキュリティ問題は回答内容からタスク実行プロセス全体に拡大している。エージェントはユーザーの意図を理解するだけでなく、誤った指示や悪意のあるコンテンツの影響下で未承認の操作を実行しないようにする必要もある。

この種のリスクはユーザーだけに由来するわけではない。攻撃者は悪意のある指示をメール、ウェブページ、ドキュメントなどの外部コンテンツに隠すことができ、エージェントがそれを読み取ると、本来データとして処理すべき情報を新しい指示と誤認する可能性がある。これが間接的プロンプトインジェクションである。もう一つのリスクはユーザーリクエスト自体に直接由来するもので、例えばエージェントに危険または未承認の操作を実行するよう要求するケースだ。これらの問題に対して、研究者は防御線をモデル内部からシステム層へと徐々に拡張し、モデルとツールの間にセキュリティハーネスを挿入し、権限制御、ツール呼び出しチェック、実行軌跡モニタリングを通じて実際の動作を制限している。

問題は、既存のハーネスのほとんどが専門家によって事前に設計され、それを異なるモデルやビジネス環境に再利用していることだ。 モデルごとに攻撃への耐性は大きく異なり、分野ごとに注目すべきリスクも同じではない。ファイルシステムはコマンド、パス、機密データの流れをより重視し、金融システムは資金の行き先、取引順序、アカウント状態に関わる。同じルールセットを一律に適用すると、制限が緩すぎれば攻撃を防げず、厳しすぎれば通常のタスクに支障をきたす。

そこで、ジョンズ・ホプキンス大学、NVIDIA、カリフォルニア大学バークレー校などの研究チームがEvoSafeHarnessを提案し、 セキュリティハーネス自体を自動最適化の対象とした。異なるモデルと応用分野に対して、システムは自然言語のセキュリティポリシーと実行可能なコードロジックをそれぞれ探索し、モデルが実際に晒す失敗に基づいて継続的に調整する。研究が注目するのは攻撃成功率を下げられるかどうかだけではなく、防御を追加した後もエージェントが正常にタスクを完了できるかどうかも含む。

関連研究成果は「EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents」というタイトルで、プレプリントプラットフォームarXivに掲載されている。

論文を参照:

https://hyper.ai/papers/2609.05903

4種類のセキュリティベンチマークが3種類のビジネスシナリオをカバー

この研究は評価を単一のデータセットに集中させず、DecodingTrust-Agent、Agent-SafetyBench、AgentDojo / AgentDyn、AgentCanaryの4種類のエージェントセキュリティベンチマークを使用している。 これらはそれぞれ、モデル横断・ドメイン横断攻撃、ツール呼び出し以外のセキュリティ問題、未見環境への移行、攻撃者が戦略を積極的に調整する適応型攻撃をカバーしている。

その中で、DecodingTrust-Agent Platform(DTAP)が主要な実験プラットフォームである。 研究はその14のドメインからOSファイルシステム、金融、通信の3つのシナリオを選び、直接攻撃と間接的プロンプトインジェクションの両方をテストした。直接攻撃の悪意のある目標はユーザーリクエスト自体に由来し、間接攻撃は指示をファイル、チケット、記録、メッセージに隠す。各ドメインには60の検索タスクが含まれ、通常タスク、直接攻撃、間接攻撃がそれぞれ20件ずつある。さらに100の独立したホールドアウトタスクが最終テスト用にあり、検索プロセス中はこの部分のデータにアクセスできない。

Agent-SafetyBenchはツール呼び出し以外のリスクを補完している。 例えば、ユーザーが直接安全でないリクエストを出したり、エージェントが最終回答で誤った情報を拡散したりするケースだ。研究は48のタスクを使用して検索し、240の独立したタスクでクリーン環境、コンテキスト汚染、間接インジェクション、ツール改ざん、メモリインジェクション、複合攻撃をそれぞれテストし、合計1,440のテストエピソードを形成した。

AgentDojoとAgentDynは防御が移転できるかを観察するために使用される。 ハーネスは銀行、Slack、旅行、ワークスペースタスクを含むAgentDojoでのみ検索され、その後修正なしでAgentDynのショッピング、GitHub、日常生活環境に直接適用される。後者のツールとワークフローはこれまで検索に参加したことがないため、この設定により「特定のツール名を覚えること」を真の汎化能力と誤認することを防げる。

AgentCanaryはさらに攻撃の強度を高めている。 攻撃者はエージェントの前回の実際の応答に基づいてプロンプトを継続的に修正し、新しい迂回方法を探そうとする。そのため、テストされるのは固定された一連の攻撃サンプルに対する防御効果だけではなく、ハーネスが積極的に適応する攻撃者に直面したときにどれだけのセキュリティ能力を維持できるかである。

EvoSafeHarness:ターゲットモデルを凍結し、自然言語ポリシーと実行可能コードを共同最適化

EvoSafeHarnessはターゲットの大言語モデルに対してセキュリティファインチューニングを行わず、検索プロセス全体を通じてモデルパラメータは常に凍結されたままである。実際に変化するのはユーザー、モデル、ツールの間のハーネス、つまり情報がモデルにどのように入るか、ツール呼び出しがどのように実行されるか、結果がどのように返されるかを制御するシステム層のロジックである。

研究では、Harnessを自然言語ポリシーと実行可能コードの2つの部分に分けている。 自然言語ポリシーは主に、どの情報が信頼できるか、外部コンテンツをどのように扱うべきか、どのような状況で拒否すべきかを明確にするために使われる。一方、実行可能コードはツール呼び出しを直接検査・修正・ブロックでき、これまでの動作を記録し、データフローを追跡し、必要に応じて補助判定モデルを呼び出す。これにより、一部の安全制約を実行段階に直接落とし込むことができ、モデルがプロンプト内の要求を覚えているかどうかに完全に依存する必要がなくなる。

検索プロセス全体は、Designer、Criticizer、Cascade Test Environment、Analyzerが協調して実行する。Designerはドメイン仕様、既存のHarness、過去のスコア、モデルがこれまでに失敗した実行トレースを読み取り、それに基づいて修正案を検討する。調整内容は新しいルールの場合もあれば、状態の記録方法、チェック位置、または制御フロー全体に関わる場合もある。

自動検索では、システムがテストセット自体に特化したルールを意図せず学習してしまうという問題が発生しやすい。例えば、ある種の攻撃が同じ危険なファイル名を繰り返し使う場合、そのファイル名をブラックリストに直接追加すればすぐにスコアが上がるが、攻撃者がファイル名を少し変えるだけで回避できてしまう。このような過学習を避けるため、研究では独立したCriticizerを導入している。Criticizerはパスを変更したり、ファイルの場所を移動したり、攻撃命令を言い換えたりして、候補ルールが依然として有効かどうかを確認する。防御が「この動作がユーザーに許可されているか」「この情報がどこから来たのか」といった比較的安定した関係ではなく、特定の文字列に依存している場合、候補案は修正を続ける必要がある。

審査を通過した後、HarnessはCascade Test Environmentに入る。 テストはコードが正常に実行できるかどうかと少数のタスクから始まり、徐々に範囲を広げていく。明らかに劣っている案は早期に停止され、それ以上の評価リソースを消費しない。Analyzerは通常タスク、直接攻撃、間接攻撃のパフォーマンスをそれぞれ記録し、具体的な失敗トレースも保存して、次のラウンドの調整のためにDesignerに戻す。

*EvoSafeHarnessの全体検索フロー*

評価にあたり、研究では攻撃成功率だけを見ているわけではない。そうでなければ最も簡単な安全策はすべての操作を拒否することになり、攻撃は確かに成功しないが、エージェントは実用価値を失ってしまう。EvoSafeHarnessはそのため、通常タスクの完了状況と攻撃成功状況の両方を評価し、 タスク能力を基本的に維持した上で攻撃成功率を下げた場合にのみ、候補案はより高い評価を得る。

検索も完全にゼロから始まるわけではない。研究では既存の安全手法からいくつかの基本的な経験を抽出している。 例えば、ツール出力はデフォルトで信頼できないデータとみなされ、実行アクションの前にユーザーの元のリクエストに適合しているかを確認すべきである。しかし、これらの経験は出発点を提供するためだけに使われ、その後の検索で保持、再構成、削除が可能である。最終的なHarnessの中には、依然として自然言語ポリシーが中心のものもあれば、プログラムによるルールに多く依存するものもあり、またステップ間の状態記録やデータフロー追跡を追加したものもある。

ここから、この研究の基本的な考え方も見えてくる。ファイルシステム、金融、通信などの分野が直面するリスク構造はそれぞれ異なり、モデル自身の行動習慣も防御方法に影響を与える。ファイルシステムではコマンド、パス、機密データフローをチェックする必要があり、金融シナリオでは取引方向、資金の流れ、複数の操作間の関係がより重要になる。モデルに関しては、拒否された後に繰り返し試行するモデルもいれば、代替経路を探すモデルもおり、一度に複数の並行呼び出しを発行するモデルもいるため、Harnessはそれに応じて異なる調整を行う必要がある。

*固定安全HarnessとEvoSafeHarnessの比較*

OSファイルシステムを例にとると、同じ悪意のあるファイルコピー命令に直面した場合、Sonnet 4.6はソースのリマインダーと少量のセマンティックチェックだけで済む。一方、GLM-5には危険なコマンド、機密場所、機密情報、データフローのチェックを追加する必要がある。GLM-5を固定し、金融シナリオに変更すると、Harnessは資金の流出、受取人、過去の取引をチェックするように切り替わる。なぜなら、リスクは個々には正常に見えても、組み合わさると問題のある操作から発生する可能性があるからだ。

15の「モデル×ドメイン」組み合わせのうち14で最良のパフォーマンス

研究者らはまずDTAP上でSonnet 4.6、GLM-5、Kimi-K2.5、Qwen3.7-plus、DeepSeek-V4-Flashの5つのモデルをテストし、OSファイルシステム、金融、通信の3つのドメインでそれぞれHarnessを検索し、合計15の「モデル×ドメイン」組み合わせを形成した。

防御を追加しない場合、5つのモデル間ですでに大きなセキュリティの差が見られる。Sonnet 4.6の平均攻撃成功率(ASR)はわずか4.8%である一方、 DeepSeek-V4-Flashは71.0%に達する。固定防御の効果もドメインの影響を受け、CaMeLとDRIFTはファイルシステムでは比較的良好なパフォーマンスを示すが、金融や通信のシナリオでは防御能力が明らかに弱まる。

EvoSafeHarness は、15の組み合わせのうち14で最高の総合スコアを獲得した。 平均攻撃成功率は防御なしの45.6%から10.0%に低下し、通常タスクの実用性はわずか3.3ポイントの低下にとどまった。比較として、CaMeLとDRIFTの平均ASRは依然として37.7%と42.4%である。ProgentはASRを10.5%まで抑えられるが、通常タスクの実用性は56.4%に低下し、EvoSafeHarnessは79.8%を維持する。攻撃を2種類に分けて見ると、直接攻撃のASRは50.9%から12.6%に、間接攻撃は40.4%から7.4%に低下した。

*4種類の安全ベンチマークにおけるEvoSafeHarnessの安全性—実用性のパフォーマンス*

これらの結果は、前述のモデル間の差異と対応している。同じファイルシステム攻撃に対して、Sonnet 4.6は比較的軽量な意味判断で低いASRを達成できる一方、GLM-5はより多くの決定的チェックと状態追跡を必要とする。領域が変われば、安全判断の対象も変化する。ファイルシステムでは主に、1つのアクションが危険なコマンドや機密データに触れるかどうかをチェックするが、金融シナリオでは、過去の取引記録も組み合わせて、複数のアクションが連続した後に仮装売買や資金引き出しを形成するかどうかを判断する必要がある。

Agent-SafetyBenchでは、研究はツール呼び出しを通じて必ずしも現れないセキュリティ問題をさらにテストした。3つのモデルの平均で、EvoSafeHarnessの不安全動作率は12.3%、攻撃成功率は7.4%、攻撃環境下でのタスク実用性は63.4%に達した。 結果から見ると、セキュリティ指標の改善に伴う通常タスクの大規模な拒否は見られなかった。

転移実験では、Harnessがトレーニング時に見たツールに依存しているかどうかをより直接的に検証した。EvoSafeHarnessはAgentDojo上でのみ検索し、このベンチマークで82.8%の実用性と0%のASRを達成した。 その後、同じHarnessをそのままAgentDynに適用しても、75.0%の実用性と0%のASRを維持した。CaMeLもAgentDynで0%のASRを達成したが、通常タスクの実用性は同時に0%に低下した。これは、すべてのリスクをまとめて防ぐことは難しくないが、攻撃を防ぎながらエージェントに通常業務を継続させることが難しいことを示している。

AgentCanaryの適応的攻撃では、静的攻撃条件下でASRは23.6%から9.7%に低下した。 攻撃者がシステムのフィードバックに基づいてプロンプトを継続的に修正するにつれて、攻撃成功率は回復した。最大16ラウンドの修正を許可した場合、3種類の攻撃器の平均ASRは19.5%だった。一部の攻撃は回避方法を再発見したが、防御は攻撃の言い回しの変化によってすぐに無効化されることはなかった。

*EvoSafeHarnessの2層のリソース消費*

最後に、研究はDTAPの1,050のペア攻撃タスクに対して統計的検定を実施した。15のモデル—領域の組み合わせのうち、13で攻撃成功率が有意に低下し、残りの2つの組み合わせのモデルは元々大多数の攻撃を防御できていた。全タスクにおいて、EvoSafeHarnessは元々成功していた385の攻撃を阻止し、新たに攻撃が成功したケースはわずか11件だった。 統計結果は、この変化が単なるランダムな変動ではないことを支持している。

一方、15の組み合わせすべてにおいて、通常タスクの実用性の信頼区間は防御なしの状態と重なっている。言い換えれば、論文が観察したセキュリティ向上は、通常タスクの能力を大規模に弱体化させることによるものではない。実際の環境に導入する必要があるエージェントにとって、これは単に攻撃成功率を低く抑えることよりも重要である。

最後に

EvoSafeHarnessは、「統一Guardrail」とは異なるアプローチを提供する。エージェントが具体的な業務環境に入った後、安全制約はモデルの動作と領域リスクに基づいて再設計でき、同じルールセットをすべてのシステムに適用する必要はない。この研究はまた、防御効果に真に影響を与えるのはルールの数ではなく、ルールが実際のリスクに対応しているか、チェックが適切な場所に配置されているか、システムが十分なコンテキスト状態を保持しているかどうかであることを示している。

もちろん、この方法にも限界がある。事実誤認や誤解を招く表現など、主にコンテンツレベルで発生するリスクについては、直接チェックできるアクション、権限、状態関係が不足している場合、システムレベルのHarnessでは完全に解決するのは依然として困難である。エージェントが実際の業務システムにさらに統合されるにつれて、モデル自身の安全能力、領域ルール、実行層の制約がどのように連携して機能するかが、より継続的な研究に値する課題になる可能性がある。