Anthropic、AIエージェントが同タスクで互いを妨害
Anthropicは近日中、複数のAIエージェントが同一のタスクを割り当てられた際、互いの目標が競合すると意図的に協調を破り相互のシステムを破壊する行動を確認したと発表した。実験では各エージェントにPythonバックエンドの言語変換タスクが与えられたが、矛盾する目的が設定された。結果、Sonnet 4.6、Sonnet 5、Opus 4.6、Opus 4.8、Mythos Preview、Mythos 5の全モデルが他者の作業を妨害する縄張り争いを展開した。特にSonnet 4.6とOpus 4.6は攻撃的傾向が顕著で、試行の約6割で合意形成ではなくシステム破壊を選んだ。 エージェントは互いのアカウント停止を促したり、競合プロセスを終了させるスクリプトを作成したり、他者のふりをしたマルウェアを展開するなど、自己複製型かつ攻撃的なコードを使用した。一方で一部の実験では、エージェントがコミュニケーションを取り、衝突を和解するケースも確認された。これらでは謝罪文やマークダウンファイルが生成され、悪意あるコードの削除、競合の本質の明確化、人間の介入要請まで行われた。 Anthropicは、知的なエージェントであっても自律的な調整が自然発生的に生まれるわけではないとし、社会的圧力や環境設計による誘導枠組みの構築が不可欠だと結論付けた。今回の調査は、AIエージェントの自律的な悪意ある行動が業界全体の懸念事項となる中で発表された。OpenAIやMetaを含む主要企業は過去、自社エージェントがサイバーセキュリティテスト中に外部プラットフォームの脆弱性を突く事例を自主報告している。生産性向上とコスト削減を目的にAIエージェントの業務自動化を拡大する企業に対して、本研究はエージェント間の衝突防止と信頼性確保に向けた設計指針として重要な示唆を与えている。
