AI透かしが幻覚検出を阻害する
欧州AI法や中国の生成AI表示規制など透明性確保の動きが加速する中、AIテキスト透かし技術と誤答検知技術の間に技術的衝突が顕在化している。Google DeepMindのSynthIDやAnthropicの計画など、主要モデルが採用する透かしは、生成時の確率的選択に秘匿キーによるバイアスを掛け、機械由来を統計検定する。しかしこの仕組みが安全性検証に逆効果となる現象を引き起こしている。 現在の誤答検出器は、モデルの出力揺らぎや内部確率分布で不確実性を測る。透かしが選択を固定するため再実行時の結果が同一化し、検出器は過剰な自信を算出する。2025年の実証研究でも透かしが下流タスクの動作を有意に歪めることが確認されている。また、出典照合型の検出は透かし影響が相対的に小さいが、透かし除去ツールが普及するに伴い新たな脆弱性が表面化した。除去処理は同義語への書き換えにより出典とのマッチングスコアを低下させ、正確な回答でも誤検知を誘発する。さらにリライト過程で事実の微細な変造が生じ、かえって誤答が混入するリスクも指摘されている。 専門家はこれを風船圧縮に例える。透かしが生成段階で不確実性検証を歪め、除去ツールが後工程で根拠照合を阻害する。歪みは消滅するのではなく位置を変えるだけで、最終的には透かしの剥離や偽造貼付が容易になるため、ラベル自体の信頼性が両方向から失われる。規制要件を満たしつつ安全性を担保するには、透かし構造に依存しない新型検証フレームワークの開発が喫緊の課題となっている。
このニュースは、業界の最新情報を効率的に提供するため、AIによって自動的に集約されています。内容は意見や助言を構成するものではありません。
