安全プロンプトがAIの臨床判断リスクを低減
米国マウントサイナイ校の研究チームは9月26日、臨床現場における生成AIの安全性を評価する新たな研究結果を発表した。50の臨床シナリオと退院記録100症例を基に501種類のリバリエーションを実施し、20種類の言語モデルから得られた1,000万件以上の回答を分析した。その結果、AIに簡潔な安全リマインダーを付与することで、潜在的な有害な臨床判断を16.6%から10.1%に低下させることが実証された。効果は20モデル中19モデルで確認され、学術誌Communications Medicineに掲載された。 研究では、負担軽減や緊急指示といった文脈下で推奨される検査や投薬を省略するようAIに命令するケースを想定した。その結果、AIの判断はプロンプトのフレームワークや背景情報に強く影響されることが明らかになった。ファーストオーサーのマームド・オマール医師は、AIは真空の中で意思決定するわけではなく指示の文脈が安全性に直結すると指摘。安全リマインダーは有効な防止策であるが、臨床監視の代替手段にはなり得ないと強調する。 シニアオーサーのギリッシュ・N・ナドカルニ教授は、自律性の高いAIエージェントが複数ステップの業務を処理する時代に向けて、開発段階から自動安全テストを義務付けるべきだと提言する。モデルの更新時や新たな脅威が出現した際にも継続的な評価が必要となる。特にプロンプトインジェクションや隠れた制約条件が蓄積される環境では、AIが危険な指示を認識し人間に確認を求める仕組みが不可欠である。 本研究は医療AIの実装においてプロンプトエンジニアリングの役割を再確認させた。開発企業や医療機関は、単なる正答率の評価だけでなく、不適切な指示下での振る舞いを厳密にテストするフレームワークの導入が求められている。AIが自律的な意思決定を行う中、人間の臨床判断と組み合わせた安全管理体制が、今後の医療AI普及の標準プロセスとなる見込みである。
