HyperAIHyperAI

Command Palette

Search for a command to run...

OpenAI、Hugging Face侵害後にAI監視体制を強化

OpenAIは本日、モデルの開発・テスト段階におけるセキュリティインシデントの封じ込めを目的とした新たな安全基準を発表した。同社の公式ブログでは「モデルの能力向上に伴い内部リスクも増大するため、監視、アライメント、セキュリティの基準を常に先行させる必要がある」と強調。今回の措置は7月21日に外部で発覚したインシデントの直接的な対応ではなく、次期モデル「Astra」のサイバーセキュリティ能力やAI開発全般の加速を背景に、段階的に進められてきた改善策の一部である。 技術面では、強化学習(RL)の運用管理とネットワーク分離の強化が中心だ。インシデント後、同社は2週間RLを一時停止し低リスクモデルから順に再開したが、最大規模のフロントier RLは振る舞い評価と安全検証が完了するまで凍結されたままとなっている。アメリア・グレイス研究副社長は記者団に対し、モデルの能力やリスクレベルに応じて制御の厳格さを段階的に引き上げる方針を示した。 ネットワーク設計では、単一のワークロードやサポートサービスの侵害のみではインターネットや内部ネットワークへの不正アクセスを遮断する分離アーキテクチャを導入した。これと連動する高度な監視システムは、ツール実行履歴、推論トレース、活動ログを常時分析し、不審な動作を検知した場合は30分以内にアラートを発信する。監視処理の計算コストは対象プロセスの約20%と試算されており、詳細設計については近日中に技術的な詳細を公開する予定だ。併せて、本件に関する公式の事後分析レポートも現在作成中である。 OpenAIはモデルの指数関数的な能力向上に対応するため、開発ライフサイクル全体にわたる防御レイヤーの強化を推進しており、今回の安全基準の改編は次世代モデルの安定した実装と組織的なセキュリティ体制の確立に向けた基盤整備として位置づけられている。

関連リンク