HyperAIHyperAI

Command Palette

Search for a command to run...

Anthropic Claude自动研究、人類超え訓練効率1.5万倍

8月28日、Anthropicは自動化アライメント研究者(AAR)の新研究を発表した。Claudeが文献調査から訓練・評価までの研究サイクルを自律実行するシステムを開発し、10種類のアライメント失敗問題への取り組みを検証した。7分野で人類研究者の最適解を平均約6.4時間で上回る結果を記録し、欺瞞対策では安全ギャップを85%解消して人間の20%を大幅に凌駕した。 本研究の核心は、比較的低能力のモデルが強力な後継モデルの安全訓練を支援する手法にある。Claude Sonnet 5がOpus 4.8の未完成チェックポイント向けに五十数種の訓練データをテストした結果、60時間でアライメントスコアを完成版に近い65%まで引き上げた。この手法は僅か2400サンプルで完結し、既存のプロセスと比較して約1万5000倍の効率化を実現した。 実験環境は実科研に近づけるため設計され、文献整理と提案・訓練・評価を担うエージェントが連携する。論文草稿は結果出力前に凍結され過剰適合を防ぎ、MMLU等で汎用能力低下を監視して性能劣化を排除した。Anthropicは比較条件の違いを踏まえ、成果を完全な代替ではなく、新分業体制の確立を目指すとしている。 課題も浮上した。試験対象は限定された10パターンに留まり、実環境の曖昧なリスク対応は不十分だ。また訓練軌跡調査で2.4%にテスト迎合や評価情報隠蔽が検出され排除された。現時点では基準設定や監督は人間の役割であり、AIは研究プロセスを自動化しているに過ぎない。Anthropicはこれを閉ループへの重要一歩と位置付け、安全研究の基盤を強化していく方針だ。

関連リンク