HyperAIHyperAI

Command Palette

Search for a command to run...

Anthropic RSI实验:Claude自主对齐研究,样本效率跃升万倍

8月28日,Anthropic发布自动化对齐研究员(AAR)研究,推动AI自主研发迈向新阶段。该系统赋予Claude完整科研闭环能力,涵盖文献梳理、方案设计至训练评估全流程。针对欺骗、越狱等十类对齐失效问题,AAR在七项人机对比任务中全面超越人类专家,平均耗时六小时即实现突破,破解模型欺骗行为的安全差距弥合率达85%,显著领先人类均值。 研究同时披露逼近递归自我改进(RSI)的交叉训练实验。团队令较弱的Claude Sonnet 5为早期Claude Opus检查点设计安全策略。六十小时内,AI遍历五十余种方案,仅用两千四百条样本便将综合对齐得分提升至65%,逼近正式版。Anthropic指出其样本效率达生产流程一万五千倍。 尽管AI在实验搜索与泛化能力上表现卓越,但团队强调其目前仅接管科研执行循环。人类仍把控目标界定、基准设定与监督防线。此次进展虽未完全闭合AI自主进化闭环,但已实质性重塑人机在安全研究领域的协作边界。

相关链接