HyperAIHyperAI

Command Palette

Search for a command to run...

人工智能中的递归自我改进:从有界自我精炼到自主研究循环

Mingguang Chen Licheng Wang Bo Qu

摘要

人工智能系统日益参与自身改进:修正其输出,在部署中调整和演化自身框架,基于自身生成的数据进行训练,并在一个日益增长的研究方向中——自行开展人工智能研究。描述这种参与的文献激增,但所用词汇(“自我精炼”、“自我奖励”、“自我对弈”、“自我演化”)混淆了根本不同的目标。我们调查了1,250篇arXiv论文(2024–2026年),并沿两个轴进行组织:系统改进的内容——其在部署中的行为、通过训练获得的策略、其评估器或研究过程本身——以及循环闭合的程度(从人机协同到完全闭合)。该分类法将有界自我精炼——收敛、可评估且已成为工业实践——与开放式递归自我改进(RSI)区分开来,后者仍受限于当前证据可衡量的各方面:接地要求、崩溃动态和计算约束。其显著特点是为自我评估设立专门类别:每个改进循环都声称某种信号可替代人类判断,因此我们调查了评估器设计空间——评判器、过程奖励模型、验证器、评分标准、元评估——以及其监督的循环,将这些信号按验证层级排序,从形式验证器(最强)到内在自我评估(最弱),并观察到已展示的自我改进强度遵循此层级,其典型失败模式(自我确认循环、模型崩溃、多样性崩溃)源于对该层级的违反,而将人类保留在循环中的“研究方向设定”瓶颈是其最高阶梯。我们将技术文献与RSI限制理论以及前沿实验室关于闭合循环的叙述所引发的安全与治理问题联系起来,并指出对自我改进进行治理级测量是该领域最缺乏研究的细分方向。

一句话总结

来自加州大学河滨分校、AlphaAvatar 和伊利诺伊理工学院的研究人员对 1,250 篇 arXiv 论文(2024–2026 年)进行的一项综述提出了一个分类法,该分类法将有界自我精炼与开放式递归自我改进区分开来,引入了一个按验证层级排序的专门自我评估类别——从形式化验证器到内在自我评估——并将典型的失败模式与层级违反联系起来,同时将治理级别的测量确定为该领域最缺乏研究的细分方向。

核心贡献

  • 一项涵盖 1,250 篇论文的综述沿两个轴组织 AI 自我改进:改进什么以及谁验证改进,从而将有界自我精炼与开放式递归自我改进分开,并解决了由“self-X”术语引起的混淆。
  • 该综述将评估信号按验证层级排序,从形式化验证器到内在自我评估,表明已展示的自我改进强度遵循此层级,而诸如自我确认循环之类的失败模式则源于对该层级的违反。
  • 该工作将人类方向设定确定为最后的验证层,并将自我改进的治理级别测量定位为该领域最缺乏研究的细分方向,主张自我改进的真实性仅取决于其验证。

引言

能够递归地自我改进的 AI 系统这一概念,已从数十年前的理论猜想转变为部分的工程现实。大型语言模型现在能够常规地精炼自身输出、基于自生成数据进行训练并修改自身的 agent 脚手架,有些系统甚至能发现反馈到 AI 开发中的算法。然而,该领域缺乏一个统一的框架来区分根本不同的自我改进形式,而模糊的“self-X”词汇掩盖了在目标、机制和风险上的关键差异。

先前的综述涉及了孤立的线索,例如在线策略蒸馏或树搜索方法,但没有一篇覆盖从有界输出精炼到开放式递归自我改进的完整范围。文献的增长速度也快于整合速度,季度产出在两年内从个位数增长到约 500 篇,使得系统化整理变得日益紧迫。

作者通过收集 2024 年至 2026 年的 1,250 篇 arXiv 论文并将其分类到一个双轴分类法中,来解决这一空白。这两个轴分别捕获系统改进的内容(行为、策略、评估器或研究过程)和循环闭合的程度(人机协同、自动审查或完全自主)。这种结构清晰地将有界自我精炼与开放式递归自我改进分开,并取代了模糊的 self-X 词汇。该综述还将自我评估提升为一个专门类别,将改进信号的可靠性视为所有自我改进形式的共同限制因素,并综合了理论、局限性和安全文献,这些文献将技术机制与递归自我改进是否以及何时可能变得自我维持的问题联系起来。

数据集

作者分两个阶段构建综述语料库,结合了广泛的种子收集和有针对性的补充收集,并用其来描绘研究活动而非衡量影响力。

语料库构成与来源

  • 种子收集:跨七个 arXiv 主题(2024–2026 年)进行查询,涵盖自我精炼、自我奖励训练、自动化 AI 研究、自我修改 agent、LLM 驱动的代码/算法发现、RSI 理论与安全以及自生成数据循环。
  • 记录使用 OpenAlex 引用和来源元数据进行丰富,然后过滤以去除无关内容,最终得到 871 篇论文。
  • 补充收集:在种子查询覆盖不足但分类法将其视为第一类别的三个领域,有针对性地添加了 379 篇论文:自我评估方法(评判器、过程奖励模型、验证器、评分标准、元评估)、测试时训练和零数据自博弈。
  • 合并后的语料库如图 2 所示。

每个子集的关键细节

  • 种子语料库(871 篇论文):通过每个查询的深度上限检索,偏向近期、高产出的主题;74% 的论文发布于 2026 年,论文的中位年龄为几个月。
  • 补充语料库(379 篇论文):构建上偏向近期;大约每七篇论文中就有一篇(约 54 篇)是外围查询的无关内容,保留在计数中但不作为证据引用。
  • 分类:所有种子论文都使用主题级映射、标题和摘要的关键词规则以及规则失误的人工纠正,被重新分类到综述的分类法类别中。基于规则的分类将 89 篇种子论文从其主题默认值中移出,其中 3 次进一步的失误通过显式覆盖进行了纠正。

该论文如何使用数据

  • 语料库被用作样本而非普查,以描绘研究活动集中的地方。
  • 论证骨架依赖于经过验证的锚定工作和诊断/批判性文献;2026 年的海量文献作为活动地图,而非持久影响力的证据。
  • 增长统计(图 6)仅使用种子语料库,以避免补充收集带来的近期偏差。
  • 每篇论文的分类分配已完整发布以供审计。

处理细节

  • 去重逻辑、每个查询的上限和分类规则(类别默认值、关键词规则、显式覆盖)已作为可执行脚本发布。
  • 分类和纠正由单个标注者执行;每个类别都存在边界论文,自动分类是近似的。
  • 工业界的 RSI 实践仅能通过已发布的成果观察到,这为最先进的部分引入了审查效应。

方法

作者提出了一个双轴分类法,以组织日益增多的自我改进方法术语。该框架根据系统改进的内容和循环闭合的程度来定位任何自我改进方法。

第一个轴根据改进对象对系统进行分类。部署时自我进化发生在系统在部署期间通过以冻结的权重迭代输出、按查询调整权重或进化其工具和技能来进行改进时。训练时自我迭代涉及系统在训练阶段生成数据或奖励以更新自身权重。自我评估侧重于改进系统的评估器,例如评判器或奖励模型。自动研究代表那些自身执行 AI 研究、提出假设和发现算法的系统。

第二个轴定义了谁验证改进。在人机协同设置中,人员审查每次更改。在人机监督设置中,改进信号是自动生成的,但人员审计结果。在闭环中,系统无需人工审查即可生成、验证和应用改进。

请参考下面的框架图,该图展示了生成的 4x3 网格,每个单元格中都有代表性系统。

作者观察到,文献密度集中在中间行,即自动生成的信号由人员审计。闭环行是稀疏的,尤其是在自我评估列,这代表了从有界自我精炼到开放式递归自我改进的过渡。

为了填充和验证此分类法,作者通过两阶段流程收集了 1,250 篇论文的语料库。首先,种子收集在 arXiv 上跨七个与自我改进相关的主题进行查询,产生了 871 篇论文。其次,分类法对齐阶段使用主题级映射和关键词规则将这些论文重新分类到双轴框架定义的类别中,并对失误进行人工纠正。有针对性的补充收集在覆盖不足的方向上添加了 379 篇论文,例如自我评估方法和测试时训练。

如下图所示,合并后的语料库被可视化为语义地图,揭示了自动研究和基础理论的连贯区域,而三个大类则相互渗透。

通过发布查询字符串、去重逻辑和分类规则的可执行脚本,分类过程变得可复现。作者还追踪了该领域产出的快速加速,如下面的增长图所示,这激发了对结构化分类法的需求,以吸收新兴范式。

实验

评估涵盖了部署时自我进化、自我评估和自动化研究,每一部分都探究了自我改进的不同方面。通过执行反馈进行的代码自我修复提供了最清晰的验证,表明可靠的改进依赖于外部验证器(如测试或证明检查器),而非非结构化的自我批评。在多模态设置中,当基于外部证据时,精炼是成功的,但当依赖模型生成的信号时,则存在自我确认循环的风险。技能库引入了持久性积累,其中可重用、已验证的程序提高了可组合性,但未经验证的技能可能会在 agent 之间传播错误。自我评估成为关键瓶颈:改进强度遵循从形式化验证器到内在信号的验证层级,纯粹的闭环自我批评产生的是重新表述而非进步。自动化研究证实了这一模式,因为使用可信评估器的进化程序发现产生了现实世界的收益,而没有可靠验证的 AI 科学家 agent 则表现出完整性失败和可审计性差距。总的来说,实验汇聚于一个发现:持久的自我改进需要外部基础,并且已验证方法的流程级积累比结果级优化提供了更持久的价值。

该分类法揭示了一个严重不均衡的研究格局,部署时和训练时自我进化占主导地位,而自主 AI 研究和基础安全工作所占份额仍然小得多。一个明显的可验证性梯度是显而易见的,方法集中在存在廉价验证器的地方,并且近期一波工作汇聚于评估器协同进化,以解决静态验证瓶颈。部署时和训练时自我进化合计占语料库的大部分,每类都超过 300 篇论文,而自动研究的规模是其两到三倍小,基础理论是迄今为止最小的类别。自我评估工作在近期论文中占比最高,82% 发布于 2026 年,反映了整个领域向同时改进验证器和策略的转变。自动研究承载了该领域一些最著名的成果,但其规模仍比主导类别小两到三倍,凸显了雄心与已发表工作量之间的差距。基础理论、局限性和安全是最小的类别,并且 2026 年论文的比例最低,表明理论和安全分析滞后于方法开发。

该评估综述了 AI 自我进化的研究格局,将工作分类为部署时、训练时、自主研究和基础安全。分析揭示了一个严重不均衡的分布,部署时和训练时方法在语料库中占主导地位,而自主 AI 研究和基础安全仍然小得多。一个明显的可验证性梯度浮现出来,方法聚集在具有廉价验证器的任务周围,近期的工作越来越侧重于评估器协同进化,以克服静态验证瓶颈。总的来说,这些发现凸显了自主研究的宏伟抱负与已发表工作量之间的显著差距,以及理论和安全分析滞后于快速方法开发的现状。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供