Command Palette
Search for a command to run...
Mendel Gödel 机:基于比较进化的递归自改进编码智能体
Mendel Gödel 机:基于比较进化的递归自改进编码智能体
Changzhi Liu Yilun Liu Sikuan Yan Volker Tresp Yunpu Ma
摘要
能够迭代重写自身源代码的自改进编码智能体在编码任务上展现了出色的性能。然而,现有方案通常仅从单次失败轨迹中推导自我修改,忽略了智能体不断积累的过往尝试档案中丰富的比较信号。受孟德尔受控遗传原理的启发,我们提出 Mendel Gödel 机(MGM)。除通用的单轨迹克隆突变外,MGM 还引入了两种能更好利用已积累证据的新型自我修改方式:反应规范突变基于智能体在多个任务上的轨迹同时对其进行编辑,跨谱系杂交则利用来自另一谱系的参考智能体在同一任务上的轨迹对当前智能体进行编辑。在加性适应度景观模型下,我们从理论上证明并通过受控代理仿真展示,新策略相比单轨迹基线能实现更快、更好的收敛。在 SWE-bench 和 Polyglot 上的实验证实,MGM 在性能、效率和泛化能力方面均取得了一致的提升。
一句话总结
来自电子科技大学、慕尼黑大学和慕尼黑机器学习中心的研究者提出了Mendel Gödel Machine (MGM),一种递归自改进的编码agent,其以孟德尔式的受控遗传原理为基础,将单轨迹克隆突变扩展为反应规范突变(基于agent在多个任务上的轨迹同时对其进行编辑)和跨谱系杂交(利用来自另一谱系的参考agent在同一任务上的轨迹来编辑agent),从而利用比较进化在SWE-bench和Polyglot上实现了理论上证明且经验上验证的更快的收敛、更高的性能、效率和泛化能力。
核心贡献
- Mendel Gödel Machine (MGM) 通过反应规范突变和跨谱系杂交增强了单轨迹克隆突变,前者根据agent在多个任务上的轨迹对其进行编辑,后者利用来自另一谱系的参考agent在同一任务上的轨迹来编辑agent,两者均重用了已有的评估数据。
- 在加性适应度景观模型下,理论分析和受控模拟表明,与单轨迹基线相比,这些比较证据策略提高了有效固定概率并加速了收敛。
- 在SWE-bench和Polyglot上的实验表明,在匹配的预算下,MGM在性能和效率上始终优于单轨迹HGM基线,消融实验证实两种算子对性能提升均有贡献,而留出评估表明进化后的脚手架可以在不同基准和骨干LLM之间迁移。
引言
作者基于自改进编码agent递归编辑自身源代码的理念展开工作,这一愿景近来已通过大型语言模型得以实现。先前的工作维护了一个agent变体档案,但在每次自我修改步骤中仅依赖单个agent的轨迹(通常是近期的失败案例),忽视了档案中业已存在的丰富比较证据。作者引入了Mendel Gödel Machine (MGM),通过两个新算子丰富了自我修改过程:反应规范突变,以agent在多个任务上的表现为条件进行编辑;跨谱系杂交,利用另一agent在同一任务上的轨迹。这些算子重用了已有的评估数据,不会产生额外的任务评估开销,从而在编码基准上实现了更快的收敛和持续的性能增益。
方法
Mendel Gödel Machine (MGM) 构建在一个包含选择、评估和扩展策略的树搜索框架之上。MGM没有依赖单轨迹自修改,而是根据档案中可用的诊断证据类型 E ,将扩展算子 Φ 划分为三个专门的子算子。这些算子分别是克隆突变 ΦCM、反应规范突变 ΦRM 和跨谱系杂交 ΦCH。
作者将这些自修改算子设计为诊断过程,要求被选中的agent基于不同的表型证据对其基因型进行通用改进,类似于孟德尔遗传学。
克隆突变 (ΦCM) 作为标准的单agent、单轨迹自改进算子。当MGM只有一个有信息的失败案例或无法构建可靠的比较时,使用该算子。给定一个选中的节点 i 和一个失败的任务 τ∈Fi,证据定义如下:
ECM(i,τ)={(φ(ai,τ),r(ai,τ))}.编辑器诊断失败原因并修改 ai,以避免在未来任务中出现类似失败:
a′←ΦCM(ai,ECM).该算子保留了标准自修改的行为,并确保搜索即使在档案规模较小时也能继续进行。
反应规范突变 (ΦRM) 引入了反应规范的概念,该概念描述了同一基因型在不同环境下如何表达出不同的表型。通过比较同一基因型在不同任务中的多个表型,MGM可以识别出反复出现或具有对比性的行为模式。当agent ai 积累了足够多的轨迹 ∣Si∣≥mRM 且至少存在两条轨迹,其中有一条是作为目标 τt∈Si 的失败轨迹时,该算子可用。参考 τr 可以是 Si 中的任何其他轨迹。证据为:
ERM(ai,τt,τr)={(φ(ai,τt),r(ai,τt)),(φ(ai,τr),r(ai,τr))}.agent被要求识别出一个共有的行为模式并实现一个通用改进:
a′←ΦRM(ai,ERM).跨谱系杂交 (ΦCH) 比较了在同一任务环境下不同基因型的情况。当两个节点至少尝试过一个共同的目标任务 τt,且该任务未被两者同时解决时,该算子可用。MGM指定一个失败的agent作为待改进的目标 at。如果参考agent ar 同样失败,MGM利用比较来识别互补的失败模式。如果 ar 解决了 τt,其基因型上的差异将指导自修改。证据为:
ECH(at,ar,τt)={(φ(at,τt),r(at,τt)),(φ(ar,τt),r(ar,τt))}.子代通过以下方式产生:
a′←ΦCH(at,ECH).这种杂交操作是一个诊断过程,目标agent从参考轨迹中提取可迁移的行为特征,并将其适配到自身的代码库中,鼓励真正的改进而非特定于任务的行为。
为了控制未来评估任务的采样方式,MGM维护了一个全局池:
Pt=i∈Vt⋃Fi,该池存储了在任何先前评估过的agent中暴露失败的任务。当为agent选择新任务时,MGM从该agent尚未尝试过的任务中采样,但为 Pt 中的任务分配一个预定的权重:
wi(τ)={βfail,1,τ∈Pt,τ∈/Pt,τ∈/Si,其中 βfail 是失败池提升系数。这种设计将评估集中在已知会暴露弱点的任务上,增加了每次 φ 评估的诊断价值,并有意在谱系间创建重叠,以促进跨谱系比较。
对于策略选择,MGM继承了一个汤普森采样策略 π,该策略在为一个现有节点启动一次 φ 评估和进行一次演化树的 Φ 扩展之间做出选择。当 π 为父节点 ai 选择 Φ 扩展时,MGM从档案中构建合格算子集合 Ωi⊆{ΦCM,ΦRM,ΦCH}。然后,MGM以可配置的权重 λCM、λRM 和 λCH 在合格算子中进行采样:
Pr(σ∣i)=∑σ′∈Ωiλσ′λσ,σ∈Ωi.选中的算子决定了证据 Eσ,子代通过以下方式产生:
a′←Φσ(at,Eσ).如果 Ωi=∅,MGM将跳过此次扩展,π 转而分配另一次 φ 评估。
实验
受控模拟证实,纳入比较证据可以降低诊断的不确定性并提高自修改的有效固定概率,随着诊断优势的增加,MGM的性能优于DGM和HGM。在SWE-bench和Polyglot上,在相同的计算预算下,MGM始终比HGM达到更高的准确率,且进化后的脚手架可以跨基准和骨干模型进行泛化,证明了其获得了可复用的工作流级别的改进。消融研究揭示,反应规范突变和跨谱系杂交对性能均有贡献,其中跨谱系杂交在保存和重用进化信息方面扮演了更关键的角色。
在相同的计算预算下并从相同的初始脚手架开始,MGM在SWE-bench Verified和Polyglot基准上均始终优于HGM。最大的增益出现在Polyglot上,MGM的准确率从50.8%提高到93.2%,相对提升83.5%,而HGM达到了77.9%。性能差距不能由运行时间或token消耗来解释,这表明MGM通过反应规范突变和跨谱系杂交对存档轨迹的重用,驱动了更有效的自我改进。在SWE-bench Verified上,MGM的准确率比初始agent提高了10.0个百分点,是HGM 5.0个百分点提升的两倍。在Polyglot上,MGM获得了42.4个百分点的提升(83.5%的相对提升),大大超过了HGM 27.1个百分点的提升(53.3%的相对提升)。两种方法使用了相同数量的评估和扩展,且它们的运行时间相当(在SWE-bench上相差3-4小时,在Polyglot上相差4小时),排除了额外计算是MGM优势来源的可能性。在这两个基准上,MGM的平均准确率为85.8%,相比之下,HGM为75.6%,共享的初始脚手架为59.6%。文本证实,HGM和MGM每个进化步骤的平均token成本相似,因此增益不能归因于更高的token支出。
当将在Polyglot上进化出的脚手架迁移到SWE-bench Pro和SWE-bench Multilingual时,MGM始终提高了准确率,而HGM则表现出有限或负面的迁移效果。MGM在两个基准上都取得了巨大的增益,表明其自修改算子发现了可复用的工作流,这些工作流可以在不同的代码库复杂性和编程语言中进行泛化。MGM在所有留出基准上都产生了显著的准确率提升,而HGM在更具挑战性的SWE-bench Pro上性能下降,在Multilingual上仅有微小的增益。MGM的相对提升范围从Multilingual上的32%到Pro上的60%,表明了进化出的脚手架变更具有鲁棒的跨基准迁移能力。
在Qwen3.6-35B-A3B上使用MGM进化出的脚手架,可以有效地迁移到DeepSeek骨干模型上,并在SWE-bench Verified-60上进行测试。MGM在两个DeepSeek模型上达到了70.8%的平均准确率,显著优于初始脚手架(47.5%)和HGM(65.0%),同时也在原始Qwen设置上提升了10.0个点。这些结果表明,MGM发现了不局限于单一基础模型的可复用工作流级别的改进。MGM在原始Qwen骨架上将准确率比初始脚手架提高了10.0个点,在迁移的DeepSeek骨架上平均提高了23.3个点。在DeepSeek-V4-Pro上,MGM相对于初始脚手架的相对提升达到66.7%,而HGM为55.6%。MGM在所有模型骨干上均始终优于HGM,在迁移的DeepSeek模型上取得了最大的绝对增益。
完整的MGM相比初始agent取得了巨大的准确率增益,而移除奖励模型或通信历史会显著降低这种改进。通信历史组件被证明是最关键的,其缺失导致了性能的最大下降。所有变体的训练时间大致相当,这证实了增益源自组件本身,而非计算成本的差异。移除通信历史使绝对准确率增益大约减半,表明其对于在迭代过程中保留和重用有用的进化信息至关重要。没有奖励模型的情况下,改进幅度下降了约三分之一,表明其有助于引导自我改进搜索朝向更有前景的agent。
MGM在SWE-bench Verified和Polyglot上进行了评估,在使用相同计算预算的情况下始终优于HGM,且其增益被证明源于轨迹重用而非额外的计算。迁移实验表明,使用MGM在一个基准或模型骨架上进化出的脚手架改进,可以有效地泛化到留出基准和不同的基础模型,而HGM则表现出有限或负面的迁移效果。消融实验证实,通信历史是保留和重用进化信息的最关键组件,奖励模型提供了额外的指导,且观察到的增益来自设计选择而非增加训练成本。