HyperAIHyperAI

Command Palette

Search for a command to run...

40 分钟前
Agent
LLM

DarwinX:通过自然选择进化智能体框架

摘要

LLM 智能体的能力不仅取决于模型权重,还取决于其框架:提示、工具、技能和控制流。自我改进循环已经在编辑框架,但单系谱搜索具有路径依赖性,局部改进往往会导致其他任务性能回退。我们提出 DarwinX,将自我进化视为在模型冻结的情况下对框架种群进行选择:一个“保留并扩展”契约只接纳在不回退的前提下扩展覆盖范围的变体,一个存档保留备选系谱以供重组,来自失败、教师和自衍生证据共享同一编辑接口。适应度来自每个基准自身的验证器:无需黄金答案,也无需人工挑选优胜者。在四个逐步将进化信号与测试分离的基准上,一次循环平均提升约 17 分:Terminal-Bench 2.1 在匹配基座上提升 +7.7 至 83.2%,在更强基座上达到已验证的前沿水平 84.7%;TerminalWorld 的留出划分达到 68.3%,领先于所有现成智能体;WebArena-Infinity 真实任务 pass@1 从 43.5% 提升至 93.0%,且审计干净;一个 Terminal-Bench 2.1 框架未经修改直接迁移至 SWE-bench Verified。进化产生的是通用智能体能力,而非针对特定基准的补丁,因此它能在任务、验证器和基座模型变化后依然有效。冻结的模型不必是固定的智能体:框架选择将评估算力转化为持久能力。

一句话总结

DarwinX 由 Salesforce AI Research 和 Salesforce Agentforce 的研究者提出,在模型冻结的情况下通过自然选择进化 agent harness 种群,使用保留并扩展式编辑、谱系重组和共享证据接口来避免路径依赖式回退;在四个基准上平均增加约 17 个点,并可原样迁移到 SWE-bench Verified。

核心贡献

  • DarwinX 通过将自进化视为对 harness 变体种群的选择来改进冻结模型 agent,结合保留并扩展契约、替代谱系档案,以及用于失败来源、教师来源和自我来源证据的共享编辑接口。
  • 适应度来自每个基准自身的验证器,不使用金标准解或人工挑选的胜者,在四个基准上平均提升约 17 个点;Terminal-Bench 2.1 在 GPT-5.5 上从 75.5% 上升到 83.2%,在 GPT-5.6 Sol 上达到 84.7%,TerminalWorld 的留出切分达到 68.3%,WebArena-Infinity 审计清洁 pass@1 从 43.5% 上升到 93.0%。
  • 一个 Terminal-Bench 2.1 harness 原样迁移到 SWE-bench Verified 时达到 84.2%,这些提升反映通用 agent 能力而非针对特定基准的补丁,因此在任务、验证器和基础模型变化后仍然保持。

引言

作者研究自改进 LLM agent,其中能力既取决于冻结模型,也取决于 harness(提示、工具、记忆和控制流)。先前的自编辑系统共享一个内部循环:批量 rollout、反思、有界编辑和回退门控;但单谱系搜索受到路径依赖和平台期困扰,修复一个任务族的编辑常常使另一个任务族回退,尤其是在混合基准上。现有的基于档案的方法可以保留变体,但往往使互补的专家变体彼此隔离,并且不要求新增收益必须保留先前解。作者提出 DarwinX,将自进化重新定义为对 harness 变体的种群选择,加入保留并扩展契约以约束回退风险,并归档变体,使互补专家可以被继承和重组。选择由基准上测得的适应度驱动,不使用金标准解或人工挑选的胜者。

数据集

作者使用两个不相交的数据组件进行合成到真实泛化:

  • 合成进化集:从每个应用自身的描述文档生成 300 个合成意图。生成流程从不读取基准的任务套件,因此合成集与真实评估任务保持分离。一个 LLM 评判器使用 avg@3 进行筛选、avg@5 进行确认,对合成轨迹评分。任何真实 WAI 任务或验证器都不影响选择。
  • 真实留出评估集:1,260 个真实任务,与合成意图不相交。这些任务配有确定性验证器,并且在进化循环的任何阶段都不可见。

处理与使用:合成意图用于生成轨迹,驱动进化过程中的迭代选择。真实任务仅用于最终报告,在其中计算 pass@1。在合成全集上,两个中间检查点得分分别为 38.4% 和 34.4%,而基础模型为 19.7%。选择门保留 26 次迭代并回退 36 次,因此被接受的改进沿着一条较短的主谱系累积,而不是通过合并分支累积。

方法

作者采用一种基于选择的 agent 改进方法 DarwinX,把能力提升视为进化问题而非训练问题。基础模型权重在整个过程中完全冻结。系统迭代地对 agent harness 提出小编辑,包括提示、记忆、工具和控制流,并且只有当经验证据表明编辑能解决新任务而不回退已解决任务时才保留。

该框架的核心是保留并扩展契约。子 harness ccc 相对其父代 ppp 通过逐任务解决率进行评估。净增益定义为 g(c)=tΔtg(c) = \sum_t \Delta_tg(c)=tΔt,其中 Δt=p^t(c)p^t(p)\Delta_t = \hat{p}_t(c) - \hat{p}_t(p)Δt=p^t(c)p^t(p),有界回退为 R(c)=t(Δt)+R(c) = \sum_t (-\Delta_t)_+R(c)=t(Δt)+。适应度准入条件在 g(c)>0g(c) > 0g(c)>0R(c)δR(c) \le \deltaR(c)δ 时接纳子代。随后,一个具备推理能力的验证 agent fff 分两个阶段裁决:先基于试验证据 E\mathcal{E}E 和共享记忆 KgK_gKg 进行初步晋升,再进行更严格的保留探测。这种双速设计允许快速探索,同时防止幸运 rollout 污染搜索。

分支进化维护一个树形档案。父代选择按累积谱系增益 G(c)=G(p)+g(c)G(c) = G(p) + g(c)G(c)=G(p)+g(c) 对节点排序。下一个父代按 p(1β)δargmaxvSG(v)+βBroaden(P)p^* \sim (1-\beta)\delta_{\text{argmax}_{v \in S}} G(v) + \beta \text{Broaden}(P)p(1β)δargmaxvSG(v)+βBroaden(P) 采样,在利用最高增益已确认变体与扩展更广泛种群之间取得平衡。

种群级继承和重组确保能力累积而非相互抵消。变体按其已解决任务集 S(c)S(c)S(c) 与父代 S(p)S(p)S(p) 的比较进行分类。改进型(S(c)S(p)S(c) \supseteq S(p)S(c)S(p))和中性子代(S(c)=S(p)S(c) = S(p)S(c)=S(p))保留重组资格,而踏脚石和归档变体只贡献提炼后的经验。当互补变体 v1,,vnv_1, \dots, v_nv1,,vn 解决不同任务时,DarwinX 通过从共同祖先 H0H_0H0 合并它们的加法编辑来物化一个继承子代。合并后的 harness 为 H=H0ΔH = H_0 \oplus \DeltaH=H0Δ,其中 Δ=ΔcodeΔskillΔpromptΔtool\Delta = \Delta_{\text{code}} \oplus \Delta_{\text{skill}} \oplus \Delta_{\text{prompt}} \oplus \Delta_{\text{tool}}Δ=ΔcodeΔskillΔpromptΔtool。子代只有在覆盖其所有父代胜利并集 S(child)iS(vi)S(\text{child}) \supseteq \bigcup_i S(v_i)S(child)iS(vi) 时才被保留。

突变循环由模块化学习信号接口驱动。在提出编辑之前,系统选择可用的最有信息量证据。失败来源信号(\nabla)总结失败轨迹,以定位缺失能力。教师来源信号(π\pi^*π)为 agent 没有成功 rollout 的任务提炼成功参考轨迹。自我来源信号(AAA)对比 agent 自身通过和失败的 rollout,以识别可靠的成功因素。所有信号都被转换为候选 harness 编辑,而不更新模型权重。

测量与确认依赖二值 avg@k 评估。Agent 超时计为失败,保留探测会在晋升子代成为祖先前重新采样谱系已知解决集。最后,失败模式分类器将基准中的主要主题聚合到种群级共享记忆 KgK_gKg 中,更新为 Kg+1=Agg(Kg,worked,regressed,themes)K_{g+1} = \text{Agg}(K_g, \text{worked}, \text{regressed}, \text{themes})Kg+1=Agg(Kg,worked,regressed,themes)。提出器和验证器都会读取该记忆,使搜索能够发明解决系统性瓶颈的全局能力,而不是孤立的逐任务补丁。

实验

DarwinX 作为通用 harness 优化流程在五个研究问题上接受评估:四个基准中进化信号与测试之间的分离程度逐步增大,外加一个消融实验。在冻结模型上,进化后的 harness 相对基础 Monet 持续改进,提升集中在程序性困难任务上,并归因于验证和产物契约技能,而非增加计算或利用验证器漏洞。留出实验和合成到真实实验显示超出训练任务的泛化能力;跨基准迁移到 SWE-bench Verified 的提升较小;消融实验确认保留并扩展行为,且没有簇级回退。

自改进 agent 方法共享相同的内部循环,但环绕其外的搜索和选择机制各不相同。现有优化器和脚手架编辑器大多缺少跨谱系合并和有界回退,因此容易受到路径依赖和跨任务干扰。区别性方法结合种群档案、保留并扩展契约和噪声感知选择,使互补专家能够重组而不会静默回退其他任务。被比较的方法大多省略有界回退和跨谱系合并,若干先前优化器对种群档案的使用受限或完全缺失。遗传式提示优化器重组提示字符串,但方式受限,不会合并为互补任务选择的变体。

在冻结模型上进化出的 harness 达到 Terminal-Bench verified 排行榜前沿。它在更低 effort 设置下略微超过先前的 verified 领先者,并相对基础 harness 和中性高 effort harness 增加若干点。提升归因于有针对性的测试时计算,而不是更大的模型或统一更高的预算。基于冻结基础模型的进化 harness 领跑 verified 排行榜,尽管使用更低的 effort 设置,仍略领先于此前的领先者。在匹配的基础模型上,进化 harness 从 75.5% 提高到 83.2%,并超过中性高 effort harness 五个点以上。额外计算集中在新通过的任务上,而已解决任务消耗的资源几乎相同。

在 TerminalWorld 的留出切分上,与 Opus 4.8 配对的进化 Monet harness 在被评估 agent 中取得最高单次尝试 pass@1,领先于 Claude Code 和未进化的基础 harness。匹配模型比较显示,在 Opus 4.8 和 GPT-5.5 上,进化 harness 均带来相似的绝对提升。该切分与训练任务不相交,并在评估前冻结,因此提升反映留出泛化能力,而非重复尝试或训练任务重放。进化 Monet harness 领跑留出 pass@1 排名,优于前沿编码 agent、中性终端 agent 及其未进化基础版本。进化在两个冻结基础模型上解决了数量相当的留出任务。对未见任务的单次尝试评估表明,提升反映泛化能力,而非训练任务重放或重试效应。

Monet 结合 DarwinX 在真实 WebArena-Infinity 套件上取得最佳审计清洁 pass@1,总体达到 93.0%,明显优于最强同模型基线和顶级公开 agent。相对同一冻结模型上的基础 Monet,进化 harness 使审计清洁通过率提高一倍以上,并在每个报告应用中都有提升,其中处方和 Gmail 等状态变更密集工作流增长最大。Monet(DarwinX)达到最高总体审计清洁通过率,以显著优势超过同模型 GPT-5.5 + Browser Use 基线和顶级公开 agent。相对基础 Monet 的提升是广泛的而非集中的:每个报告应用都改进,处方和 Gmail 等状态变更密集任务增长最大。

进化 harness 相对基础 Monet 同时提高原始通过率和审计清洁通过率,审计清洁 pass@1 从 43.5% 上升到 93.0%。无效成功从 120 次下降到 17 次,确认无效、人工复核和阻止尝试率降至接近零。评估平面、特权主机和漏洞利用相关违规消失,只留下原始状态突变。审计清洁 pass@1 从 43.5% 上升到 93.0%,而确认无效成功下降 22.1 个百分点。进化 harness 完全消除评估平面、特权主机和漏洞利用违规;剩余无效轨迹全部为原始状态突变。

实验在冻结模型上评估了进化后的 agent harness,涵盖 Terminal-Bench、TerminalWorld 留出切分和真实 WebArena-Infinity 套件。进化 harness 在相同或更低 effort 下达到或超过先前排行榜和前沿 agent,并且提升迁移到未见任务,表明是留出泛化而非重试或重放效应。在真实网页基准上,各应用普遍改进,harness 几乎消除了无效、特权主机和漏洞利用相关轨迹。总体而言,结果表明通过有界回退和跨谱系合并来进化脚手架设计,可以得到更稳健、更可迁移且审计安全的 agent 行为。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供