Command Palette
Search for a command to run...
EVODUET:面向科学发现的网络搜索与任务求解双层协同进化
EVODUET:面向科学发现的网络搜索与任务求解双层协同进化
Young-Jun Lee Jinheon Baek Soyeong Jeong Minki Kang Seungyeon Jwa Jonghyun Choi Seungho Han Dongyeop Kang
摘要
基于大语言模型(LLM)的进化搜索在进展需要模型所缺乏的外部知识时可能停滞。提供相关文档有所帮助,但随着解发生变化,仅添加网络搜索工具可能会不断返回相同页面。我们提出 EVODUET,一种在固定模型参数下协同进化解与搜索查询的双层优化方法。每次迭代中,一个检索门控让 LLM 评估其知识缺口,并选择检索新文档、重用已存储文档,或在不使用文档的情况下继续。内层循环细化查询,并按文档预计产生的解分数对文档进行排序;外层循环从这些文档并行生成候选解,并记录评估结果以供后续搜索使用。在 21 个每轮迭代生成一个候选解的优化任务中,EVODUET 将 OpenEvolve 的归一化发现增益在使用 GPT-5.6-Luna 时从 74.1% 提升至 78.0%,在使用 Gemini-3.8-Flash 时从 61.3% 提升至 82.3%,而 Qwen3.5-9B 未从中受益。我们的最佳运行在八个任务上超过了此前报告的最佳分数,包括 Q20 上的 Swap Reduction 和 Rosetta,并在另外三个任务上与之持平。EVODUET 在其他脚手架(如 Top-K、EvoX)下也能在 Sums/Diffs 和 Denoising 任务中带来改进,表明其适用于不同的进化搜索脚手架。
一句话总结
明尼苏达大学等提出 EVODUET,一种双层协同演化方法,在固定模型参数下交替进行解决方案演化和搜索查询演化,使用检索门进行知识缺口评估,并通过内、外循环进行查询精化、文档排序、候选生成和结果记录;EVODUET 将 OpenEvolve 归一化发现增益从 GPT-5.6-Luna 上的 74.1% 提升到 78.0%,在 Gemini-3.8-Flash 上从 61.3% 提升到 82.3%。
核心贡献
- 提出 EVODUET,一种双层优化方法,在外循环中协同演化解决方案,在内循环中协同演化网络搜索查询,并固定 LLM 参数。
- 在 21 个优化任务中,每次迭代一个候选,EVODUET 将 OpenEvolve 的归一化发现增益在 GPT-5.6-Luna 上从 74.1% 提升到 78.0%,在 Gemini-3.8-Flash 上从 61.3% 提升到 82.3%;Qwen3.5-9B 没有受益,最佳运行在八个任务上超过此前报告的最佳分数,并在另外三个任务上持平。
- EVODUET 还改善了 Sums/Diffs 和 Denoising 上的 Top-K 与 EvoX 脚手架,分析表明方法迁移是检索文档最常见的用途,而预测文档增益仍需要评估器验证。
引言
LLM 驱动的演化搜索脚手架越来越多地用于可评分但无法直接计算最优解的优化任务,例如 Erdos 最小重叠问题、GPU 内核设计和单细胞 RNA-seq 去噪。现有脚手架通常作为封闭的解决方案循环运行,或添加策略循环,仅利用运行中的演化历史和 LLM 的参数化知识。因此,当改进需要外部信息而这两种来源都不包含时,它们会停滞。作者提出 EVODUET,一种双层方法,在外循环中协同演化候选解决方案,在内循环中协同演化网络搜索查询,使用知识缺口检索门决定何时搜索,并在评估前使用假设证据评分对检索文档排序。在 21 个优化任务中,EVODUET 改善了 OpenEvolve,并在八个任务上超过此前报告的最佳分数。
方法
作者将科学发现形式化为双层优化问题,引入 EVODUET 来协同演化解决方案和网络搜索查询。该框架包含三个主要组件:用于解决方案优化的外循环、用于查询优化的内循环,以及连接两者的基于知识缺口的检索门控机制。理想的双层优化形式化为:
outer: solution optimizationx⋆=argoptx∈XE(x)s.t.inner: query optimizationqt⋆=argoptq∈QtE(xt+1(q))如下图所示:
外循环遵循演化搜索脚手架来演化解决方案。在每次迭代 t,选择策略 ϕ 从种群 De 中选择父解决方案 xt 及其演化历史 Ht。随后,LLM Mθ 生成候选解决方案 xt+1∼Mθ(I,ct,St),其中 St 是一组检索到的网络文档或为空。为实现多样化探索,作者采用门控并行候选解决方案生成,从同一输入提示并行生成 Nt 个候选。基于评估器 E 选择最佳有效候选,并传递给选择策略。
基于知识缺口的检索门控机制决定模型是否需要外部知识来改进当前解决方案。给定上下文 ct 和搜索数据库 Ds,LLM 输出当前知识状态 Kt 和检索决策 gt:
(Kt,gt)=GATEMθ(ct,Ds),gt∈{NO-OP,LOOK-UP,RETRIEVE}.如果模型内部知识足够,则选择 NO-OP。如果已存储文档提供了缺失知识,则选择 LOOK-UP,复用现有证据而不进行新的网络搜索。如果两种来源都不足够,则选择 RETRIEVE 以调用内循环。
当 gt=RETRIEVE 时,内循环在 R 轮中近似进行查询优化,而不生成或评估候选解决方案。它首先计算种群状态描述符,并将其总结为事实观察 At,以形成初始上下文 c~t0=(ct,Kt,At)。在每一轮 r,该循环执行四个操作。第一,LLM 构造 J 个针对剩余知识缺口的查询。第二,执行网络搜索,将返回的文档与之前保留的文档合并成池 Pr。第三,执行假设证据评分,LLM 为池 Pr 中每个未评分文档 d 预测评估器分数 s^t(d),为内层目标提供代理信号。最后,更新知识状态 Ktr 并保留预测分数最高的前 D 个文档作为 Str。经过 R 轮后,最终保留的文档 St=StR 被传回外循环,以指导生成改进的候选解决方案。
实验
实验在 31 个优化任务上评估了用于科学发现的网络搜索,使用 OpenEvolve 和 EVODUET 跨多个 LLM,以归一化发现增益作为指标。Oracle 文档改善了平均进展,尤其在更多并行候选和较小模型上,但收益因任务和模型而异。EVODUET 的双层查询演化和基于知识缺口的检索门维持了更广泛的文档发现,并比联合级搜索改善结果,在部分解决任务和数学任务上增益最大,但仅对能够使用检索证据的模型有效;较弱的 Qwen3.5-9B 出现下降。检索文档主要贡献方法和性能目标,该方法与现有脚手架集成,同时降低 Denoising 上的成本。
EVODUET 在评估任务上匹配或略微改善先前的最先进指标,且报告的运行成本适中。进一步分析显示,基于知识缺口的检索门优于随机和停滞式门控,而双层搜索设计超过无网络搜索、联合级和顺序替代方案。该方法还提高了现有脚手架的归一化下游增益,并在 Denoising 上实现较强成本效率。基于知识缺口的门在所有检索门控策略中产生最高的归一化下游增益,在 Denoising 上尤其比停滞启发式有大幅改进。EVODUET 在三个任务上超过无网络搜索、联合级循环内搜索和顺序搜索变体,并在 OpenEvolve、Top-K 和 EvoX 脚手架上改善结果。在 Denoising 上,EVODUET 达到略高于 100% 的归一化下游增益,同时与 SimpleTES 相比将估计 API 成本降低约 6.9 倍。
实验在多个下游任务和脚手架上评估 EVODUET,与先前最先进方法比较,并消融其检索和搜索组件。EVODUET 以适度运行成本匹配或略微改善先前最先进指标,其基于知识缺口的检索门优于随机和停滞式门控,尤其在 Denoising 上。双层搜索设计也超过无网络搜索、联合级和顺序替代方案,同时提高 OpenEvolve、Top-K 和 EvoX 脚手架的归一化下游增益。在 Denoising 上,该方法达到略高于 100% 的归一化下游增益,并将估计 API 成本相比 SimpleTES 降低约 6.9 倍。