Command Palette
Search for a command to run...
Frontis-MA1:面向机器学习工程中递归自我改进的 AI4AI 模型训练
Frontis-MA1:面向机器学习工程中递归自我改进的 AI4AI 模型训练
摘要
递归自我改进(RSI)要求 AI 系统能够改进构建 AI 的过程(即 AI4AI);机器学习工程(MLE)为研究这一能力提供了具体、可执行的测试平台。我们引入了 OpenMLE,一个用于 MLE 中 RSI 研究的开源全栈系统,涵盖具有执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-ERL)和长程搜索(OpenMLE-Evo)。在此栈上,我们将 Frontis-MA1-35B 后训练为面向 MLE 的元进化智能体,围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)对齐后训练与推理:这些算子通过基于执行反馈的 SFT 和 RL 在已对所有评估基准去重的数据上进行训练,然后组合构成长程搜索,将学习与进化耦合在单一循环中。在 MLE-Bench Lite 上,每任务预算为 12 小时,使用单张 RTX 4090 且显存上限为 12 GB,Frontis-MA1-35B 借助 OpenMLE-Evo 将 Medal Average 从其基模型的 39.39% 提升至 60.61%,并借助 OpenMLE-Evo-Max(基准无关的经验先验和异步搜索)达到 71.21%,超越了 GPT-5.5 + Codex 并接近 GPT-5.6 Sol 和 2.8T Kimi K3。在留出的 NatureBench Lite 上,两个组件均表现出迁移性:固定框架,替换为训练后的模型,Match-SOTA 从 50% 提升至 70%;固定模型,替换为 OpenMLE-Evo,Match-SOTA 从 20% 提升至 50%。我们发布了模型权重和完整的 OpenMLE 栈,以支持面向 RSI 的可执行 AI4AI 的可复现研究。
一句话总结
来自 Horizon Research、Frontis.AI 和清华大学的研究者提出了 Frontis-MA1-35B,一个元进化 agent,通过基于执行的 SFT 和 RL 后训练四个原子程序进化算子,并将其组合为长程搜索,借助 OpenMLE-Evo-Max 将 MLE-Bench Lite 上的 Medal Average 从 39.39% 提升至 71.21%,超越 GPT-5.5+Codex 并接近 GPT-5.6 Sol 和 Kimi K3,同时还能迁移到 NatureBench Lite。
核心贡献
- OpenMLE 是一个面向机器学习工程中元进化研究的开源全栈系统。它提供可验证的任务环境及执行反馈,通过监督微调和强化学习进行基于执行的算子学习,并以结构化经验引导的长程进化搜索。
- Frontis-MA1-35B 被后训练为元进化 agent,通过围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)对齐训练和推理过程,这些算子使用基于执行的 SFT 和 RL 在已针对评估基准去重的数据上进行训练,随后组合为长程搜索,将学习与进化耦合在一起。
- 将训练后的模型与 OpenMLE-Evo 结合,在 MLE-Bench Lite 上将 Medal Average 从 39.39% 提升至 60.61%,而使用 OpenMLE-Evo-Max 则达到 71.21%。模型和搜索框架均可迁移到 NatureBench Lite,其中模型将 Match-SOTA 从 50% 提升至 70%,搜索框架将其从 20% 提升至 50%。
引言
作者致力于构建能够自主改进其他 AI 系统的 AI 系统,这一方向被称为 AI for AI(AI4AI),其长期目标是实现递归自我改进。机器学习工程(MLE)是一个具体的测试平台,agent 必须在延迟、带噪声的执行反馈下迭代开发 ML 解决方案。以往工作在进化搜索、任务环境或基于执行的后训练方面推动了 MLE agent 的发展,但目前尚无公开系统能够在一个可复现的工作流中同时涵盖可扩展的任务构建、基于执行反馈的 agent 训练以及长程进化框架。作者提出了 OpenMLE,一个统一这些组件的开源全栈解决方案:OpenMLE-Gym 提供经过质量筛选的任务和结构化反馈,OpenMLE-ERL 通过监督学习和强化学习训练可复用的程序变换算子,而 OpenMLE-Evo 将这些算子组合为经验引导的搜索。这一集成技术栈能够训练一个元进化 agent,由其充当自身进化框架的变异引擎,在 MLE 基准上取得显著提升,并公开所有产物以供更广泛的研究。
数据集
作者构建了 OpenMLE-Gym,一个包含 5,758 个可执行机器学习工程任务的套件,用于 LLM agent 的后训练、搜索和评估。每个任务是一个可验证的环境,将问题描述、训练数据、隐藏测试标签和一个指标脚本封装为标准化的包。数据集来自三个互补来源:
- 精选基准(156 个任务): 从现有论文和基准中人工选取,设计置信度最高但规模有限。原始资产直接处理为可执行包。
- Kaggle 数据集(3,362 个任务): 使用 MLE-Smith 数据集到任务的流水线大规模生成,并通过包级质量控制进行过滤。目标由系统自动推断,因此质量可能参差不齐。
- Kaggle 竞赛(2,240 个任务): 通过定制的爬取和构建流水线构建,下载竞赛文件,从 Meta Kaggle 提取模式与元数据,并生成任务描述、数据划分和评估脚本。与 MLE-Bench 重叠的竞赛被排除,以保证评估的完整性。
所有任务采用统一的布局:原始资产存放在 raw/ 中,agent 可见的训练数据、测试输入和示例提交位于 data/public/ 中,隐藏答案隔离在 data/private/ 中,metric.py 脚本验证预测并返回标量分数。对于竞赛衍生任务,自动化框架利用本地证据(模式、数据类型、维度、采样行)和 Meta Kaggle 记录生成 prepare.py,该脚本确定性地划分标注数据,将公开输入与私有答案分离,并创建符合模式的示例提交。随后通过执行准备代码并对示例提交评分来验证包;无法构建或无法生成有效标量指标的包将被丢弃。
后续基于 LLM 的质量过滤器检查每个任务包(描述、原始文件、处理脚本、输出、数据样本),并在五个维度上返回结构化判断:任务有效性、数据充分性、原始数据使用情况、任务复杂度和数据质量。仅保留通过最严格推荐且指标有效的任务,从而移除退化目标、数据泄露、标注错误和格式错误的处理。对于竞赛分支,该语义关卡在排行榜长度筛选、MLE-Bench 重叠移除和许可检查之后应用。
最终数据集涵盖表格、文本、时间序列、图像及其他模态(11% 为多模态),其中分类和回归占 87% 的任务。作者利用这些环境为 agent 提供可验证的反馈:agent 读取公开训练数据,对测试输入生成预测,并从 metric.py 获得标量奖励,从而实现后训练、测试时搜索和递归自我改进循环。
方法
作者通过将三种特定来源的路径映射为统一的执行任务包,构建了 OpenMLE-Gym。如下图所示,精选层次在精选基准、Kaggle 竞赛和 Kaggle 数据集之间平衡了质量与规模。对于竞赛衍生分支,自动化框架将 Kaggle 竞赛标识转换为标准化的执行包,并在可执行性验证后应用严格的语义质量关卡。最终的执行任务格式将 agent 可见的公开输入与隐藏的私有答案分离,并包含可执行工具以确保评分可复现。
为了训练用于进化推理的模型,作者将局部技能与搜索算法分离,通过训练一组紧凑且可复用的程序变换算子:Draft、Improve、Debug 和 Crossover。训练过程包括基于执行的监督热启动和随后的强化学习。
在监督热启动阶段,作者采用两条采样路径。并行路径独立采样并执行完整的 Draft 解决方案,而进化路径则在已执行的程序上应用 Improve、Debug 和 Crossover,以保留来自高质量局部轨迹片段的有用步骤。采集过程根据预算自适应规则停止,从而形成大规模 SFT 语料库。
在此热启动基础上,强化学习阶段聚焦于使异构结果可比较并集中学习信号。作者首先定义了一个有界基础奖励,然后从任务历史在策略分数前沿中推导出更紧的自适应边界,以保持分辨率。为进一步放大每个 rollout 组中靠近顶部的奖励差距,采用了熵优势,将更多学习信号引导至最佳候选。如下图所示,将熵加权与自适应边界结合,能够得到比此前奖励构建方法更强的平滑组最佳奖励轨迹。
在测试时扩展方面,作者引入了 OpenMLE-Evo,一个经验驱动的搜索框架,将执行结果转化为可复用的证据。搜索过程通过结构化经验积累维护对先前尝试的持久化表示。每个被评估的节点生成一个捕获来源和性能的节点级经验卡,这些卡被聚合到任务全局经验板上。
父节点选择由一个多因素效用函数引导,该函数结合了归一化验证分数、相对最强父节点的正向改进以及方法家族新颖性。一旦选定父节点,系统将延迟丰富的自然语言记忆合成,直到算子被调用时,检索相关祖先和兄弟节点,构建一个有界的、算子条件化的上下文。整体经验引导的搜索框架如下图所示,展示了经验卡元数据如何更新全局搜索状态,并为后续操作注入记忆信息。
实验
评估使用 22 个任务的 MLE-Bench Lite 划分,在固定 12 小时单 GPU 预算下进行,报告三次运行的 Valid Rate、Medal Average 和 Human Rank。基于执行的后训练相比基础模型大幅提升了性能,将其与领域特定的进化搜索框架结合,能够提炼跨任务先验,带来互补增益,超越强大的外部系统。具有结构化记忆和多因素选择的长程搜索将额外算力转化为超越首个可执行解决方案的持续改进,将解决方案质量提升至金牌水平,而非仅达到铜牌门槛。这些收益可跨输入模态迁移,并延伸至科学基准,在此后训练模型与适配搜索框架共同提升了相对论文的科学进展。
在 MLE-Bench Lite 上,采用 OPENMLE-EVO 框架的 Frontis-MA1-35B 系统显著优于其基础 Qwen 模型,在有效提交率、奖牌平均分和人类排名上均更高。OPENMLE-EVO-MAX 变体进一步提升了所有指标,实现了完美有效性并取得了最高的奖牌平均分。较小的 Frontis-MA1-30B 模型在相同指标上落后于 35B 配置。采用 OPENMLE-EVO 的 Frontis-MA1-35B 将奖牌平均分和有效提交率显著提升至 Qwen3.6-35B-A3B 基础模型之上。使用 OPENMLE-EVO-MAX,系统达到完美有效性(22/22)和 71.21% 的奖牌平均分,为对比中最高。人类排名从基础模型的 0.58 提升至 EVO 的 0.76,再提升至 MAX 变体的 0.81。较小的 Frontis-MA1-30B 模型在有效提交率、奖牌平均分和人类排名上均低于 35B 系统。
该对比评估了 Frontis-MA1-30B 和 GLM-5.2 在不同框架下的 MLE 基准表现。OPENMLE-EVO-MAX 为两个模型均带来了完美有效性和最高的奖牌平均分,而采用此框架的 GLM-5.2 获得了最高的人类排名。OPENMLE-EVO 框架的有效性较低,但仍能在 GLM-5.2 上相较于 Claude Code 基线提升奖牌平均分。OPENMLE-EVO-MAX 为 Frontis-MA1-30B 和 GLM-5.2 均实现了 22/22 的完美有效率和 66.67% 的奖牌平均分。使用 OPENMLE-EVO-MAX 的 GLM-5.2 获得了最高的人类排名(0.8164),略高于使用相同框架的 Frontis-MA1-30B(0.8053)。
在 10 个任务的 NatureBench Lite 上,最佳参考 agent 达到了 70% 的 Surpass-SOTA 和完美的 Match-SOTA。后训练的 Frontis-MA1-35B 相较于其基础模型在 Surpass-SOTA 和 Match-SOTA 上分别提升了 10 个和 20 个百分点,而仅适配搜索框架就分别贡献了 10 个和 30 个百分点的提升。模型与框架结合后可匹配多个强大的参考系统,这表明基于执行的后训练可以迁移到竞赛式机器学习工程之外的领域。Claude Opus 4.7 和 GLM-5.2 在 10 个任务子集上以 70% 的 Surpass-SOTA 和 100% 的 Match-SOTA 领跑参考 agent。Frontis-MA1-35B 将 Match-SOTA 较其基础模型提升了 20 个百分点,结合 OpenMLE-Evo 适配器后,性能与 GPT-5.4 和 GLM-5.1 持平。
在 MLE-Bench Lite 上的实验表明,OPENMLE-EVO 框架,尤其是其 MAX 变体,显著提升了 Frontis-MA1-35B 模型的有效性、奖牌平均分和人类排名,远超基础模型,实现了完美有效性和最高奖牌平均分;较小的 30B 模型表现落后。正面交锋对比证实,OPENMLE-EVO-MAX 为 Frontis-MA1-30B 和 GLM-5.2 均带来了完美有效性和最高奖牌平均分,其中 GLM-5.2 在人类排名上领先。在 NatureBench Lite 上,后训练的 Frontis-MA1-35B 与该框架结合后可匹配顶级参考 agent,验证了基于执行的后训练可以迁移到竞赛任务之外。