HyperAIHyperAI

Command Palette

Search for a command to run...

Agent
LLM

Repo-To-Skill:将 GitHub 仓库蒸馏为 AI4AI 技能

摘要

自主智能体正开始端到端地执行机器学习(ML)研究。这些智能体将模型主干与用于规划、执行、记忆和验证的框架相结合,但这种架构仍将领域特定的专有知识置于智能体之外。我们将这一缺失的层次称为操作知识,即区分“了解一个方法”与“使其真正奏效”的诀窍。这类知识并非不存在于该领域中,它出现在代码仓库和论文中,但形式是为人类读者编写的,且体量过大,无法在任务执行期间加载。一旦被蒸馏为紧凑且经过验证的技能,这些知识便可在不同任务间复用,而无需在每次运行时重新发现。我们提出了 DisCo,一个由技能驱动的研究智能体,它能够创建技能并在研究过程中使用它们。其蒸馏过程以两种互补的形式进行:任务无关蒸馏,将领域内广泛使用的仓库浓缩为可复用技能;以及任务导向蒸馏,生成具体任务所需的技能。前者应用于整个开放生态系统,产生了 AREX-Skill 库,其中包含从 1000 个广泛使用的 ML 仓库中蒸馏出的 5000 余项经过验证的技能,并组织为 20 个领域和 178 个能力族。在固定使用 GPT-5.5 主干、研究框架和下游执行预算的条件下,配备技能的智能体在 MLE-bench 上的得分比无技能的同一智能体高 134.3%,在 PaperBench 上高 34.4%,在 FrontierCS 上高 9.2%,在 PassNet 上高 14.0%。这些提升源于在固定设置下增加了蒸馏后的操作上下文。

一句话总结

北京智源人工智能研究院等机构的研究者提出 DisCo,一种由技能驱动的 research agent,它将 GitHub 仓库蒸馏为可操作的技能,构建了包含来自 1,000 个机器学习仓库的 5,000 余项已验证技能的 AREX-Skill Library,使 agent 在 MLE-bench 上的性能提升 134.3%,在 PaperBench 上提升 34.4%,在 FrontierCS 上提升 9.2%,在 PassNet 上提升 14.0%(均相对于无技能的 agent)。

核心贡献

  • 论文将操作知识引入为自主机器学习 research agent 所缺失的一个层面,并提出 DisCo 方法,该方法将版本特定的实践知识从静态制品(论文与仓库)蒸馏为可复用、已验证的技能图,agent 可将其作为操作上下文加载,而无需更改模型主干或研究框架。
  • DisCo 的蒸馏以两种互补模式运行:任务无关过程将广泛使用的机器学习仓库浓缩为技能,任务导向过程则为特定研究任务生成技能;前者规模化后形成 AREX-Skill Library,包含来自 1,000 个仓库的 5,000 余项已验证技能,并组织为 20 个领域和 178 个能力族。
  • 在固定的 GPT-5.5 主干和匹配的下游执行预算下,配备技能的 agent 在 MLE-bench 上得分提升 134.3%,在 PaperBench 上提升 34.4%,在 FrontierCS 上提升 9.2%,在 PassNet 上提升 14.0%(均与同一无技能的 agent 对比),表明添加蒸馏操作知识可显著增强自主研究性能。

引言

用于机器学习研究的自主 agent 通常由大语言模型和协调推理与执行的框架构成,但这两个组件都缺少选择合适方法、正确配置工具及避免常见陷阱所需的领域特定操作知识。这一缺失层面迫使 agent 在试错上浪费执行预算,并阻碍其跨任务复用洞见。作者将操作知识确定为关键缺失成分,并引入 DisCo,一种由技能驱动的 agent,将此类知识从现有仓库和论文蒸馏为紧凑、已验证的技能。通过为固定模型和框架配备这些技能,在 MLE-bench 和 PaperBench 等基准上实现了显著的性能提升,表明仅操作知识就能大幅增强自主研究能力。

数据集

作者引入了 AREX-Skill Library,一个供 DisCo 系统使用的持久化操作知识图谱存储库。该库围绕三类来源锚点组织:1,000 个机器学习仓库的精选快照、论文衍生的技能图以及任务导向的技能图。下文详述其构成、处理与使用方式。

  • 仓库衍生技能

    • 来源与范围: 1,000 个开源机器学习仓库,根据可见性与实际效用(如 GitHub stars 等信号)选取。集合涵盖模型实现、训练与部署系统、数据/评估工具及科学软件。
    • 图谱构建: 对每个仓库,DisCo 使用高推理努力的 GPT-5.5 和 GPT-5.6-sol 构建经过验证的技能图(平均成本约每个仓库 40 美元)。证据边界包括源代码、文档、示例、测试、脚本和配置文件。图谱将支持的工作流分解为数据准备、训练、推理、评估、部署、故障排除或维护等技能,并附带保留执行细节的引用和脚本。
    • 验证与过滤: 纳入前,每个图谱均通过断言支持案例、仓库原生示例、测试、命令行检查、微小夹具检查或冒烟脚本进行检验。归因于图谱的失败会触发本地修复并重新运行。最终在 1,000 个图谱中产生 5,353 项技能
    • 分类与路由: 基于简短仓库摘要(排除 stars、URL 和已有类别)归纳出两级能力分类体系(20 个领域和 178 个族)。分类体系在最终分配前固定。随后,每个已验证图谱根据确切的领域到族路径进行分类,分配需提供理由、仓库证据和置信度。仅基于关键词、仅依赖、可选集成和仅示例的匹配均被拒绝。一个仓库可属于多个族;共记录 2,209 条确切分配,其中 700 个仓库出现在多个族中。基于这些分配生成的路由器在使用时实现渐进式信息披露。
  • 论文衍生技能

    • 来源: 153 篇被选为 20 个 PaperBench 目标相关工作论文。每篇论文被分解为模块级技能,涵盖方法组件、数据/评估流程及实现工作流。
    • 构建与过滤: 每个模块均独立检查,随后进行排除原始实现仓库的有界恢复实验。由此产生 636 项论文衍生技能。目标论文及其发布制品被排除在技能来源之外;相关工作上下文决定每个目标可获取哪些源论文技能。所得技能在目标任务之外仍可复用。
  • 任务导向技能

    • MLE-bench: 为 75 个任务各构建一个描述性图谱,通过任务分解、来源发现及有界诊断试验完成。排除竞赛特定内容。
    • FrontierCS: 一个面向恢复的单一图谱,供所有 188 个 Agent Track 任务共享。
    • PassNet: 一个基准级图谱,涵盖 FX 图检查、模式匹配、语义保持重写、Triton 实现及性能诊断。
    • 所有任务导向图谱均通过任务分解与诊断试验构建,细节见附录。
  • 库的使用方式

    • 该库作为 DisCo 的操作知识存储。Creator 模式将接受的技能图写入库中;Researcher 模式检索任务相关分支作为操作上下文。
    • 研究过程中,模型从路由器描述开始,沿相关领域到族路径,打开所选仓库图谱,并仅加载当前步骤所需的技能、引用或脚本。当不同图谱提供不同能力时可打开多个,但若无族紧密匹配则不强制路由。这种渐进式信息披露确保仅所选分支进入操作上下文。

方法

作者提出 DisCo,一个将操作知识实例化为技能层的框架,以弥合模型广泛先验与研究任务具体程序需求之间的差距。DisCo 作为单一 research agent 运行,具有两种不同模式:Creator 模式与 Researcher 模式,共享相同的主干模型和框架。

参考框架图:

在 Creator 模式下,agent 执行技能蒸馏,将声明性源知识转换为可执行的操作知识。无论由何种锚点启动,该过程均遵循四阶段流水线。首先,agent 界定能力范围,确定应从源材料中暴露哪些技能。其次,收集并过滤相关文档、代码或论文以夯实证据。第三,通过将工具封装在稳定接口后并组装为结构化格式,构建候选技能图。最后,通过断言支持检查与任务试验验证并优化图谱,记录任何未解决的缺口。蒸馏可以是任务无关的,此时锚点为仓库或论文等来源;也可以是任务导向的,此时锚点为特定问题,agent 主动寻找缺失的能力。

操作知识被结构化为技能图 G=(S,L)\mathcal{G} = (\mathcal{S}, \mathcal{L})G=(S,L),其中每个技能 SSS 组织为三层:知识接口(SKILL.md)提供标准操作流程与路由逻辑,知识基底(references/)包含更深入的 API 与算法细节,执行接口(scripts/)包含可执行包装器。这种分离确保 agent 仅加载必要信息。

在 Researcher 模式下,agent 通过从 AREX-Skill Library 获取操作知识 K\mathcal{K}K 来求解任务 τ\tauτ。作者采用渐进式信息披露原则以高效管理上下文。agent 并非加载整个图谱,而是首先查阅路由器或入口技能以识别相关分支,然后仅打开当前步骤所需的特定技能,并根据需要跟踪设置、评估或修复的链接。这使框架保持对规划与执行的控制,同时技能图提供选择性的、任务特定的操作上下文。

AREX-Skill Library 作为连接两种模式的持久化存储。它按来源锚点组织蒸馏后的技能图,涵盖数千个仓库、论文和基准任务。为便于高效检索,库利用两级能力分类体系及生成的路由器。

如下图所示:

库路由器将请求从宽泛领域缩小到具体包族,再到单个仓库图谱,最终定位相关技能。这种结构化检索路径确保 agent 继承蒸馏后的操作知识而无需重新推导,使系统在多样化的机器学习领域可扩展。

实验

在四个不同的基准上,将 DisCo 蒸馏的技能作为操作上下文添加到固定的 Codex agent 中,持续提升性能,在更困难的任务及基线 agent 表现挣扎的任务上增益最大,同时减少失败与错误结果。提升并非仅由资源使用增加所致,配备技能的 agent 超越了强基线,表明外部化操作知识在不改变 agent 主干或框架的情况下显著增强机器学习研究能力。

为 Codex agent 添加蒸馏操作技能大幅提升其在 MLE-bench 上的表现,整体 Any-Medal 得分从 31.11% 升至 72.89%。这一增益在所有难度层级均一致,且在 High 难度任务上最大,相对提升达 366.8%。配备技能的 Codex 还以 8.45 个百分点超越最强公开基线,且未修改 agent 主干或执行框架。配备技能的 Codex 整体 Any-Medal 得分为 72.89%,较无技能基线提升 41.78 个百分点。提升在 High 难度任务上最显著,得分从 13.33% 升至 62.22%。技能使 Codex 整体超出最佳公开基线 8.45 分,在 High 任务上优势最大(15.55 分)。相对增益随任务难度增长,表明蒸馏知识对复杂机器学习问题尤其有价值。

为 GPT-5.5 Codex 配备蒸馏技能使 PaperBench 平均复现得分提升 10.14 分,相对提升 34.4%。增益广泛,出现在 20 个任务中的 18 个上,且在基线 agent 挣扎的任务上最大,有时得分翻数倍。少数得分较高的任务略有回退,与偶尔的检索精度失败一致,这些失败干扰了有效的无辅助策略。添加技能后,平均复现得分从 29.45% 升至 39.59%,相对提升 34.4%。技能在 18/20 任务上提升性能,在低基线任务如 ftrl(从 1.50 到 17.17)和 rice(从 7.94 到 48.51)上相对增益最大。两个基线得分高于平均的任务回退(samplespecific-masks 和 stay-on-topic),表明检索到的技能内容偶尔可能误导 agent。配备技能的 agent 在取得更高得分的同时,使用的 token、步骤和工具调用量远低于 Claude Code 配置,在排行榜上 Pareto 占优。

为 Codex 提供蒸馏技能图使其 FrontierCS Agent Track 得分从 70.63 升至 77.14,绝对提升 6.51 分,相对提升 9.22%。该配备技能的 Codex 取得最高总分,同时使用的 token、步骤和工具调用量远低于 Claude Code 参赛方案,并特别提升了无引导探索困难的任务表现。将冻结的技能图添加到 Codex 后,188 个任务中的 74 个性能提升,提升任务平均增益 22.23 分,退化任务平均损失 8.76 分。最大收益出现在无技能得分低于 50 的任务上,均值从 19.43 升至 45.99,30 个任务跨过 50 分门槛。配备技能的 Codex 取得最高分(77.14),每任务仅使用 4.47M token,而得分更低的 Claude Code 配置使用超过 13.8M token。得分增益与额外资源使用基本不相关(Spearman ρ ≤ 0.015,针对 token、步骤和工具调用),表明技能在原始规模之外提升性能。

为 Codex 配备蒸馏的 PassNet 技能显著改善图编译器 pass 生成。技能提升综合得分、正确性和加速比,同时减少失败样本,使 agent 超越其无引导对应版本及 TorchInductor 编译器基线。添加蒸馏技能使 AS Score 相对无技能 Codex 基线提升 14%。失败样本从 14 降至 5,减少 64%,正确性从 81% 升至 91%。配备技能的 Codex 取得高于 TorchInductor 的综合得分(1.5313 vs. 1.419)。几何平均加速比从 1.5891 升至 1.6688。

在四个不同的基准上,为 Codex agent 配备蒸馏技能持续提升性能,在基线挣扎的复杂任务上相对增益最大。配备技能的 agent 超越强公开基线和 Claude Code 配置,同时使用的 token 和工具调用量大幅减少,表明蒸馏操作知识在原始规模之外提升能力。增益广泛,但偶有回退表明检索不精确可能在少数任务上误导 agent。总体而言,这些实验验证了融入蒸馏技能图和操作模式显著增强 agent 解决具有挑战性的机器学习工程与研究问题的能力。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供