HyperAIHyperAI

Command Palette

Search for a command to run...

CyberFactory:基于真实环境实例规模化提升网络安全能力

摘要

随着大语言模型(LLM)在编码能力上的持续进步,其在网络安全领域的潜力引起了越来越多的研究关注,闭源 LLM(如 Mythos)已展现出先进的网络安全能力。然而,现有的开源工作仍存在局限:前沿的开源权重模型未能提供可复现的网络安全训练方案;开源训练方案聚焦于孤立任务,缺乏可扩展的智能体数据;而扩展智能体轨迹需要较强的领域先验。本文提出 CyberFactory,一个统一的开源框架,将概念验证(PoC)生成、漏洞修复和网络安全问答(CyberQA)中的数据构建、轨迹合成与模型训练连接起来。CyberFactory 将公开的漏洞工件(包括来自真实环境的 CVE)转化为可执行且可验证的任务实例。它进一步利用可复用的漏洞分析技能,引导教师模型进行源码检查、基于领域先验的问题求解以及基于证据的验证。由此产生的监督是智能体式的:模型与工具和目标环境交互,并根据执行反馈修正其解决方案。利用这些轨迹,我们训练并发布了 OpenAegis,该模型在推理时无需依赖该技能即可内化技能引导的流程。在 CyberGym 上,OpenAegis 在一小时预算下达到 58.1% 的 Pass@1,较其 Qwen 3.5 基座模型提升了 28.5 个百分点,并在相同框架下优于所评估的通用骨干模型。

一句话总结

北京航空航天大学等机构提出了 CyberFactory,一个统一的开源框架,将公开的 CVE 转化为可执行、可验证的任务实例,并合成技能引导的 agentic 轨迹,用于概念验证生成、漏洞修补和 CyberQA。由此得到的模型 OpenAegis 在一小时预算下于 CyberGym 上达到 58.1% 的 Pass@1,相较其 Qwen 3.5 基座模型提升 28.5 个百分点,并在相同 scaffold 下优于所评估的通用主干模型。

核心贡献

  • CyberFactory 是一个开源框架,将公开的 CVE 工件转化为可执行、可验证的任务实例,统一了概念验证生成、漏洞修补和网络安全问答的数据构建。
  • 一种可复用的漏洞分析技能引导教师模型进行源码检查、领域引导的探索和基于证据的验证,生成带有执行反馈的 agentic 轨迹,传授连贯的安全分析流程,而推理时无需使用该技能。
  • 由此得到的模型 OpenAegis 在一小时预算下于 CyberGym 上达到 58.1% 的 Pass@1,相较其 Qwen 3.5 基座模型提升 28.5 个百分点,并在相同 scaffold 下优于所评估的通用主干模型。

引言

大语言模型日益增长的网络安全能力既带来希望也带来风险,推动了对可复现方法的需求,以检查漏洞并自动化防御操作。先前的开源工作提供了强大的模型或孤立的任务覆盖,但缺乏统一、可复现的训练方案;它们没有提供可扩展的 agentic 数据,也未将领域特定的流程指导注入模型训练。作者提出了 CyberFactory,一个端到端的开源框架,将真实世界的 CVE 工件转化为可执行、可验证的实例,涵盖漏洞检测、补丁生成和网络安全问答。一种可复用的漏洞分析技能引导一个可与工具交互的教师 agent 进行源码检查、领域先验驱动的探索和基于证据的验证,生成有依据的监督轨迹。所得数据用于训练 OpenAegis,该模型内化了这一先验引导的工作流,并在 CyberGym 基准上达到 58.1% 的 Pass@1,显著优于规模更大的基线模型,且推理时无需使用该技能。

数据集

作者使用多种数据源为漏洞相关任务构建数据集,主要用于概念验证构建、补丁生成和问答。

  • PoC 构建实例

    • 来源:ARVO、OSS-Fuzz 和来自野外的 CVE。
    • ARVO 实例最容易创建,因为它们提供了补丁前和补丁后的 Docker 镜像以及真实 PoC。
    • OSS-Fuzz 实例仅提供引入漏洞的提交。作者使用二分搜索法定位对应的修复提交。
    • 来自野外的 CVE 最为困难。它们提供受影响的软件版本范围和元数据,如 CWE 类型。作者保留具有 CWE 类型的 CVE,从版本范围中定位修复提交,并使用补丁前版本作为漏洞镜像,补丁后版本作为修复镜像。
    • 一个 PoC 只有在补丁前构建中触发目标行为且在补丁后构建中不触发时,才被视为有效。
    • 在实例验证期间,作者过滤掉推理模型已经能够解决的实例,仅保留具有挑战性的实例。额外的漏洞特定信号(如漏洞类型或崩溃信息)仅用于验证,在数据合成和训练期间被丢弃。
  • PoC 实例的描述

    • 作者使用 LLM 对修复提交信息进行分类。
    • 高质量的提交信息直接保留。
    • 低质量的提交信息则利用漏洞特定证据和修复提交重写为漏洞描述。
  • 补丁生成数据

    • 补丁生成实例遵循与 CVE-Factory 相同的方法。
    • 使用来自 CVE 记录的漏洞修复语料和神经修复公式。
  • 问答数据

    • 问答数据采用答案优先的策略。
    • 可信答案来自执行衍生的结果(如崩溃位置和测试结果)、结构衍生的事实(如变更的函数和调用图关系)以及从权威报告中提取的文本答案。
    • 作者使用 LLM 评判器进行自动检查,以验证答案可追溯到来源、未在问题中泄露,并识别出唯一答案。
    • 模糊或无效的样本会重新生成一次或被丢弃。
  • 数据使用方式

    • PoC 构建实例用于创建可执行环境和相应的漏洞描述,作为提示。
    • 补丁生成数据用于构建补丁生成实例。
    • 问答数据用于提高问答任务中的可信度。
    • 提供的文本未指定具体的数据集大小、训练集划分比例或混合比例。

方法

作者引入了一个全面的数据合成流水线,以支持 OpenAegis 的训练。该流水线涵盖漏洞检测、漏洞修复和网络安全问答。

如下图所示:

这一端到端的工作流,称为 Cyber Factory,编排了从源适配到多任务训练和评估的全过程。

流水线从适配多样化的漏洞源开始,包括 ARVO、OSS-Fuzz 和野外 CVE。安全过滤器处理这些输入以生成标准化的证据。对于概念验证构建,作者通过配对补丁前和补丁后的 Docker 镜像来重建可执行实例。对于 OSS-Fuzz 漏洞,使用二分搜索法定位特定的漏洞修复提交。野外 CVE 经过三步流水线处理:保留具有通用缺陷枚举类型的 CVE,在受影响的版本范围内定位修复提交,并通过过滤掉基线模型已经能够解决的实例来验证实例。为生成高质量的漏洞描述,系统使用大语言模型对修复提交信息进行分类,并用漏洞特定证据补充低质量信息。

为确保数据可靠性,该框架实施了严格的质量校准。行为检查验证候选的概念验证输入是否在补丁前构建中触发目标漏洞,但在补丁后构建中不触发。难度检查过滤掉过于简单或无法解决的实例。对于补丁生成,作者建立在已有的漏洞修复语料库之上。在问答模块中,采用答案优先的策略以保证可信度。可信答案来源于执行结果、结构事实和权威报告。然后,基于 LLM 的评判器验证答案是否可追溯、未在问题中泄露且可唯一识别。校准之后,一个脱敏引擎处理私有证据(如崩溃位置和修复提交),生成脱敏且对 agent 可见的任务,包括代码、描述和可执行文件。

最后阶段专注于合成轨迹和训练模型。为防止 rollout 过程中的低效探索,作者编码了一种任务无关的漏洞分析技能。该技能引导模型检查目标、利用适当的测试技术,并在验证失败时修正其方法,通过监督微调将这些流程知识迁移到模型参数中。为处理接近 256K token 限制的长上下文,应用了一种结构化的压缩协议。当上下文使用率达到 90% 时,累积的轨迹被压缩成一个延续状态,保留已验证的证据、失败的尝试和待执行的操作,同时丢弃冗余日志。为概念验证生成、修补和问答合成的轨迹随后用于训练和评估 OpenAegis,涵盖多个网络安全任务。

实验

评估使用 CyberGym 任务,其中 agent 必须在一小时预算内,利用差分预言机,合成一个在补丁前构建中触发漏洞但在补丁后构建中不触发的概念验证输入。OpenAegis 基于 Qwen 3.5-397B-A17B,在使用漏洞分析技能生成的轨迹上进行微调,取得了最高的成功率,显著优于其基座模型和更大的通用 agent。分析表明,该技能引导教师模型产生系统性的探索与验证工作流,监督微调将其内化到 OpenAegis 中,从而在推理时无需该技能的情况下,实现更整合的工具使用、更强的插桩能力和更具选择性的提交。

OpenAegis 在评估模型中取得了最高的 Pass@1 (58.1%)。在 Qwen 3.5 主干上的专门化带来了 28.5 个百分点的提升,表明训练轨迹在基座检查点之外贡献巨大。该模型也优于更大的通用系统,尽管使用的参数更少,但分别超过 GLM 5.2 14.8 个百分点和 Kimi K2.7 6.4 个百分点。OpenAegis 取得了最高的 Pass@1 (58.1%),优于总参数量高达 1T 的模型。在相同的 Qwen 3.5 主干上进行微调,将 Pass@1 提升了 28.5 个百分点,是所有比较中最大的增益。OpenAegis 分别超过 GLM 5.2 和 Kimi K2.7 14.8 和 6.4 个百分点,同时使用的参数更少。

在 90% 利用率时压缩上下文,在所评估的策略中取得了最高的 Pass@1 和最低的上下文耗尽率。这一优势在需要超过 40 次工具交互的长周期任务上尤为明显,压缩执行显著减少了上下文耗尽导致的失败。调整触发阈值表明,90% 提供了一个实用的权衡点,因为更早的压缩会降低有效性,而更晚的压缩则难以为后续的工具调用留出足够空间。在 90% 上下文利用率时的压缩执行取得了最高的整体 Pass@1 (58.1%) 和最低的上下文耗尽率 (7.0%)。简单的截断表现最差,Pass@1 最低 (45.6%),上下文耗尽率最高 (24.5%)。在工具交互超过 40 次的任务上,与完整历史相比,压缩执行将 Pass@1 提升了 8.5 个百分点,并将上下文耗尽减少了 11.7 个百分点。在 80% 而非 90% 时触发压缩,导致 Pass@1 更低且上下文耗尽更高,确认 90% 是一个有利的操作点。

在推理时对 GLM 5.2 应用漏洞分析技能,即使每次技能引导的尝试仅获得四分之一的墙上时钟时间,也提升了 Pass@1。该比较使用了不使用技能的一次 60 分钟尝试和使用技能的五次 15 分钟尝试,因此并非计算量匹配。结果表明,这显著提高了合成吞吐量,而非等量计算下的改进。技能引导的 GLM 5.2 取得了更高的 Pass@1,尽管每次尝试时间更短,且每次尝试的运行时间仅为四分之一。不使用技能的条件使用了一次 60 分钟尝试,而技能引导的条件使用了五次 15 分钟尝试,因此增益反映的是合成吞吐量,而非等量计算下的改进。这一改进发生在数据构建期间,并未给 OpenAegis 引入推理时的依赖。

注入漏洞分析技能将模型从临时的直接尝试转变为系统性的领域引导探索和基于证据的验证。探索和验证的覆盖率几乎达到普遍,每条轨迹的调用次数呈数量级增长,而每次 shell 调用的操作数略有下降。使用该技能后,探索覆盖率从几乎为零跃升至几乎每条轨迹。验证覆盖率从接近零上升到几乎所有轨迹。每条轨迹的探索和验证调用次数急剧增加。每次 shell 调用的操作数略有下降,表明该技能并未直接驱动操作整合。

明确向教师模型提供领域技能极大地增加了每条轨迹的探索和验证调用次数。微调后的 OpenAegis 模型在推理时从未见过该技能,却表现出类似的高频模式,表明探索与验证工作流已通过训练被内化。在 GLM 5.2 中注入技能,将探索和验证调用从接近零提升到每条轨迹超过两次。OpenAegis 在推理时未接收该技能的情况下,达到了与技能引导的教师模型相当的探索和验证频率。基座模型几乎不进行探索或验证,突显了由技能引导和随后内化所驱动的行为转变。

实验在 Pass@1 和上下文管理方面评估了 OpenAegis,表明在 Qwen 3.5 主干上进行微调带来了巨大增益,并且尽管使用的参数更少,其性能优于更大的通用模型。在 90% 上下文利用率时的压缩执行取得了最佳的 Pass@1 和最低的上下文耗尽率,在需要大量工具交互的长周期任务上收益最大。推理时注入漏洞分析技能通过引导系统性的探索和验证提高了合成吞吐量,而微调后的 OpenAegis 模型在推理时无需该技能即内化了此行为。基座模型很少探索或验证,突显了由技能引导和随后训练带来的行为转变。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供