HyperAIHyperAI

Command Palette

Search for a command to run...

Agent
LLM

Raven:面向可组合智能体智能的“框架之框架”

摘要

随着大语言模型的发展,AI 智能体正从孤立的、领域特定的任务走向长程、跨领域工作流。这一转变暴露出两个挑战:日益增加的 harness 复杂性使人工设计难以扩展,而与特定领域更紧密的耦合限制了单个 harness 的通用性。核心问题因此从“如何为某一领域设计更强的 harness”转变为“如何自主构建专用 harness、通过经验改进它们,并在跨领域场景中进行编排”。我们提出 Raven,即“框架之框架”(The Harness of Harnesses),一个开源多智能体生态系统,可针对特定模型和领域自动构建并演化模块化 harness,将每个可执行的“模型–harness” 对视为可组合的智能单元。为支持全域协作网络(All-Domain Collaboration Network),其 Host Agent 对目标进行分解、将子任务匹配给专用智能体、协调执行依赖并整合结果;同时,host archive 与 EverOS 保存跨任务经验,Skill Forge 则将这些经验转化为可复用的流程。我们的理论给出了充分条件,证明在共享资源预算下,此类组合能够将可靠任务覆盖范围扩展到超出任意可用单个智能体的覆盖范围。在复杂且长程的任务上,Raven 显著优于当前最先进的智能体系统,推动了可组合智能体智能的前沿。

一句话总结

EverMind AI 的研究人员推出了 Raven: The Harness of Harnesses,一个开源多 agent 生态系统,该系统自主构建并演化模块化的模型-领域 harness,将其作为可组合的智能单元;使用 Host Agent 分解目标,将子任务匹配到专门的 agent,协调执行依赖,整合结果,同时由 EverOS 和 Skill Forge 保存并复用经验;并在共享资源预算下提供了扩展可靠任务覆盖范围的充分理论条件,在复杂长时程任务上显著优于当前最优 agent 系统。

核心贡献

  • 提出了 Raven,一个开源多 agent 生态系统,自动为特定模型和领域构建并演化模块化 harness,将每个可执行的模型-harness 对视为可组合的智能单元,并使用 Host Agent 分解目标,将子任务匹配到专门 agent,协调执行依赖,整合跨领域结果。
  • 提出一个理论框架,给出充分条件,说明在共享资源预算下,组合这些模型-harness 单元能够扩展可靠任务覆盖范围,超过可用单个 agent 的覆盖范围,同时考虑规划与协调成本。
  • 在 MAOB 上,Raven 在两种受测 backbone 下均在全部四项规划指标上排名第一,Exact Match 相较最强 baseline 分别提高 10.4 和 10.5 个百分点;HarnessBank 实验证明了 harness 自适应带来的收益,SkillCorpus 实验表明经过整理的技能库在三个基准上提升了 Raven,其中两个基准的增益大于 OpenClaw。

引言

作者们解决的问题是协调基于 LLM 的 agent,这些 agent 依赖不同工具、执行策略和专门 harness 来完成复杂的多阶段任务。agent 的实际能力不仅取决于其模型,还取决于其 harness,包括工具接口、上下文管理、技能和恢复机制。先前方法在手工 harness 设计上面临扩展挑战,并因专门 harness 对工具、输出和交接的假设而难以实现组合,而多 agent 系统常常存在 agent 间对齐不足和任务验证不充分的问题。作者们提出了 Raven,一个开源多 agent 生态系统,将每个模型-harness 对视为组合单元。Host Agent 将子任务匹配到已注册的原生或第三方 agent,将依赖关系表示为有向无环图,并协调执行,而模块化 harness 演化、持久记忆和技能复用支持跨任务自适应。作者们还从理论上说明了组合何时能扩展可靠任务覆盖范围,并引入了多 Agent 编排基准 MAOB,用于评估编排规划。

数据集

数据集描述涵盖两个组成部分:

SkillCorpus 与 SkillHub 技能目录

  • 来源:SkillCorpus 通过来源注册表聚合公共技能。SkillHub 是 Raven 查询的实时技能目录。固定参考版本包含 96,401 个活跃技能。
  • 记录模式:每个技能包含来源原生 ID、显示名称、适用性/触发描述、程序主体、捆绑资源和元数据。在 SKILL.md 中,名称和描述为 frontmatter,程序为 Markdown,可选目录保存脚本、参考资料或资产。
  • 整理流水线:六个阶段依次解析条目、过滤格式错误或长度不合格的条目、去重、分配质量和问题标记、执行发布准入,并附加来源先验、embedding 和索引条目。
  • 去重:使用内容和名称指纹,再使用 1,024 维语义 embedding。余弦相似度高于 0.995 时触发自动合并;在 (0.90, 0.995] 区间内的配对交由 LLM 裁定。
  • 发布与质量:实用性、鲁棒性和安全性按 0 到 10 评分,并归一化到 0-1。硬标记包括提示注入、命令注入、不安全执行、认证绕过和 CSAM 风险。准入要求许可证通过、无恶意软件匹配、无硬标记,且安全性至少为 0.3。19 个问题标记用于限制质量维度。对于准入技能,内容质量是 0.50 实用性、0.35 鲁棒性和 0.15 安全性的加权和,并按安全性进行衰减;结构奖励为 scripts 目录加 0.05,为 references 目录加 0.02。综合质量结合 0.85 内容质量、0.15 来源先验和结构奖励,并进行截断。每个发布技能获得 16 个任务领域标签之一。
  • 检索使用:语料提供 Qwen3-Embedding-0.6B 检索模型和 Qwen3-Reranker-0.6B 重排器。检索字段从每个正文精简到 3,000 个字符。参考栈召回并重排候选,然后由 LLM 选择器返回零到两个技能。Raven 合并多个来源,并将受限正文摘录提供给其选择门。

多 Agent 编排基准(MAOB)

  • 来源与规模:140 个请求以职业任务为模型,来自 137 个不同职业和 140 个模板。模式提取使用公开职业任务集合 GDPval 和 JobBench,但不复用任何任务文本。
  • 组成:每个请求配有一个经审核的参考有向无环图,图包含四类专门子 agent:research、coding、content 和 oncall。基准包括全部 11 个至少包含两个领域的子集。参考图平均有 2.72 个节点和 1.84 条边,总共有 257 条参考边。98 个任务为纯串行,42 个允许并行执行。领域频率为 content 106、research 103、coding 102、oncall 70。按子集规模看,66 个任务跨两个领域,47 个跨三个,27 个跨四个。
  • 构建:生成过程以图为先。参考 DAG 在请求文本之前确定。参考图使用 Claude Opus 5 编写;请求根据图使用 GLM-5.2 生成。泄漏过滤器拒绝直接枚举步骤或明确命名领域的请求。
  • 质量控制:自动检查拒绝不一致的规范、角色边界违规和字段不一致。进一步处理会删除请求中无依据的参考节点,然后从传递闭包重构边。专家评审记录节点集一致性、顺序歧义以及请求元素到节点的归因。
  • 用途:MAOB 用于评估多 agent 编排,通过衡量 Host Agent 提出的图与经审核参考图之间的一致性。所有请求均为自包含文本,不包含附件。

方法

作者们提出 Raven,一个通过 Host Agent 在共享资源预算下控制分配、信息交换和执行,从而组合可执行模型-harness 对的系统。

如下图所示:

框架形式化了可组合的 agentic 智能,其中模型及其 harness 构成一个可调用的执行单元。host 协调异构 agent,例如研究、代码和设计专家,管理显式的产物交接和控制流。

对于任务分解,host 使用分阶段的编排引导。初始只携带引导的摘要,仅当请求需要多个 agent 时才加载完整引导。然后 host 组成一个带类型的依赖图。

参考框架图:

图规划与准入过程确保结构一致性和能力一致性。一次提交包含一个扁平节点列表和图层级标记。运行时在分派任何 worker 之前执行五项顺序检查,覆盖格式、图结构、agent 能力、状态和环境约束。被拒绝的图返回第一个错误,并附带指向引导的指针,以便 host 重试。

一旦图被准入,系统进入由 host 中介的图执行。

如下图所示:

节点生命周期规定,一个节点只有在所有前驱节点完成并稳定后才会运行。一次独立的 LLM 调用对输出和 transcript 末尾进行判断。负面判定使节点进入异常状态挂起,促使 host 决定继续、放弃或重新规划。此外,如果 worker 提出澄清请求,host 会尝试使用当前对话和记忆自动填写答案,然后再转交给用户。

产物和记忆流通过文件支持的记录进行管理,以避免上下文重复。

参考框架图:

节点的 prompt 由其模板、上游输出、记忆路径和文件渲染。运行时将 prompt、输出和 transcript 写入磁盘,同时记忆记录异步进行。已完成节点进入会话级节点注册表,使后续图能够引用先前输出,并使单次委托能够继续现有 agent 实例。

为了纳入跨轮次的更广泛反馈,系统使用共享组记忆层。

如下图所示:

host 充当唯一的代理,调解对按所有者分区的库的访问。在规划前检索经验,并存入轮次摘要。分派时,host 为 worker 预取共享经验和最近的判定。评估分两阶段进行:即时判定在执行后立即根据从 host 回复中提取的归因块生成,反馈判定在下一用户轮次创建,以根据用户反应修正结果。

除编排之外,作者们设计了模块化 harness 自演化机制。围绕冻结模型的策略通过用于记忆、规划、能力和动作的策略接口暴露。Evolver Agent 从评估日志中诊断执行失败并提出补丁,补丁通过配对改进统计进行筛选,然后保留在语义基因库中。同时,Skill Forge 模块从经过整理的目录和本地记忆中检索可复用程序,而经验驱动的流水线提取执行案例,以增量聚类并更新技能,用于未来任务。

实验

评估考察 Raven 在编排规划、harness 自演化、四个专门工作流和程序性技能复用方面的表现。规划在受控 backbone 下的多 Agent 编排基准上单独评测,Raven 始终比 baseline 产生更好的专门 agent 选择和依赖结构。harness 自演化在冻结模型下提升了七个基准上的 held-out 性能,而 research、coding、design 和 oncall 专门 agent 在领域任务上均优于更强的 baseline,通常资源使用相当或更低。技能检索实验进一步表明,当程序被添加到固定 harness 和 backbone 时,收益持续存在,且 Raven 将相同的检索技能转化为比对照 harness 更大的改进。

在两个受测 backbone 上,Raven 在所有四项多 agent 编排指标上均优于最佳同 backbone baseline。DeepSeek-V4-Flash-0731 取得最强的绝对 Node F1、Edge F1 和 Exact Match Rate,而 Qwen3.8-27B 取得最强的 Partial Order Accuracy 和最大单项指标增益。Exact Match Rate 在两个 backbone 上都是得分最低的指标,且每种情况下约提升 0.10。Raven 在 Qwen3.8-27B 和 DeepSeek-V4-Flash-0731 上均改善了全部四项报告指标,超过最佳 baseline。DeepSeek-V4-Flash-0731 在绝对 Node F1、Edge F1 和 Exact Match Rate 上领先;Qwen3.8-27B 在 Partial Order Accuracy 上领先。最大绝对增益来自 Qwen3.8-27B 的 Partial Order Accuracy,而 DeepSeek-V4-Flash-0731 在 Node F1 上增益最大。Exact Match Rate 在两个 backbone 上仍是最弱的绝对指标,两个模型的增益几乎相等。

在多 agent 图分派之前,Raven 对格式、图结构、agent 能力、agent 状态和运行时环境执行准入检查。这些检查捕获格式错误的参数、无效或循环依赖、缺失占位符支持、未授权路径使用、不可用 agent 以及不允许的委托状态。验证在第一次失败时停止,并返回指向编排引导的指针。准入检查分为格式、图结构、agent 能力、agent 状态和环境类别。图结构验证拒绝重复或先前使用过的标识符、未解析依赖、无支持的输出占位符、无效路径形式和循环。agent 能力规则将共享实例限制为有状态 agent,将技能覆盖限制在实例链的头部,并阻止向没有本地文件访问权限的 agent 传递路径参数。第一个失败的检查会停止验证,并引导调用方查阅编排引导进行修复。

在组记忆层中,访问集中在 host 中,host 可以读写自己的共享库和每个已映射 agent 库,但无法访问用户库。已映射 worker 通过预取获得对 host 库和自己判定的只读访问。未映射 agent 无法访问这些组记忆库。host 对共享 host 库和所有已映射 agent 库具有读写访问权限。host 和已映射 worker 无法访问用户库。已映射 worker 对 host 库和自己的判定获得只读预取访问。未映射 agent 无法访问 host 库、用户库或 agent 库。

该基准覆盖了四领域名单中至少两个专门领域的所有可能组合,涵盖两领域、三领域和四领域任务。大多数任务涉及两个领域,少数任务需要三个领域,最少需要全部四个领域。该套件共包含 140 个任务,跨 11 个不同的领域组合。全部 11 个可能的至少包含两个领域的子集均被覆盖。两领域任务最常见,其次是三领域和四领域任务。基准总共包括 140 个任务。

在 DeepResearch Mixed 上,Raven-Research 在所有共享 backbone 下均取得所比较研究 harness 中最高的合并准确率。其相对最强 baseline 的领先幅度约为三到八个百分点,大多数配对比较具有统计支持。优势集中在 BrowseComp 和 Humanity’s Last Exam,而 FRAMES 上的结果接近,DeepSeek-Harness 在 xBench-DeepSearch 上表现更好。Raven-Research 在每个共享 backbone 组内的合并准确率均排名第一。配对统计检验在六项同 backbone 比较中有五项支持 Raven-Research,剩余一项的比较结果仍为正。基准级增益集中在 BrowseComp 和 Humanity’s Last Exam;在 xBench-DeepSearch 上,DeepSeek-Harness 略有领先。

实验评估了 Raven 在多 agent 编排、准入验证、组记忆访问控制、基准覆盖和研究 harness 准确率方面的表现。Raven 在全部四项编排指标上优于最佳同 backbone baseline,exact match 仍是最弱指标,而准入检查在分派前捕获格式、图结构、agent 能力、agent 状态和环境错误。组记忆访问被集中强制执行,因此 host 对共享库和已映射 agent 库具有读写访问权限,已映射 worker 获得只读预取访问,未映射 agent 无访问权限。基准覆盖 140 个任务,涵盖两到四个专门领域的所有 11 种可能组合,并且 Raven-Research 在每个共享 backbone 组内取得最高合并准确率,增益集中在 BrowseComp 和 Humanity’s Last Exam。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供