Command Palette
Search for a command to run...
Omni-IO Skills:驾驭智能体全原生能力
Omni-IO Skills:驾驭智能体全原生能力
Yanlin Li Mingyang Hao Shengqiong Wu Hao Fei Mong-Li Lee Wynne Hsu
摘要
通用智能体能够进行长程规划、推理和行动,但其在文本、图像、音频、视频、文档、3D 资产和代码上的产出能力仍然相互割裂。将基础模型扩展至更多模态会使能力增长受制于高昂的模型更新成本,而组合专家模型与工具仍无法解决流程、依赖关系、中间资产以及跨轮次修订应如何协同的问题。我们提出 Omni-IO Skills,一个即插即用的 Agent Harness(智能体驾驭框架),它通过分层技能(Skills)、标准化多模态执行接口、依赖感知编排和持久化资产注册表,使现有智能体具备全原生(omni-native)能力。多资产工作流被表示为声明式执行图(Declare Execution Graphs),这些执行图并发调度相互独立的操作,并将成功输出注册为资产,供下游及跨轮次在可替换的执行后端中复用。该框架的 27 项技能覆盖 38 个代表性任务,横跨七种产物模态和四类能力:理解、生成、推理与检索。在 UniM-90 上,该框架将 GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率分别从 40.00% 和 38.89% 提升至 100%,同时将二者的相对语义–质量耦合得分分别从 26.99 提升到 74.94、从 27.82 提升到 77.78;严格结构得分分别达到 100.00 和 99.78。这些结果证明,框架级能力组合是在不改变宿主智能体推理核心的前提下构建广泛且可演进的 Omni 系统的实用路径。
一句话总结
新加坡国立大学和牛津大学的研究人员提出 Omni-IO Skills,这是一个即插即用的 Agent Harness,它结合了分层 Skills、标准化多模态执行、通过 Declare Execution Graphs 实现的依赖感知编排,以及持久化 Asset Registry;其 27 个 Skills 覆盖七种模态的 38 个任务,并将 GPT-5.6 Sol 和 Claude Sonnet 5 在 UniM-90 上的输入支持率从 40.00% 和 38.89% 提升到 100%。
核心贡献
- Omni-IO Skills 是一个即插即用的 Agent Harness,在不改变通用 agent 推理核心的情况下,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,使通用 agent 具备全模态原生能力。
- 它将多资产工作流表示为 Declare Execution Graphs,可并发调度独立操作,并在可替换的执行后端中注册成功输出,供下游和跨轮次复用;其 27 个 Skills 覆盖七种工件模态的 38 个代表性任务,以及四类能力:理解、生成、推理和检索。
- 在 UniM-90 上,Omni-IO Skills 将 GPT-5.6 Sol 和 Claude Sonnet 5 的输入支持率从 40.00% 和 38.89% 提升到 100%,将相对 Semantic-Quality Coupled Score 从 26.99 提升到 74.94,以及从 27.82 提升到 77.78,并达到 100.00 和 99.78 的 Strict Structure Scores。
引言
现实世界的 Omni 工作流涵盖讲座录音、文档、视觉设计、幻灯片、音频、视频、3D 资产和代码,因此 agent 必须接收和生产交错的多模态内容,同时保持语义和资产连续性。Omni 基础模型改善了统一理解与生成,但将更多模态扩展到同一骨干网络会在表示、目标、tokenization、保真度和更新周期之间产生权衡。Codex 和 Claude Code 等通用 agent 提供了较强的推理和规划能力,但其端到端生产界面仍以软件和知识工作为中心;而模型协调系统和 Agent Skills 可以委托给专家或打包流程,但尚未完全解决能力选择、工件传递、故障隔离和跨轮次恢复。作者提出 Omni-IO Skills,这是一个即插即用的 Agent Harness,保持宿主 agent 不变,并增加分层 Atomic、Expert 和 Scenario Skills、依赖感知执行、可替换后端和持久化 Asset Registry,使现有 agent 无需重新训练即可完成多模态工作流。
方法
作者设计 Omni-IO Skills 以处理面向应用的任务,其中源材料、中间资产和交付物横跨多种媒体类型。系统支持跨模态理解、生成、推理和检索,覆盖七种工件类型:文本、图像、视频、音频、文档、3D 和代码。箭头左侧的图标表示输入,右侧的图标表示输出,用于说明任务如何消费或产生多种工件类型。
为管理这些复杂工作流,系统采用位于宿主 agent 与外部多模态工具之间的四层架构。该结构分离任务知识、工具接口、服务实现和持久化输出,使宿主 agent 能够规划多模态任务,而无需将应用工作流绑定到特定服务提供方或工作区路径。
Skill Entry 层向宿主 agent 暴露统一的任务接口。它根据任务粒度和组合范围,将可复用的过程性知识组织为三个层级。
Atomic Skills 执行单一的、可独立调用的操作。Expert Skills 面向特定最终交付物,将多个原子操作组织成完整工作流,例如海报设计或复杂视频制作。Scenario Skills 处理更广泛的应用场景,确定所需交付物,并协调相应的 Expert 或 Atomic Skills。
所有层级的 Skills 都遵循共享的声明式表示 s=⟨cs,Is,Ps,Os,Hs⟩,其中 cs 描述适用条件,Is 和 Os 定义输入与输出,P 记录执行过程,Hs 标识与其他 Skills 的关系。收到请求后,系统选择相关 Skill 并递归展开,直到步骤可执行为止。高层级 Skills 会被其组成的低层级 Skills 替代,从而形成 Declare Execution Graph (DEG)。
MCP Tool Service 层将语义化任务规范转换为标准化可执行操作。它将外部能力归为理解、生成和实用工具。每个外部执行的 DEG 节点通过统一契约提交,其中包含其任务类型、prompt、参数以及依赖已解析的资产输入。该层还定义外部工具执行与宿主原生执行之间的边界,确保两种路径遵循相同的依赖语义。
Provider and Configuration 层将工具能力与用于执行该能力的具体服务实现分离。对于每个任务类型,它维护对应工具、服务提供方、模型、凭据、默认参数和回退策略的绑定。这种分离允许在不重写 Skills 所编码过程性知识的情况下进行实现层替换。
Asset Registry 为所有工件提供共享数据抽象。已注册资产表示为 a=⟨asset_id,type,subtype,path,description,params,turn_id,source_asset_id⟩。该全局唯一标识符使上层能够独立于物理文件路径引用资产。记录持久化在一个仅追加的 JSON registry 中,以保持可追溯性并支持跨轮次复用。
运行时工作流同时组织控制流与资产流。收到用户请求后,Skill Entry 层选择并展开 Skills 为可执行任务,并将这些任务实例化为 DEG 中的节点。
执行前,DEG 会进行结构验证,确保所有依赖均可解析且图为无环图。有效图按连续的 Waves 调度。所有前驱节点均已完成且处于待处理状态的节点组成下一个 Wave,从而使相互独立的节点能够并发执行。对于每个可执行节点,MCP Tool Service 选择合适的工具,Provider and Configuration 层解析具体的服务提供方和参数。上游输出被注入为下游任务的输入。节点成功完成后,其输出被注册到 Asset Registry,可供下游节点或未来请求使用。
实验
评估在 UniM-90(覆盖文本、图像、音频、视频、文档、代码和 3D 任务的多模态子集)上,比较了使用和不使用 Omni-IO Skills 的 GPT-5.6 Sol 与 Claude Sonnet 5。添加 Omni-IO Skills 使两个 agent 都能处理所有输入模态,并在语义质量、交错一致性和输出结构方面带来一致提升。关于艺术教程生成和产品推广的定性案例研究进一步表明,这些 skills 支持协调的多模态理解、生成和任务编排,同时保持输出之间的一致性。
Omni-IO Skills 组织为三层层级,其中高层级 Scenario 与 Expert Skills 会展开为原子操作。所实现的原子 skills 覆盖多模态理解、生成和网络浏览,包括视觉、音频、文档、3D、文本和代码能力。这种分层组合支持在复杂交付物中复用底层能力并共享中间工件。原子 skills 涵盖针对图像、视频、文档和 3D 的多模态理解,以及针对视频、音乐、语音、3D、Word、PDF、代码和 Markdown 的生成。高层级 Scenario 与 Expert Skills 递归展开为原子 skills,使复杂工作流能够复用底层能力,同时共享输入和中间结果只表示一次。
一个产品推广请求被分解为四波依赖图。产品参考分析首先运行,随后并行生成海报和视频/音效资产,第三步组装宣传视频和海报,最后运行落地页生成。已完成的上游资产会被注册,以便后续修改可以复用它们,并仅重新执行受影响的下游任务。产品参考分析首先运行,并在任何资产生成开始前提取产品外观和视觉约束。海报资产和视频/音效资产在第二波并行生成,随后在第三波组合为宣传视频和海报,最后进行落地页生成。当请求新的落地页样式时,会复用已注册的产品分析和宣传资产,并仅重新运行落地页任务。
Omni-IO Skills 在 UniM-90 上一致地提升 GPT-5.6 Sol 和 Claude Sonnet 5。两个基础 agent 的输入支持变为完整,相对语义质量、交错一致性、严格结构和宽松结构指标均大幅提升。这些提升表明更广泛的模态覆盖和更强的输出结构控制。添加 Omni-IO Skills 将两个基础 agent 的输入支持提升到 100%,而未添加时约为或低于 40%。相对语义质量和交错一致性显著提升,两个基础 agent 的结构得分都接近满分。
实验将 Omni-IO Skills 视为覆盖多模态理解、生成和网络浏览的原子与高层级 skills 的三层层级,并通过一个四波依赖图的产品推广工作流对其进行评估。该工作流验证了上游工件的复用,以及在仅下游任务发生变化时的选择性重新执行。在 UniM-90 基准上,为 GPT-5.6 Sol 和 Claude Sonnet 5 添加 Omni-IO Skills 可获得完整输入支持、更强的语义质量和交错一致性,以及接近完美的结构控制,表明模态覆盖更广且输出格式更可靠。