Command Palette
Search for a command to run...
LLM 智能体时代的图工程:从个体智能到系统智能
LLM 智能体时代的图工程:从个体智能到系统智能
摘要
大语言模型(LLM)已从语言生成模型迅速演变为能够解决日益复杂和长周期任务的自主智能体。伴随这一演变,涌现出一系列新兴的工程范式,包括用于激发模型能力的提示工程、用于管理信息访问的上下文工程、用于组织外部工具与资源的驾驭工程,以及用于实现持续反思与自我改进的循环工程。然而,随着现实世界任务复杂性的增加,个体智能的根本局限逐渐显现:许多任务本质上需要异构的专业知识、相互依赖的子任务、并行执行、独立验证和持久状态,这些需求超出了任何单一智能体的组织能力。仅仅增强个体智能体的能力或上下文无法解决这种架构上的不匹配。相反,智能必须分布在多个专业化智能体之间,并在系统层面进行组织。我们将这种能力称为系统智能:即智能体系统将多个智能组件组织并协调成一个连贯、自适应的整体,以追求共同目标的能力。然而,实现系统智能不仅仅需要增加智能体的数量,还需要用于组织工作、协调异构智能体以及维护不断演化的执行状态的显式结构。在本综述中,我们引入了图工程,这是一种构建下一代智能体系统的新兴范式。与以往主要优化个体交互或智能体层面行为的范式不同,图工程专注于构建表示任务、智能体和系统状态的显式、动态且不断演化的图结构。这种基于图的抽象为组织复杂目标、编排异构智能体、建模系统动态以及实现可扩展的智能体演化提供了统一的基础。在本文中,我们系统性地回顾了 LLM 智能体时代下图工程的原理、方法和应用。所有相关资源,包括研究论文、开源数据和项目,均已为社区收集于 https://github.com/DEEP-JLU/Awesome-Graph-Engineering。
一句话总结
来自香港理工大学、南洋理工大学等机构的研究人员提出了 Graph Engineering,一种构建 LLM agent 系统的范式,通过构建显式、动态且不断演化的任务、agent 和系统状态图结构,将异构 agent 组织为超越个体优化的 System Intelligence,实现编排、动态建模和可扩展演化。
核心贡献
- 本文提出了 Graph Engineering,一种以结构为中心的范式,使用显式、动态的图抽象来表示任务、agent 和系统状态,从而能够组织复杂目标并协调异构 agent,超越个体 agent 优化。
- 本文将综述文献组织为三个互补的图视图:工作组织、agent 协调和运行时状态管理。这些基于图的抽象支持调度、能力绑定、执行追踪、故障定位和受控的系统演化。
- 该综述指出了语义对齐、图治理、评估、隐私和安全自我改进方面的开放挑战,并提供了一个精心整理的资源集合,以指导未来面向 System Intelligence 的图原生基础设施工作。
引言
大型语言模型已成为智能系统的基础,但模型级能力和个体 agent 循环不足以应对复杂的现实世界任务,这些任务需要异构专业知识、并行执行、独立验证和持久的长时程状态。提示工程、上下文工程、Harness 工程和 Loop 工程改进了个体 agent,但它们仍将相互依赖的工作强制纳入共享上下文和主要顺序的控制流,在调度、角色分离和故障恢复方面造成瓶颈。先前的多 agent 方法也可能仍然受限,因为它们可能缺乏清晰的工作组织、协调机制和一致的运行时状态管理。作者提出了 Graph Engineering,一种以结构为中心的范式,使用图抽象来显式表示和治理任务组织、agent 协调和运行时状态演化,旨在支持系统级智能,而不仅仅是增加更多能力更强的 agent。
数据集
作者将数据集和评估部分描述为资源的分类概念,而非具体的数据集清单。
- 组成与来源:该部分区分了三种资源类型:基准测试、数据集和可执行环境。基准测试定义任务、评估协议和评分规则。数据集提供可复用的实例、注释、图、交互记录或执行轨迹。环境暴露可观察和修改的可执行状态。
- 各子集的关键细节:未提供具体的数据集大小、来源或过滤规则。论文仅指出资源在表 1 中标注为 B(基准测试)、D(数据集)和 E(可执行环境),且这些形式并非互斥。
- 论文如何使用数据:评估资源围绕三个智能层级组织:模型智能、个体智能和系统智能。模型智能涉及有界模型交互;个体智能涉及单个自主 agent 在持续轨迹中结合推理与外部能力;系统智能涉及多个协调的智能组件。
- 处理与元数据构建:该部分未描述数据集的预处理、裁剪、划分或混合比例。其主要元数据方案是三层智能分类法,加上表 1 中的 B/D/E 资源类型标签。
方法
作者提出了一个智能系统的层次化框架,从个体 agent 演化到基于图的系统智能。个体 Agent 被定义为一个自主实体 Ai=Loop(Fi,Hi;sit),其中基础模型 Fi 提供认知能力,Agent Harness Hi 管理外部资源。
从模型智能到个体智能的过渡通过特定的工程层实现。基础模型通过预训练和后训练建立参数化能力。Prompt 和 Context 工程将这些能力调节到特定任务。Harness 工程通过将模型连接到持久记忆、工具和执行环境来扩展模型。Loop 工程随后将这些资源组织为感知、规划、行动和反馈的迭代循环,从而实现持续的目标导向行为。
为了解决个体 agent 在管理并行和相互依赖任务方面的局限性,作者引入了 Graph Engineering。该方法使用图结构显式表示和优化任务、组件和运行时状态之间的关系,构成 System Intelligence 的基础。
Graph Engineering 框架包含三个核心模块:任务组织、Agent 协调和运行时状态管理。
任务组织将高层目标结构化为可执行的工作流。
目标分解将复杂目标分解为显式的子任务和依赖图,允许依赖感知的调度,并在中间结果出现时进行动态细化。工作流优化将这些子目标编译为可执行的操作符和控制流。该过程涉及搜索和优化工作流结构本身,并根据运行时反馈调整执行路径,确保系统能够动态修订工作流和剩余子目标。
Agent 协调管理异构 agent 的协作。
Agent 能力建模将 agent 映射到其特定技能、工具访问和可靠性概况。Agent 团队组织将这些 agent 编排为协作结构,例如顺序链、路由拓扑或扇出和扇入模式,这些结构可以根据上下文动态重新配置。多 agent 通信管理信息流,通过移除低效链接和跨执行轮次演化交互模式来优化通信拓扑。
运行时状态管理通过跟踪执行和处理故障来确保系统可靠性。
状态记录维护可追踪的运行时视图和角色绑定,实施受控更新,在提交前验证更改。故障定位检测异常并追踪执行偏差,以识别根本原因和第一个无效状态。故障恢复利用此诊断建立恢复边界,保留有效工作,同时选择性地重新执行或修复受影响区域,以安全地恢复系统。
实验
评估框架围绕三个智能层级组织资源:模型智能评估有界模型输出,个体智能评估 agent 在持续交互中的轨迹,系统智能考察多组件组织和演化。基准测试和应用表明,虽然工作组织和 agent 团队结构日益普遍,但持久的系统演化和结构信用分配仍未得到充分探索。跨领域的主要挑战是从手动固定的结构转向图工程化的系统,其中结构变化可观察、可控且可跨任务和时间迁移。
列出的模型智能资源是针对有界模型交互的基准测试和数据集,例如广泛知识、研究生级科学推理、NP 完全问题求解、奥林匹克数学和指令遵循。若干条目强调客观或形式化验证,一个条目专注于具有约束跟踪和故障恢复的演化多轮对话。随附的讨论将这些资源置于更广泛的分类法中,该分类法还涵盖个体智能、系统智能和可执行环境。所有列出的模型智能条目均标注为 B/D,意味着它们作为基准测试或评估协议,结合了数据集、注释或轨迹。可验证性是一个反复强调的重点:OlymMATH 提供形式化验证,NPPC 提供自动可验证的推理,IFEval 使用客观可检查的约束。EvolIF 将评估从单轮响应扩展到具有约束跟踪和故障恢复的演化多轮对话。
智能系统的开源库按其主要的工程目标组织,涵盖模型智能、个体智能和系统智能。模型智能工具涵盖分布式预训练、后训练、强化学习和服务,最近的项目整合了训练和 rollout 生成。更广泛的生态系统正在采用 agent 团队结构和运行时状态管理,但持久的结构演化仍不常见。模型智能库覆盖从分布式预训练(Megatron Core)到高吞吐量服务(vLLM)的完整生命周期,主要采用 Apache-2.0 许可。像 verl 和 slime 这样的项目将训练与 rollout 服务合并,展示了强化学习中模型训练和推理的实际融合。跨应用领域,工作组织和 agent 团队工程被广泛采用,但系统很少根据积累的证据永久性地修订其组织结构。
跨应用领域,工作组织和 Agent 团队工程已经普遍,而运行时状态管理通过事件流、检查点和共享任务板变得更加可见。持久的系统演化仍然罕见,大多数系统在固定结构内适应,而不是根据积累的证据进行修订。软件编码 agent 展示了从个体智能到系统智能的实际过渡,但仅仅增加 agent 并不能保证系统智能,还需要仔细的分解、责任分配和状态共享。工作组织和 Agent 团队工程出现在大多数代表性应用中,从端到端的软件生产到多 agent 编码系统。运行时状态管理通过 agent-计算机接口、事件流、持久任务板和可重现的执行历史变得越来越可见。列出的系统中缺乏持久的系统演化,这些系统在预定义的组织结构内适应,而不是根据证据永久性地修订它们。像 OpenHands、Codex 和 Claude Code 这样的软件工程系统跨越个体智能和系统智能,采用并行 agent、子 agent 和共享运行时状态。应用证据支持区分图结构化和图工程化,后者需要结构目标、图级可观测性、受控变异和持续改进的证据。
评估领域涵盖针对有界模型交互的基准测试,重点强调可验证性,包括形式化验证和客观可检查的约束,而开源库越来越多地将训练和推理合并用于强化学习。跨应用领域,工作组织和 agent 团队工程被广泛采用,运行时状态管理通过事件流和共享任务板获得可见性。然而,持久的系统演化仍然罕见,因为大多数系统在固定结构内适应,而不是根据积累的证据永久性地修订其组织。证据支持区分仅仅图结构化和图工程化,后者需要结构目标、图级可观测性、受控变异和持续改进的证据。