Command Palette
Search for a command to run...
智能体工件创建:系统、评估、原则与机遇
智能体工件创建:系统、评估、原则与机遇
摘要
生成模型能够将自然语言提示转化为图像、文本、代码及其他内容,降低了草稿和组件生产的经济成本。其实际影响日益取决于这些片段能否成为完整、可靠的交付成果。此类交付成果带来了不同的挑战,因为其需求相互关联,而最终输出中可见的故障可能难以追溯或修复。本综述考察智能体工件创建,我们将其定义为一种有状态构建过程:AI 系统实质性构建或修订交付成果,且中间观察结果会引导后续工作。从功能上看,该过程将工件的可操作表示、构建策略和运行时验证连接起来,验证反馈能够引导后续行动。这种控制结构可以暴露依赖关系并支持有针对性的修订,但前提是观察结果能够在可用行动可修复的范围内识别故障。我们审阅了截至 2026 年 8 月 20 日可获取的 259 篇文献:其中 230 个系统符合上述定义,另有 29 个针对智能体工件构建的基准。我们比较了六个工件族,然后将应用场景和评估实践作为独立维度加以分析。跨工件族来看,构建挑战不仅反映模态差异,还取决于决策耦合的紧密程度,以及故障是否在仍可修复时变得可见。分解可以降低局部复杂性,但会增加协调与重组成本。当学习型评判器与生成器共享偏好或盲点时,其提供的独立证据可能十分有限。我们提出若干原则,以保持承诺与责任的明确性、将反馈转化为有针对性的修复,并在变更后重新验证受影响的状态。我们还指出了在工件、创作者意图和构建系统不断演化的过程中维持连贯、可问责控制所面临的挑战与机遇,尤其是在故障难以诊断或多个结果可能均有效的情况下。我们在 https://github.com/GeminiLight/awesome-agentic-artifact-creation 维护了一份精选的智能体工件创建论文列表。
一句话总结
来自香港科技大学(广州)、浙江大学等机构的研究人员对 agentic artifact creation 进行了综述,将其视为连接可操作的工件表示、构建策略和运行时验证的有状态构建过程,其中运行时验证的反馈可以重定向后续行动;他们评审了六类工件中的 259 项工作(230 个系统和 29 个基准),以形成针对性修复与重新验证的原则。
核心贡献
- 本文将 agentic artifact creation 定义为一种有状态构建:AI 系统实质性地构建或修改交付物,中间观察结果会改变后续工作;随后综述了六类工件中的 230 个系统和 29 个基准。
- 该综述比较了六类工件,并将应用场景和评估实践作为独立维度进行分析,发现关键构建挑战包括紧密耦合的决策、出现较晚或原因不清的失败,以及过于粗糙、难以支持局部修复的编辑。
- 针对控制与问责提出了四项设计原则:外化承诺、界定控制边界、将反馈连接到可行修复,以及在变更后重新验证受影响状态;并以作用域偏好记忆和权限感知委托作为具体机制。
引言
生成模型现在可以从自然语言提示生成文本、图像、代码、视频和其他内容,这些能力正进入专业和创意工作流,其中交付物必须满足若干相互依赖的验收标准。直接生成适用于边界清晰、易于检查的输出,但当决策影响下游约束、失败出现较晚、大范围编辑使局部修复变得困难时,其可靠性会下降。以往的综述往往按模型家族、Agent 能力、领域或流程组织工作,而不是按交付工件本身组织。作者通过将 Agentic Artifact Creation 定义为有状态构建来填补这一空白:对中间工件状态的观察会改变后续的修订决策。他们综述了六类工件中的 200 多个系统,提出了基于可操作表示、构建策略和运行时验证的功能模型,并综合了可检查构建控制的原则、挑战和研究议程。
数据集
概述
作者使用了一个映射的全文出版物语料库,涵盖工件构建系统。所选摘录描述了按工件家族组织的定性证据库:数据可视化、音频工件、语音音频和 3D 资产。源文本中未报告数值数据集大小、训练划分和混合比例。
来源与组成
- 数据可视化:来自 AMACE、PlotGen、CoDA、Data Formulator 2、SVG 编辑工作流和 DV-World。数据由与转换路径、图表规范和对话式修订状态相关联的视觉工件组成。
- 音频工件:包含符号化或渲染的声音,在乐谱、歌词、制作图、分轨和波形上具有可编辑状态。
- 语音音频:映射的全文出版物语料库中没有出现专门的语音音频构建系统;证据来自条件分解的文本或视频到音频生成,以及播客制作流程。
- 3D 资产:分为视觉资产和参数化模型;系统包括 ShapeCraft、LL3M、InfiniHuman、SmartAvatar、Seek-CAD、CADDesigner、LLM 驱动的 FreeCAD 自动化、基于 STEP 和 NURBS 的生成器、CADIR 和 ArtisanCAD。
子集细节与筛选规则
- 数据可视化:筛选和验收要求有效传达信息,并忠实于源数据和已记录的变换。处理过程保留可执行的转换路径,检查渲染结果,并保持数据转换、图表规范和对话式修订同步。
- 音频工件:未给出规模或筛选细节。验证检查使用音乐关系、源脚本与说话人链接,或场景级事件对齐。
- 语音音频:未给出规模或筛选细节。材料必须保持源内容、脚本、说话人、时间点和渲染片段对齐。AudioToolAgent 会路由音频问答和语音转文本工具,但不维护可编辑的音频工件。
- 3D 资产:视觉资产需要语义部件、外观控件和编辑句柄,才能在修订后继续可用;参数化模型保留尺寸、特征、约束和精确边界几何。相关处理包括程序化历史、渐进式网格构建,以及具有依赖、约束、拓扑和诊断信息的跨后端构建图。
模型如何使用数据
- 该语料库用作绘制工件家族图谱、识别可进行针对性修复位置的证据基础。
- 这些摘录中未描述模型训练划分、混合权重或数据集规模。
- 作者并未将这些段落作为训练数据集呈现;他们映射已发布系统及其工件级处理链接。
裁剪与元数据构建
- 未报告图像裁剪策略或数值预处理流程。
- 元数据围绕渲染输出、编码、转换和源数据之间的链接构建。这些链接决定修订是否可以精确定位,而不必退回对整个资产重新生成。
方法
作者提出 Agentic Artifact Creation 范式,将交付工件视为在生产过程中可检查和修改的状态。与中间观察无法改变后续行动的直接生成流水线不同,agentic 创建将构建策略、可操作表示和运行时验证耦合在一起,使反馈能够在验收之前改变后续决策。
在功能层面,作者将 Agentic Artifact Creation 组织为三个角色,它们构成一个循环的构建过程。
可操作表示通过中间形式暴露当前工件侧状态 Rt,并提供编辑接口。中间形式可以是工件实例、结构化模型或可执行程序,决定哪些内容在步骤之间持久保留。编辑接口指定诸如单元编辑、关系编辑或整个工件编辑等操作来修改状态。应用动作 at 会产生更新后的状态 Rt+1=U(Rt,at)。
构建策略解释任务规范 T、当前表示 Rt 和可用反馈 ft,以选择下一动作 at=π(T,Rt,ft)。该策略受决策控制约束,决策控制可以是基于工作流的或自主式的;并受 Agent 拓扑约束,范围从单 Agent 到集中式或去中心化多 Agent 系统。
运行时验证根据验收标准评估更新状态的观察结果 ot+1,生成反馈 ft+1=V(T,Rt+1,ot+1)。它从工件状态、运行时行为、评估信号或外部响应等观察来源获取信息。反馈函数随后推导出标准状态、失败诊断或修订指导,以告知构建策略。如果状态被接受,则交付工件;否则反馈将驱动修订。
该功能架构支持三种构建能力:可组合性,允许替换或重排步骤;可追溯性,将需求与动作和观察联系起来;可修订性,为针对性修复提供介入点。
作者将该框架应用于六类工件:文本、2D 视觉、音频、视频、空间和行为。每一类都表现出不同的失败观察点,从静态检查到时间播放和运行时后果。
这些工件家族进一步组织为 16 个分析画像,对创意写作、数据可视化、音乐、叙事视频、3D 资产和软件系统等具体工件类型进行分类。
为指导这些不同背景下的系统设计,作者以决策相互依赖性、失败可观察性和可修复性作为定性视角,提出了 agentic 创建的四项原则。
第一,外化承诺要求将验收标准连接到可寻址的工件状态,使重要需求对后续动作保持可用。第二,界定控制边界在工件依赖关系发生变化的位置指定委托和审查边界,确保跨边界一致性的责任。第三,使反馈可操作将相关验收标准与及时证据、诊断和可行修复动作连接起来。最后,重新验证受影响状态将验收证据视为按版本限定:当发生更改时,使依赖证据失效,并选择性地重新验证受影响状态。这些原则共同定义了可检查的控制关系,以相称的控制成本支持受控目标实现。
实验
所综述的实验涵盖视觉文档构建、工程设计和评估基准。视觉文档研究对比了分阶段、统一和轨迹感知的海报与演示文稿系统,表明修复页面级问题可能会破坏源数据锚定或整套幻灯片的叙事一致性。工程设计实验区分了可部署系统开发(其中仿真提供反馈)与仿真建模(其中转换模型或仿真器本身是交付工件),并强调在多个已接受交付物之间保持一致。评估和基准分析刻画了工件、轨迹和系统级目标,证据渠道和评估器,协议条件,以及基准格局;发现单一汇总分数会掩盖任务特定和标准特定的失败,而开放式工件需要版本化的验收规范和预算匹配的比较。
相近综述主要围绕模型家族、Agent 架构、创意工作流、软件 Agent、工具轨迹、人类协作或评估方法组织,而非围绕交付工件。其工件范围涵盖多模态内容、软件、通用任务和数字任务,而构建状态和反馈控制大多不完整或缺失。评估重点各不相同,从工件级和任务级到轨迹级和交互级,只有以评估为中心的工作覆盖多个层级。在这些综述中,交付工件不是主要分析单元;其主要视角包括模型家族、Agent 架构、创意工作流、软件 Agent、工具轨迹、人类协作和评估方法。作为组织轴,构建状态和反馈控制大多不完整或缺失;评估重点从工件级和任务级到轨迹级和交互级不等,只有以评估为中心的工作跨越多个层级。
工件家族的区别在于哪些依赖机制和观察模式主导其验收标准,次要标记表示亚类型层面的参与。其签名从面向阅读的文本工件和面向渲染的 2D 视觉工件,经过面向播放的音频和视频,转向持久空间结构和状态依赖的行为工件;在后两类中,动态和交互标准更加突出。评估证据不均衡:专用基准在 2D 视觉和行为工件中最为成熟,对已交付工件和有界执行的覆盖,比对轨迹或已测试用例之外有效性的覆盖更强。文本和 2D 视觉工件以语义或感知依赖为特征,主要观察模式是阅读或渲染。音频和视频工件增加了时间和面向播放的标准,而空间和行为工件强调空间或动态状态以及交互。专用基准在 2D 视觉和行为工件中最为成熟,而音频、视频和空间工作更常依赖系统论文中的协议。
代表性系统主要覆盖文本工件创建,另有一个 2D 视觉条目。文本系统使用多种受维护的中间形式,并且大多采用基于工作流的构建策略。运行时验证和 Agent 拓扑在所列系统之间差异更大。所列文本系统维护各种中间形式,如大纲、手稿、草稿、角色图和 LaTeX 状态。基于工作流的构建策略在该集合中很常见,其中一个文本系统也被标记为自主式。运行时验证细节范围从未报告到状态、诊断、指导、状态、度量和响应观察的组合。唯一的 2D 视觉代表使用数据加规范的中间形式,在单 Agent 工作流下渲染为图表。
代表性文本和 2D 视觉协议一致评估交付工件,而轨迹证据不均衡,通常有限或缺失。在所展示的协议中,只有一个报告了任务能力之外的 agentic 系统属性,具体为可控性。LM 评审员和人工评审员比基于规则的检查或专家模型更常作为评估渠道出现。所有选定协议都明确覆盖工件本身,而轨迹覆盖范围从无报告覆盖到有限或明确覆盖不等。该子集中只有一个协议评估任务能力之外的系统属性,报告了可控性。在这些协议中,LM 评审员和人工评审员是比基于规则的检查或专家模型更常见的评估渠道。
分析表明,相近综述主要围绕模型家族、Agent 架构、工作流和评估方法组织,而不是围绕交付工件,构建状态和反馈控制仅被部分覆盖。工件家族的区别在于验收是依赖语义或感知阅读、时间播放,还是空间和状态依赖的交互;专用基准在 2D 视觉和行为工件中最成熟,而音频、视频和空间工作通常依赖系统协议。代表性系统以文本为主,维护各种中间形式(如大纲或草稿),并使用基于工作流的构建方式,但运行时验证和 Agent 拓扑差异很大。评估协议一致评估最终工件,对轨迹证据的覆盖不均衡,很少报告任务能力之外的 agentic 属性,并且更多依赖 LM 评审员和人工评审员,而不是基于规则的检查或专家检查。