Command Palette
Search for a command to run...
AutoDesign:面向长程智能体设计的元框架优化
AutoDesign:面向长程智能体设计的元框架优化
摘要
将多模态来源转化为凝练且结构化的媒体输出,可以从根本上概念化为一个以模型-框架系统为核心的长程智能体过程。理想的框架系统应当与人类设计先验保持一致,并通过经验探索积累可复用的经验以驱动递归式自我改进,然而现有范式仍是静态的,难以具备这一能力。本文提出 AutoDesign,一个与人类设计先验对齐的框架,其中元框架优化器引导代码智能体基于 rollout 反馈递归改进框架。为实例化并评估该框架,我们聚焦于学术论文到海报生成任务,并引入 PosterBench,包含一个涵盖五个学科、由 100 篇论文组成的主赛道,以及用于受控评估的共享 10 篇论文子集 PosterBench-mini。在 PosterBench 主赛道上,AutoDesign 取得最高分 78.32,超过闭源商业系统 Claude Design 7.45 分。在七种受控的代码智能体-模型配置中,集成学习得到的 DesignHarness 均能稳定提升性能,将平均 PosterBench 分数从 54.99 提高到 67.39(+12.4%)。在完全自主的长程循环中,该系统在 40 分钟内执行 253 次工具调用和 11 轮编辑,成本低于 3 美元,在人工评估中达到平均会议海报质量。一项系统盲评的人类研究进一步表明,AutoDesign 在所评估系统中获得了最高的人类偏好。
一句话总结
美团、MBZUAI、华中科技大学等机构的研究人员提出 AutoDesign,这是一个通过与人类设计先验对齐的 meta-harness 优化框架,使用 meta-harness 优化器指导 code agent 基于 rollout 反馈递归改进 harness;在 paper-to-poster 的 PosterBench 评估中,AutoDesign 取得 78.32 分,超过 Claude Design 7.45 分,并将平均 PosterBench Score 从 54.99 提高到 67.39。
核心贡献
- AutoDesign 是一个 meta-harness 优化框架,从聚合的 rollout 轨迹、源与渲染诊断、评估器反馈和参考海报中,每次递归更新一个 DesignHarness 组件,同时保持模型权重固定。
- PosterBench 被提出作为学术论文到海报生成的统一评测协议,包含一个跨五个学科的 100 篇论文主赛道,以及一个共享的 10 篇论文 PosterBench-mini 子集,用于受控评测。
- AutoDesign 取得 PosterBench 主赛道最高分 78.32,超过 Claude Design 7.45 分。在七种受控的 code agent 与模型配置中,学习到的 DesignHarness 将平均 PosterBench Score 从 54.99 提高到 67.39(+12.4%),并且一项不透露系统身份的人工研究在偏好上将 AutoDesign 评为最高。
引言
多模态设计需要把异构来源转化为可编辑、面向人的制品,例如海报、幻灯片和网页,这使得它成为一项具有挑战性的长时程任务,因为系统必须抽取证据、在混合输入上推理、规划修改并响应反馈。先前系统通常依赖生成-批评-修订循环,并可能保留反思或技能,但通常把与人类对齐的反馈视为对单个输出的一次临时纠正,而不是用于改进生产系统本身的可复用知识。作者提出 AutoDesign,这是一种 meta-harness 优化框架,它通过从标注参考初始化的评估器来锚定人类偏好,并且仅在训练性能提升且不损害开发集时才接受 harness 更新,从而跨任务递归改进 design harness。他们将该方法实例化为面向学术论文到海报生成的 DesignHarness,并提出 PosterBench,这是一个同时衡量来源忠实度、科学传播、布局、可读性和视觉质量的基准与评测协议。
方法
作者将 design harness H 定义为围绕固定模型 πθ 的系统,在给定上下文 c 的情况下,将多模态来源 x 转换为面向人的制品 y:
y∼H(πθ,x,c)该 harness 通过执行轨迹 τ 生成制品,轨迹记录中间动作和修订的序列。为了实现系统性的 meta-harness 优化并便于贡献归因,design harness 被分解为五个功能组件:上下文与记忆(Context and Memory)、工具与规范(Tools and Specifications)、执行运行时(Execution Runtime)、编排(Orchestration)以及评估与反馈(Evaluation and Feedback)。
meta-harness 作用于该 design harness 以改进其具体实现。给定用户说明和初始 harness H0,meta-harness 产出优化后的 harness HT。优化目标是 design harness 所生成制品的期望质量:
J(H)=E(x,c)∼ptask,y∼H(πθ,x,c)[Rmeta(y,x,c)]其中 Rmeta 是用于评估制品质量的评估器。目标是找到 H⋆=argmaxHJ(H)。在整个过程中,模型参数 θ 保持不变,这意味着优化作用于模型周围的系统,而不是模型权重本身。
AutoDesign 将制品生成和 harness 优化组织为两个嵌套反馈回路。
内层回路在固定 design harness H 下改进单个制品。它初始化一个 scaffold,其中包含 designer Mdesign 和 critic Mcritic。在细化步骤 k,designer 基于先前状态和反馈生成制品 yk,同时 critic 对其进行评估:
yk=Mdesign(yk−1,fk−1;x,c) fk=Mcritic(yk;x,c)这种交互在当前 design harness 下产生一条执行轨迹 τ。
外层回路基于多次生成运行收集的证据,跨任务改进 design harness H。
每个外层回路迭代经历四个阶段:rollout、evaluation、update proposal 和 acceptance gate。
-
Rollout:当前 harness Ht 在训练集上执行,生成制品和对应轨迹。
-
Evaluation:评估器 Rmeta 从七个质量维度评估制品,包括 Faithfulness、Coverage、Density、Visual Evidence、Layout、Readability 和 Aesthetics。该评估器将面向可测量属性的规则检查与面向感知属性的 VLM 判断相结合。
-
Update Proposal:优化器 P 以 coding agent 的形式充当规划器和代码编辑器,分析轨迹和评分,提出候选 harness Ht+1′:
Ht+1′=P(Ht,τt,st,L)
每次迭代的更新被限制在五个 harness 组件中的恰好一个,以保持贡献归因可解释。
-
Acceptance Gate:仅当候选在训练集上性能提升,且在独立开发集上没有下降时,才被接受:
Accept(Ht+1′)⟺Jtrain(Ht+1′)>Jtrain(Ht)∧Jdev(Ht+1′)≥Jdev(Ht)
系统还支持可选的人工介入模式,用户可以在其中向 planner 提供方向性指导,或在检测到系统性偏差时修订评估器。
meta-harness 优化产生最终的 DesignHarness 架构,支持多种输出媒介,例如学术海报、幻灯片和网页。
得到的架构由四个主要阶段组成:
- Paper Ingestion:该阶段将输入来源和设计上下文转换为结构化、具备来源感知的上下文。它抽取文档元数据、章节大纲、关键段落和视觉证据,并将其组织成内容简报和制品计划。每个元素都保留对源位置的引用以便追溯。
- Artifact Generation and Revision:designer 模块以 coding agent 实现,将制品生成或修订为可编辑的 HTML 文件。这使修订能够以局部代码编辑实现,无需完整重新生成。
- Validation and Finalization:在每一步细化中,基于规则的验证器对缺失资源、断裂来源链接或布局违规等问题应用确定性阻断检查。如果候选通过,循环终止。如果失败,则渲染制品并由 Critic VLM 检查美学和可读性等感知属性。合并后的反馈指导下一轮修订。该循环最多允许 12 次尝试。
- Finalization:最佳有效候选经过后处理,包括渲染调整和资源内联,以生成自包含输出。如果在未通过所有检查的情况下尝试预算耗尽,回退机制会确定一个可交付候选。
实验
实验使用 PosterBench 对海报生成进行基准评测,该基准是一个跨五个学科、覆盖 100 篇论文的冻结评估器,结果发现 AutoDesign 在对比系统中取得了最高整体性能。消融实验隔离了 design harness,并表明它在多种模型和 coding-agent 配置上一致改善结果,同时视觉预览反馈有助于纠正布局和裁切失败。盲评人工评估将 AutoDesign 排在首位,并发现自动评分与人类偏好之间存在中等但有意义的关联,基准分数差距越大,人类判断越一致。轨迹定性分析确认,迭代诊断反馈会产生局部修复并保留有效内容。
AutoDesign 在整体海报质量上领先被评测系统,其 Claude 4.8 配置取得了最强基准结果和最高的盲评人类偏好估计。该基准对人类判断的追踪呈正向但中等相关,且当分数差距较大时,其预测与评审者更加一致。代表性修订轨迹显示,critic 反馈产生局部布局修复,同时保留有效内容。AutoDesign 取得最高的整体基准性能,领先于 Claude Design 和 OpenDesign 配置。盲评评审者相比其他系统更偏好 AutoDesign,且基准偏好海报与人类选择之间的一致性随分数差距增大而提高。
AutoDesign 配置在 PosterBench 主赛道上领先,其中 Claude Code 与 Claude 4.8 组合得分最高,Codex 组合凭借更强的美学几乎追平。Claude Design 和 OpenDesign 系统整体落后,尽管在某些维度上具有竞争力。人类偏好判断也倾向于 AutoDesign,且随着基准分数差距扩大,与人类评审者的一致性提高。AutoDesign 与 Claude Code 组合取得最强整体分数,受到高密度、布局和可读性的支撑。AutoDesign 与 Codex 几乎追平最高分,但以视觉证据和布局换取更强的美学。Claude Design 在所列系统中有最高的覆盖率和视觉证据,但较低的密度和可读性限制了其整体分数。OpenDesign 变体整体排名最低,其中 Codex 配置在视觉证据和可读性上相对较弱。人类偏好将 AutoDesign 排在 Claude Code、OpenDesign 和 Claude Design 之前,且当分数优势更大时,基准偏好海报更常与人类选择一致。
领先配置是 AutoDesign 搭配 Codex 和 GPT 5.5,它在所列系统中取得最高整体 PosterBench Score,并在 faithfulness、density、readability 和 aesthetics 上取得最高分。AutoDesign 搭配 Claude Code 和 Claude 4.8 时整体排名第二,而 OpenDesign 配置和 Claude Design 整体得分较低。Claude Design 取得最强 coverage,但被较弱的 density 和 readability 拖累。AutoDesign 搭配 Codex 和 GPT 5.5 整体领先,并在 faithfulness、density、readability 和 aesthetics 上表现最佳。在相同 coding agent 和模型下,AutoDesign 在整体分数上优于 OpenDesign 和 Claude Design。Claude Design 获得最高 coverage 分数,但在 density 和 readability 上落后,导致整体排名较低。整体最弱配置是 OpenDesign 搭配 Codex 和 GPT 5.5,与领先系统形成很大差距。
在固定的 10 篇论文子集上,AutoDesign 在 design harness 赛道领先,整体加权 rubric 分数最高,排在 OpenDesign 和 Claude Design 之前。其优势由布局和可读性驱动,尽管它在三种设计变体中视觉证据最低。在固定 AutoDesign 和 GLM 5.2 的 coding harness 赛道中,Kimi Code 以较大整体差距优于 ZCode,在大多数维度上具有广泛优势。AutoDesign 在 design harness 赛道整体领先,但视觉证据弱于 OpenDesign 和 Claude Design。Kimi Code 在大多数评分维度上优于 ZCode,尤其是在布局和可读性上有较大优势。
加入 DesignHarness 后,每个已完成配置的 PosterBench Score 都有提高,提升幅度约在 5 到 20 分之间。改进出现在多种模型和 coding-agent 组合中,低基线配置往往提升更大。最大的单项提升来自 DeepSeek V4 Pro 搭配 Claude Code。DesignHarness 在所有七个已完成配置中提高 PosterBench Score,提升约 5 到 20 分。最大提升出现在 DeepSeek V4 Pro 搭配 Claude Code,而 GPT-5.5 搭配 Codex 以及 Claude 4.8 搭配 Claude Code 等得分较高的基线配置提升幅度更温和。
AutoDesign 配置在各评测中一致取得最高整体海报质量和人类偏好,优于 Claude Design 和 OpenDesign,领先结果由布局、密度和可读性驱动,尽管一些变体在视觉证据或覆盖率上落后。当分数差异较大时,基准偏好与人类判断更一致,critic 反馈支持局部布局修复而不干扰有效内容。在固定子集比较中,AutoDesign 也在 design harness 赛道领先,而 Kimi Code 在 coding harness 中优于 ZCode。加入 DesignHarness 在所有已完成配置中提高 PosterBench 分数,且低基线配置提升更大。