HyperAIHyperAI

Command Palette

Search for a command to run...

AutoDesign:面向长程智能体设计的元框架优化

摘要

将多模态来源转化为凝练且结构化的媒体输出,可以从根本上概念化为一个以模型-框架系统为核心的长程智能体过程。理想的框架系统应当与人类设计先验保持一致,并通过经验探索积累可复用的经验以驱动递归式自我改进,然而现有范式仍是静态的,难以具备这一能力。本文提出 AutoDesign,一个与人类设计先验对齐的框架,其中元框架优化器引导代码智能体基于 rollout 反馈递归改进框架。为实例化并评估该框架,我们聚焦于学术论文到海报生成任务,并引入 PosterBench,包含一个涵盖五个学科、由 100 篇论文组成的主赛道,以及用于受控评估的共享 10 篇论文子集 PosterBench-mini。在 PosterBench 主赛道上,AutoDesign 取得最高分 78.32,超过闭源商业系统 Claude Design 7.45 分。在七种受控的代码智能体-模型配置中,集成学习得到的 DesignHarness 均能稳定提升性能,将平均 PosterBench 分数从 54.99 提高到 67.39(+12.4%)。在完全自主的长程循环中,该系统在 40 分钟内执行 253 次工具调用和 11 轮编辑,成本低于 3 美元,在人工评估中达到平均会议海报质量。一项系统盲评的人类研究进一步表明,AutoDesign 在所评估系统中获得了最高的人类偏好。

一句话总结

美团、MBZUAI、华中科技大学等机构的研究人员提出 AutoDesign,这是一个通过与人类设计先验对齐的 meta-harness 优化框架,使用 meta-harness 优化器指导 code agent 基于 rollout 反馈递归改进 harness;在 paper-to-poster 的 PosterBench 评估中,AutoDesign 取得 78.3278.3278.32 分,超过 Claude Design 7.457.457.45 分,并将平均 PosterBench Score 从 54.9954.9954.99 提高到 67.3967.3967.39

核心贡献

  • AutoDesign 是一个 meta-harness 优化框架,从聚合的 rollout 轨迹、源与渲染诊断、评估器反馈和参考海报中,每次递归更新一个 DesignHarness 组件,同时保持模型权重固定。
  • PosterBench 被提出作为学术论文到海报生成的统一评测协议,包含一个跨五个学科的 100 篇论文主赛道,以及一个共享的 10 篇论文 PosterBench-mini 子集,用于受控评测。
  • AutoDesign 取得 PosterBench 主赛道最高分 78.32,超过 Claude Design 7.45 分。在七种受控的 code agent 与模型配置中,学习到的 DesignHarness 将平均 PosterBench Score 从 54.99 提高到 67.39(+12.4%),并且一项不透露系统身份的人工研究在偏好上将 AutoDesign 评为最高。

引言

多模态设计需要把异构来源转化为可编辑、面向人的制品,例如海报、幻灯片和网页,这使得它成为一项具有挑战性的长时程任务,因为系统必须抽取证据、在混合输入上推理、规划修改并响应反馈。先前系统通常依赖生成-批评-修订循环,并可能保留反思或技能,但通常把与人类对齐的反馈视为对单个输出的一次临时纠正,而不是用于改进生产系统本身的可复用知识。作者提出 AutoDesign,这是一种 meta-harness 优化框架,它通过从标注参考初始化的评估器来锚定人类偏好,并且仅在训练性能提升且不损害开发集时才接受 harness 更新,从而跨任务递归改进 design harness。他们将该方法实例化为面向学术论文到海报生成的 DesignHarness,并提出 PosterBench,这是一个同时衡量来源忠实度、科学传播、布局、可读性和视觉质量的基准与评测协议。

方法

作者将 design harness HHH 定义为围绕固定模型 πθ\pi_\thetaπθ 的系统,在给定上下文 ccc 的情况下,将多模态来源 xxx 转换为面向人的制品 yyy

yH(πθ,x,c)y \sim H(\pi_\theta, x, c)yH(πθ,x,c)

该 harness 通过执行轨迹 τ\tauτ 生成制品,轨迹记录中间动作和修订的序列。为了实现系统性的 meta-harness 优化并便于贡献归因,design harness 被分解为五个功能组件:上下文与记忆(Context and Memory)、工具与规范(Tools and Specifications)、执行运行时(Execution Runtime)、编排(Orchestration)以及评估与反馈(Evaluation and Feedback)。

meta-harness 作用于该 design harness 以改进其具体实现。给定用户说明和初始 harness H0H_0H0,meta-harness 产出优化后的 harness HTH_THT。优化目标是 design harness 所生成制品的期望质量:

J(H)=E(x,c)ptask,yH(πθ,x,c)[Rmeta(y,x,c)]J(H) = \mathbb{E}_{(x, c) \sim p_{\text{task}}, y \sim H(\pi_\theta, x, c)} [R_{\text{meta}}(y, x, c)]J(H)=E(x,c)ptask,yH(πθ,x,c)[Rmeta(y,x,c)]

其中 RmetaR_{\text{meta}}Rmeta 是用于评估制品质量的评估器。目标是找到 H=argmaxHJ(H)H^\star = \arg\max_H J(H)H=argmaxHJ(H)。在整个过程中,模型参数 θ\thetaθ 保持不变,这意味着优化作用于模型周围的系统,而不是模型权重本身。

AutoDesign 将制品生成和 harness 优化组织为两个嵌套反馈回路。

内层回路在固定 design harness HHH 下改进单个制品。它初始化一个 scaffold,其中包含 designer MdesignM_{\text{design}}Mdesign 和 critic McriticM_{\text{critic}}Mcritic。在细化步骤 kkk,designer 基于先前状态和反馈生成制品 yky_kyk,同时 critic 对其进行评估:

yk=Mdesign(yk1,fk1;x,c)y_k = M_{\text{design}}(y_{k-1}, f_{k-1}; x, c)yk=Mdesign(yk1,fk1;x,c) fk=Mcritic(yk;x,c)f_k = M_{\text{critic}}(y_k; x, c)fk=Mcritic(yk;x,c)

这种交互在当前 design harness 下产生一条执行轨迹 τ\tauτ

外层回路基于多次生成运行收集的证据,跨任务改进 design harness HHH

每个外层回路迭代经历四个阶段:rollout、evaluation、update proposal 和 acceptance gate。

  1. Rollout:当前 harness HtH_tHt 在训练集上执行,生成制品和对应轨迹。

  2. Evaluation:评估器 RmetaR_{\text{meta}}Rmeta 从七个质量维度评估制品,包括 Faithfulness、Coverage、Density、Visual Evidence、Layout、Readability 和 Aesthetics。该评估器将面向可测量属性的规则检查与面向感知属性的 VLM 判断相结合。

  3. Update Proposal:优化器 PPP 以 coding agent 的形式充当规划器和代码编辑器,分析轨迹和评分,提出候选 harness Ht+1H'_{t+1}Ht+1

    Ht+1=P(Ht,τt,st,L)H'_{t+1} = P(H_t, \tau_t, s_t, \mathcal{L})Ht+1=P(Ht,τt,st,L)

    每次迭代的更新被限制在五个 harness 组件中的恰好一个,以保持贡献归因可解释。

  4. Acceptance Gate:仅当候选在训练集上性能提升,且在独立开发集上没有下降时,才被接受:

    Accept(Ht+1)    Jtrain(Ht+1)>Jtrain(Ht)Jdev(Ht+1)Jdev(Ht)\text{Accept}(H'_{t+1}) \iff J_{\text{train}}(H'_{t+1}) > J_{\text{train}}(H_t) \land J_{\text{dev}}(H'_{t+1}) \geq J_{\text{dev}}(H_t)Accept(Ht+1)Jtrain(Ht+1)>Jtrain(Ht)Jdev(Ht+1)Jdev(Ht)

系统还支持可选的人工介入模式,用户可以在其中向 planner 提供方向性指导,或在检测到系统性偏差时修订评估器。

meta-harness 优化产生最终的 DesignHarness 架构,支持多种输出媒介,例如学术海报、幻灯片和网页。

得到的架构由四个主要阶段组成:

  1. Paper Ingestion:该阶段将输入来源和设计上下文转换为结构化、具备来源感知的上下文。它抽取文档元数据、章节大纲、关键段落和视觉证据,并将其组织成内容简报和制品计划。每个元素都保留对源位置的引用以便追溯。
  2. Artifact Generation and Revision:designer 模块以 coding agent 实现,将制品生成或修订为可编辑的 HTML 文件。这使修订能够以局部代码编辑实现,无需完整重新生成。
  3. Validation and Finalization:在每一步细化中,基于规则的验证器对缺失资源、断裂来源链接或布局违规等问题应用确定性阻断检查。如果候选通过,循环终止。如果失败,则渲染制品并由 Critic VLM 检查美学和可读性等感知属性。合并后的反馈指导下一轮修订。该循环最多允许 12 次尝试。
  4. Finalization:最佳有效候选经过后处理,包括渲染调整和资源内联,以生成自包含输出。如果在未通过所有检查的情况下尝试预算耗尽,回退机制会确定一个可交付候选。

实验

实验使用 PosterBench 对海报生成进行基准评测,该基准是一个跨五个学科、覆盖 100 篇论文的冻结评估器,结果发现 AutoDesign 在对比系统中取得了最高整体性能。消融实验隔离了 design harness,并表明它在多种模型和 coding-agent 配置上一致改善结果,同时视觉预览反馈有助于纠正布局和裁切失败。盲评人工评估将 AutoDesign 排在首位,并发现自动评分与人类偏好之间存在中等但有意义的关联,基准分数差距越大,人类判断越一致。轨迹定性分析确认,迭代诊断反馈会产生局部修复并保留有效内容。

AutoDesign 在整体海报质量上领先被评测系统,其 Claude 4.8 配置取得了最强基准结果和最高的盲评人类偏好估计。该基准对人类判断的追踪呈正向但中等相关,且当分数差距较大时,其预测与评审者更加一致。代表性修订轨迹显示,critic 反馈产生局部布局修复,同时保留有效内容。AutoDesign 取得最高的整体基准性能,领先于 Claude Design 和 OpenDesign 配置。盲评评审者相比其他系统更偏好 AutoDesign,且基准偏好海报与人类选择之间的一致性随分数差距增大而提高。

AutoDesign 配置在 PosterBench 主赛道上领先,其中 Claude Code 与 Claude 4.8 组合得分最高,Codex 组合凭借更强的美学几乎追平。Claude Design 和 OpenDesign 系统整体落后,尽管在某些维度上具有竞争力。人类偏好判断也倾向于 AutoDesign,且随着基准分数差距扩大,与人类评审者的一致性提高。AutoDesign 与 Claude Code 组合取得最强整体分数,受到高密度、布局和可读性的支撑。AutoDesign 与 Codex 几乎追平最高分,但以视觉证据和布局换取更强的美学。Claude Design 在所列系统中有最高的覆盖率和视觉证据,但较低的密度和可读性限制了其整体分数。OpenDesign 变体整体排名最低,其中 Codex 配置在视觉证据和可读性上相对较弱。人类偏好将 AutoDesign 排在 Claude Code、OpenDesign 和 Claude Design 之前,且当分数优势更大时,基准偏好海报更常与人类选择一致。

领先配置是 AutoDesign 搭配 Codex 和 GPT 5.5,它在所列系统中取得最高整体 PosterBench Score,并在 faithfulness、density、readability 和 aesthetics 上取得最高分。AutoDesign 搭配 Claude Code 和 Claude 4.8 时整体排名第二,而 OpenDesign 配置和 Claude Design 整体得分较低。Claude Design 取得最强 coverage,但被较弱的 density 和 readability 拖累。AutoDesign 搭配 Codex 和 GPT 5.5 整体领先,并在 faithfulness、density、readability 和 aesthetics 上表现最佳。在相同 coding agent 和模型下,AutoDesign 在整体分数上优于 OpenDesign 和 Claude Design。Claude Design 获得最高 coverage 分数,但在 density 和 readability 上落后,导致整体排名较低。整体最弱配置是 OpenDesign 搭配 Codex 和 GPT 5.5,与领先系统形成很大差距。

在固定的 10 篇论文子集上,AutoDesign 在 design harness 赛道领先,整体加权 rubric 分数最高,排在 OpenDesign 和 Claude Design 之前。其优势由布局和可读性驱动,尽管它在三种设计变体中视觉证据最低。在固定 AutoDesign 和 GLM 5.2 的 coding harness 赛道中,Kimi Code 以较大整体差距优于 ZCode,在大多数维度上具有广泛优势。AutoDesign 在 design harness 赛道整体领先,但视觉证据弱于 OpenDesign 和 Claude Design。Kimi Code 在大多数评分维度上优于 ZCode,尤其是在布局和可读性上有较大优势。

加入 DesignHarness 后,每个已完成配置的 PosterBench Score 都有提高,提升幅度约在 5 到 20 分之间。改进出现在多种模型和 coding-agent 组合中,低基线配置往往提升更大。最大的单项提升来自 DeepSeek V4 Pro 搭配 Claude Code。DesignHarness 在所有七个已完成配置中提高 PosterBench Score,提升约 5 到 20 分。最大提升出现在 DeepSeek V4 Pro 搭配 Claude Code,而 GPT-5.5 搭配 Codex 以及 Claude 4.8 搭配 Claude Code 等得分较高的基线配置提升幅度更温和。

AutoDesign 配置在各评测中一致取得最高整体海报质量和人类偏好,优于 Claude Design 和 OpenDesign,领先结果由布局、密度和可读性驱动,尽管一些变体在视觉证据或覆盖率上落后。当分数差异较大时,基准偏好与人类判断更一致,critic 反馈支持局部布局修复而不干扰有效内容。在固定子集比较中,AutoDesign 也在 design harness 赛道领先,而 Kimi Code 在 coding harness 中优于 ZCode。加入 DesignHarness 在所有已完成配置中提高 PosterBench 分数,且低基线配置提升更大。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供