HyperAIHyperAI

Command Palette

Search for a command to run...

视觉生成中文本条件化的缩放性质

Zilong Chen Chaorui Deng Kunchang Li Hongyi Yuan Haoqi Fan

摘要

我们研究了视觉生成中文本条件化的经验缩放性质。此类性质此前很少被测量,因为扩散损失并不随自然语言提示中的词元数量而缩放。令人惊讶的是,我们发现收敛后的扩散损失随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量:一种白盒似然度量(GPG)和一种黑盒属性度量(ED)。在受控训练实验中,收敛后的扩散损失随 GPG 近似线性下降,并随 ED 呈幂律关系。在这些缩放性质的指导下,我们通过利用从图像中导出的语义与几何标注构建结构化提示来提升可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏训练提示器来提升可提示性。由此得到的系统在几乎所有组合性、推理和世界知识基准上均优于所有已评估的开放权重模型,同时在大多数评估中达到或超过了最强的闭源权重模型。

一句话总结

字节跳动 Seed 研究员表明,在视觉生成中,收敛后的扩散损失随提示中的结构化语言而扩展,随白盒 GPG 指标近似线性下降,并随黑盒 ED 指标遵循幂律;他们利用这些缩放性质,通过结构化提示改善可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏改善可提示性,在几乎所有组合性、推理和世界知识基准上超过所有被评估的开放权重模型。

核心贡献

  • 通过采用白盒视觉接地指标(GPG)和黑盒属性指标(ED),引入视觉生成中文本条件的经验缩放性质,并表明收敛后的扩散损失随 GPG 近似线性下降,随 ED 遵循幂律。
  • 通过构建由图像派生的语义和几何标注的结构化提示来改善可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏训练提示生成器来改善可提示性;匹配自然语言重训练表明,结构化表示的收益并非仅由额外训练带来。
  • 所得系统在几乎所有组合性、推理和世界知识基准上超过所有被评估的开放权重模型,并在大多数评估中达到或超过最强的闭源权重模型。

引言

文本到图像生成已经扩大了模型规模和数据规模,但与语言模型不同,它从图像-文本对中学习,而不是从视觉信号本身学习。图像描述经常以模糊的方式约束视觉内容或将其省略,因此更长的自然语言提示并不能可靠地改善生成,现有系统仍然难以处理涉及物体、布局、关系和视觉一致性的密集提示。作者围绕描述信息而不是描述长度重新定义该问题。他们引入了结构化提示,这是一种基于 JSON 的语义模式,其中包含场景上下文、逐元素属性和几何信息以及跨元素关系的显式字段,并采用基于图像的指标来量化描述信息量。这些指标可在固定训练条件下预测收敛后的扩散损失;通过训练一个 LLM 提示生成器在测试时推断结构化字段,可得到一个无需更改扩散架构即可改善组合生成的端到端系统。

数据集

数据集描述

  • 语料与标注目标 作者使用一组固定的训练图像和源标注,但摘录未报告原始语料规模、原始数据来源或过滤规则。每张训练图像都用忠实的全模式 L10 场景提示进行标注,所得的 SP 级别被用作扩散训练的结构化监督。

  • 标注管线 作者通过五个阶段的管线构建从图像到 SP 的监督:

    • 阶段 1:读取完整图像以建立全局语义:意图、场景、氛围、风格、光照、相机设置,以及带标识符和边界框的有序元素清单。
    • 阶段 2:重新查看每个元素裁剪区域,使 VLM 能够解析局部描述、属性、动作和摄影信息。人物元素还接收 Sapiens 133 关键点姿态叠加,以帮助确定身体左右朝向和关节几何。
    • 阶段 3:添加来自 DepthAnything V2 的相对深度几何证据,以及来自 SAM 2.1 的掩码和遮挡线索。边界框、掩码和深度支持重叠、包含、相对位置和深度顺序。
    • 阶段 4:协调全局语义、裁剪级语义和几何证据,以序列化一个格式良好的 L10 SP。专家输出约束标注而不是被原样复制;推断的姿态可以文本形式存储,而关键点和掩码仍为中间证据。
    • 阶段 5:将 L10 标注投影到受控字段阶梯 L5-L9。
  • 子集与受控字段阶梯 L5 到 L9 由每个完整 L10 SP 通过预定义字段组的确定性掩码派生。从 L5 到 L10 依次恢复:

    • 边界框
    • 场景上下文
    • 动态属性
    • 深度与关系
    • 元素级摄影信息

    每个级别都是同一 L10 标注的投影,因此图像和源标注保持固定;只有暴露给学习器的描述内容和组织方式发生变化。NL 对照是从相同的底层标注证据独立语言化得到的,而不是从 SP JSON 转换而来。

  • 在模型中的使用 SP 级别在扩散训练中用作结构化监督。评估时,一个冻结的 Gemini 3 Pro 为每个用户提示零样本生成一个 L10 SP。L5-L9 由同一输出派生,并由在相应级别训练的 BAGEL diffuser 渲染。论文报告,随着模式丰富度增加,GenEval2 GM 和顺序交换的 GSB 呈现单调改善。逐字段消融确定全局场景上下文是最大的单个贡献因素,其次是边界框条件。

  • 处理与元数据说明 关键处理细节包括由边界框定义的元素裁剪、姿态关键点叠加、深度图、掩码和遮挡线索。最终元数据是带有字段组的序列化全模式 SP;较低 SP 级别是确定性掩码,不是新的标注。

方法

作者提出一个以结构化提示(Structured Prompt,SP)为中心的文本到图像生成框架,SP 是一种有类型的 JSON 描述,将基于图像的变量组织到命名字段中。该 SP 充当大语言模型(LLM)提示生成器与扩散模型之间的共享接口,旨在同时最大化可扩散性和可提示性。

SP 在三个不同范围内组织基于图像的信息。全局字段描述整体意图、场景、氛围和光照。每个前景对象都有一个逐元素条目,详细说明其身份、属性、动作、边界框位置和可选深度。跨元素关系将这些条目绑定在一起。作者通过固定骨干重建探针表明,逐步恢复这些 SP 字段可改善重建指标,而单纯加长自然语言描述则性能持平。

为了量化不同描述格式所暴露的信息,作者引入两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。GPG 测量当配对图像显示给一个冻结的视觉语言模型时的对数似然增益,计算公式为:

GPG(y,I)t=1Tmt[logpM(ytI,y<t)logpM(yt,y<t)]\mathrm{GPG} (y, I) \triangleq \sum_{t = 1}^{T} m_{t} \Big [ \log p_{M} (y_{t} \mid I, y_{< t}) - \log p_{M} (y_{t} \mid \varnothing, y_{< t}) \Big ]GPG(y,I)t=1Tmt[logpM(ytI,y<t)logpM(yt,y<t)]

ED 通过将描述属性与基于图像的参考集进行匹配,提供一种语义度量,报告为 F0.5(PA,RA)F_{0.5}(P_{A}, R_{A})F0.5(PA,RA)

作者建立了缩放性质,表明收敛后的扩散训练损失可以很好地由 GPG 的线性函数拟合,并随 ED 呈幂律趋势。这种校准使得描述信息量能够预测相同预算下收敛后的扩散损失。

为了在语料规模上提高可扩散性,作者开发了一个五阶段图像到 SP 标注管线。该管线结合通用视觉语言模型与冻结的领域专家,以提取姿态和几何证据。

该管线首先建立共享语义框架,恢复全局意图并创建元素清单。然后重新访问每个元素裁剪区域以解析局部描述,利用 Sapiens 获取人体姿态关键点。补充的几何证据通过 DepthAnything V2 提供相对深度,通过 SAM 2.1 提供掩码和遮挡线索。最后的组装阶段协调这些证据与全局和裁剪级语义,以序列化格式良好的 SP。为了将模式丰富度与标注质量分开,该管线对预定义字段组进行确定性掩码,从完整标注中派生较低级别的 SP。

推理时没有配对图像可用,因此 LLM 提示生成器必须从用户请求中推断合理的视觉细节来实例化 SP。作者通过分阶段训练管线提高可提示性,包括监督微调(Supervised Fine-Tuning,SFT)、冷启动蒸馏和强化微调(Reinforcement Fine-Tuning,RFT)。SFT 教授 diffuser 期望的 SP 内容分布。冷启动蒸馏利用图像条件教师生成的轨迹,教会提示生成器从用户提示推理到详细 SP。RFT 超越离线轨迹,进入提示生成器自身的 rollout。验证器使用保守阈值过滤这些轨迹,On-Policy Self-Distillation(OPSD)在接受的轨迹上训练提示生成器,通过最小化无图像提示生成器与图像条件教师之间的散度:

LOPSD(θ)=Eτπθ,τ accepted[1TτtTτD(π(τ<t,prompt,I),πθ(τ<t,prompt))]\mathcal{L}_{\mathrm{OPSD}} (\theta) = \mathbb{E}_{\tau \sim \pi_{\theta}, \tau \text{ accepted}} \left[ \frac{1}{|\mathcal{T}_{\tau}|} \sum_{t \in \mathcal{T}_{\tau}} D \left(\pi^{\star} (\cdot \mid \tau_{< t}, \text{prompt}, I), \pi_{\theta} (\cdot \mid \tau_{< t}, \text{prompt})\right) \right]LOPSD(θ)=Eτπθ,τ accepted[Tτ1tTτD(π(τ<t,prompt,I),πθ(τ<t,prompt))]

这一过程确保提示生成器学会生成详细且结构一致的 SP,从而有效条件化扩散模型。

实验

实验将完整的提示生成器-diffuser 管线与代表性文本到图像模型进行对比,然后通过固定模式和 diffuser、改变 LLM 后端和训练阶段来分离可提示性,最后测试推理时迭代优化。结构化提示接口相比基线和匹配自然语言对照带来广泛提升;训练后的提示生成器能传递 LLM 进展,并改善结构组合、布局和文本保真度,其中任务特定训练的贡献大于零样本模式填充。迭代式“精化-渲染-判断”优化进一步改善结构和对齐,但收益在几轮后饱和,表明提示生成器训练吸收了大部分收益,长周期提示侧推理并不是强烈必需的。

从基础级别到完整模式逐步恢复更丰富的结构化提示生成器字段,在 GenEval2 GM 和 GSB 上相对基础级别产生单调收益。当引入场景上下文、动态属性以及深度和关系时,收益尤其明显。由于每个级别使用在该级别训练的 BAGEL diffuser,这些结果不能与 Qwen-Image 系统直接比较。随着每个更丰富的字段组加入,两项评估指标均改善,同时每个结构化提示生成器的平均 tokens 数从 447 增加到 1374。GSB 相对基础级别的最大单步增益出现在添加场景上下文时,GenEval2 的最大改善出现在添加动态属性时。

结构化提示文本到图像系统在开放权重模型中以物体为中心、密集提示跟随、世界知识和推理导向基准上取得领先或并列结果,并在大多数指标上达到或超过代表性闭源系统。在相同 Qwen-Image 骨干上的匹配对比显示,官方提示增强和匹配自然语言重训练会提高分数,但仍远低于结构化提示系统,表明共享的结构化描述接口是收益来源。这些收益出现在多种提示场景和评估器上,而不仅限于单一设置。在被评估的开放权重系统中,结构化提示模型在几乎所有报告指标上领先或并列,并在大多数指标上达到或超过闭源系统,收益涵盖物体对齐、密集提示跟随、世界知识和推理。在相同架构上的受控对比表明,官方提示增强和匹配自然语言重训练远远落后于结构化提示系统,说明结构化描述接口是关键因素,而不是模型规模或训练本身。

在固定模式和图像生成器的情况下,零样本结构化提示相比自然语言重写在对齐和偏好上有所改善,但会降低 DPG-Bench 和结构分数。训练提示生成器可弥补这一差距,成为所有四项指标上最强的单轮后端。原生多轮 coding agents 提供额外收益,而使用训练后提示生成器的迭代式“精化-渲染-判断”循环超越了最强的 coding agent,同时缩短了优化轨迹。零样本模式填充相比同个 LLM 的自然语言重写改善了对齐和 GSB,但持续降低 DPG-Bench 和结构。训练提示生成器使其在 DPG-Bench、结构、对齐和 GSB 上成为最强的单轮后端。coding-agent 行同时改变了模型和推理过程,因此不能单独隔离后端模型。通过迭代优化,训练后的提示生成器达到比最强 coding agent 更高的 GSB,并且平均所需轮数少于基础提示生成器。

累积式提示生成器训练改善结构和偏好,其中监督微调带来最大的单阶段结构增益,冷启动进一步改善结构和偏好,同时略微降低对齐。在 RFT 变体中,验证器门控 OPSD 在 DPG-Bench、结构、对齐和偏好上达到最强终点,超过验证器奖励 GRPO 和无门控 OPSD。这表明将高置信度 rollout 选择与密集图像条件目标结合起来,比仅奖励或无门控优化更有效。SFT 产生最大的单阶段结构增益,并相比基础提示生成器建立明显偏好。验证器门控 OPSD 取得最强整体指标,而冷启动以轻微对齐代价改善结构和偏好。

在模式、图像骨干、判断器和提示生成器权重保持不变的情况下,零样本和训练后的提示生成器都随着优化预算增加而改善。结构质量和布局质量的收益大于基本对齐的收益。训练后的提示生成器从更强的起点出发,以更少轮数达到通过输出,并且额外优化的收益快速递减。增加“精化-渲染-判断”轮数对两种提示生成器的结构改善都大于对齐改善,表明反馈主要修复对象分解、关系和布局。训练后的提示生成器在单轮时就在结构和净偏好上超过零样本提示生成器最好的八轮结果,并且平均通过判定所需轮数更少。对训练后的提示生成器来说,从四轮增加到八轮只会增加少量结构和偏好收益,因此迭代修正会很快饱和。

实验通过模式消融、受控模型对比、后端变体、提示生成器训练阶段和优化预算来评估结构化提示文本到图像管线。更丰富的结构化字段持续改善生成质量,其中场景上下文和动态属性带来最大收益;相同骨干对比将改进主要归因于结构化描述接口,而不是模型规模或训练本身。训练提示生成器,尤其是采用验证器门控 OPSD,产生最强的单轮结果;迭代式“精化-渲染-判断”优化进一步改善结构和偏好,但在几轮后饱和。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供