HyperAIHyperAI

Command Palette

Search for a command to run...

LLaDA-Image:基于完全开放训练配方构建强大图像生成器

摘要

我们提出 LLaDA-Image,一个统一框架,它将一个从头训练的 6B 扩散 Transformer(DiT)与一个基于 LLaDA2.0-Mini 扩散语言模型主干构建的冻结视觉-语言理解模块配对。我们没有从一开始就严重依赖成对的图像-文本数据,而是首先通过纯图像预训练和中期训练构建强大的视觉生成先验。生成流程包含 2.2 亿个样本,其中 98% 为真实图像。为实现高效且可扩展的优化,我们在整个 DiT 中使用无参数 RMSNorm 以及 Muon 优化器。由此产生的统一模型能够生成高度逼真的图像,同时精确遵循细粒度的编辑指令。我们进一步将 LLaDA-Image 蒸馏为 LLaDA-Image Turbo,使其能够在 2 到 4 个采样步骤内实现快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文赛道分别取得了 53.53 和 53.38 的总分,在两个赛道的开源模型中均创下新的最优水平。为支持对能力强且高效的生成模型的进一步研究,我们公开了模型权重、训练代码和详细配方。

一句话总结

来自AGI研究中心与Inclusion AI的研究者提出了LLaDA-Image,一个统一框架,它将一个从头训练的6B6\text{B}6B扩散Transformer与一个基于LLaDA2.0-Mini骨干的冻结视觉-语言模块配对,使用220M220\text{M}220M样本(98%98\%98%真实图像)进行仅图像预训练,采用无参数RMSNorm和Muon优化器,在Qwen-Image-Bench上取得了最先进的开源图像生成成绩(英文53.5353.5353.53,中文53.3853.3853.38),并通过蒸馏得到LLaDA-Image Turbo,实现242--424步快速推理。

核心贡献

  • LLaDA-Image是一个统一的6B扩散Transformer,将冻结的视觉-语言模块与从头训练的DiT配对,在Qwen-Image-Bench的英文和中文赛道上均取得了最先进的开源分数。
  • 一个以真实数据为主的渐进式训练管线使用了2.2亿生成样本(98%为真实图像),并在监督微调阶段保持真实数据占比超过70%,配合无参数RMSNorm和Muon优化器稳定训练,实现高照片真实感和编辑准确性。
  • 通过TwinFlow(一种分布匹配与自对抗流蒸馏方法)将模型蒸馏为LLaDA-Image Turbo,可在2–4个采样步内完成推理,同时保持有竞争力的生成质量。

引言

图像生成系统正演变为通用视觉创作工具,必须处理多语言提示、照片级真实合成、保留参考的编辑、准确的文字渲染以及高效推理。然而,开源模型面临显著瓶颈:主流训练范式从一开始就将视觉先验学习与语言对齐绑定,导致在计算最密集的阶段需要昂贵且有损的配对描述;合成数据可以加速收敛,但常引入伪影并限制长期真实感;将生成与编辑统一起来同时保持低推理成本仍然困难。作者提出了LLaDA-Image,一个从头训练的60亿参数扩散Transformer,并提供完整的开源配方。他们通过仅图像预训练将视觉先验学习与语言对齐解耦,使用基于dLLM的统一架构进行理解、生成和编辑,采用以真实数据为主的渐进式训练管线,并通过TwinFlow将模型蒸馏为2–4步变体,同时保持整体数据预算适中,并公开权重、代码和训练配方。

数据集

作者从网络来源和精选集合中构建了一个大规模图像语料库,其中一小部分合成数据主要用于监督微调(SFT)中的文字渲染任务。该数据集为预训练和中期训练提供仅图像样本,为SFT提供成对的图像-文本样本。

  • 构成与规模

    • 整个生成训练共使用约2.2亿样本。
    • 超过90%为仅图像样本(真实图像);剩余约10%为用于SFT的成对图像-文本样本。
    • 真实图像占整个语料库的98%;合成图像仅占2%,且只出现在SFT部分。
    • SFT数据分为四组:自然、设计、人物和合成内容。在成对的SFT数据中,真实图像仍超过70%。
  • 过滤

    • 三阶段管线:元数据、美学和质量过滤。
    • 元数据:保留总像素数大于1024²且文件大小与像素比≥0.15字节/像素的图像。
    • 美学:移除ArtiMuse评分<60的图像。
    • 质量:移除DeQA-Score<4.0的图像。
  • 裁剪与分辨率

    • 预训练使用随机正方形裁剪并缩放至256×256。
    • 中期训练和SFT阶段使用宽高比桶(详见论文第4.3节)。
  • SFT的描述生成

    • 过滤后的图像由Qwen3.6-35B-A3B和Qwen3-VL-235B-A22B-Instruct生成描述,使用的提示要求忠实描述主体、属性、动作、空间关系、场景和视觉风格,并准确转录任何可见文本的原始语言。
    • 幻觉检查(由Qwen3.6-35B-A3B执行)丢弃编造物体、属性、关系或文本,或错误转录文本的描述。
    • 额外移除过滤掉格式错误输出、拒绝响应、退化重复、隐私信息和水印信号。剩余的描述构成SFT的图像-文本监督。
  • 图像编辑数据

    • 经过类似的图像质量过滤后,进行编辑指令一致性检查,仅保留源-目标对,其中指令正确描述了可见变化,且没有无依据的细节。
  • 训练中的使用

    • 仅图像真实数据用于预训练和中期训练,使模型在大规模无描述的情况下接触多样化的视觉内容。
    • 成对的图像-文本数据(配合宽高比桶)用于SFT,真实图像占比保持70%以上,合成图像保留用于文字渲染场景。

方法

作者提出了LLaDA-Image,一个统一架构,无缝支持文本到图像生成和图像编辑。该框架将高级语义解释与像素空间生成解耦,分别分配给专用组件,并通过显式连接器桥接。

如下图所示:

理解组件基于LLaDA 2.0 Mini扩散大语言模型骨干,配备SigLIP-VQ视觉编码器。它处理文本提示或编辑指令以引导生成。对于图像编辑,参考图像刻意绕过此理解阶段,直接注入生成组件。

为了桥接VLM和扩散Transformer(DiT)之间不同的表示空间,作者引入了一个理解到生成的接口。该接口由残差查询适配器(RQA)和Transformer连接器组成。RQA利用一组可学习的查询token,对多模态输入序列进行交叉注意力。这些残差查询被附加到原始输入,并由冻结的VLM骨干在单次预填充过程中处理。这促使VLM提取对生成合成最有益的多模态上下文。随后,由浅层Transformer块堆叠而成的Transformer连接器将VLM隐藏状态投影到DiT条件空间。

生成组件是一个纯单流基于Transformer的DiT。作者将每个归一化层替换为无参数RMSNorm,以提高优化稳定性。给定带噪图像隐变量、时间步和条件编码,图像和条件token被嵌入到一个共享序列中。DiT中的每个块通过联合自注意力直接建模语义条件与演化中的视觉token之间的交互。对于图像编辑,引入了一个并行的参考图像流。参考图像通过SigLIP-VQ编码,并由DiT特定的参考分支处理以产生语义token。这些token与文本条件token拼接。此外,干净的参考图像通过VAE编码,其隐变量与带噪目标隐变量在DiT输入嵌入器之前拼接。这种双通路设计为未修改区域提供了高级语义指导和原生像素级证据。

训练管线精心设计,以在视觉生成能力与文本指令对齐之前先启动视觉生成能力。作者首先进行思维链监督微调以增强骨干理解能力。然后,在256x256分辨率下进行仅图像预训练。不依赖大规模图像-文本对,而是使用冻结的VLM从未标注图像中提取语义作为自条件信号。为防止平凡的恒等映射,应用图像token掩码率,将任务转化为通过流匹配优化的稀疏到密集预测。生成器通过最小化目标LFM=E[Fθ(xt,t,hcond)(zx)22]\mathcal{L}_{\mathrm{FM}} = \mathbb{E} \left[ \| \boldsymbol{F}_{\theta}(\mathbf{x}_{t}, t, \mathbf{h}_{\mathrm{cond}}) - (\mathbf{z} - \mathbf{x}) \|_{2}^{2} \right]LFM=E[Fθ(xt,t,hcond)(zx)22]来预测恒定速度场。

预训练之后,仅图像中期训练阶段将像素预算提升至512x512,并引入基于宽高比桶的可变分辨率训练。该策略在数据并行秩之间保持每图像像素预算近乎恒定,同时保留源宽高比,防止几何失真,并使模型具备生成多样化宽高比的能力。

在监督微调期间,作者过渡到成对的文本到图像对齐。他们采用logit-normal时间步采样,将更大比例的优化预算分配给高噪声状态,提高早期去噪过程的稳定性。对齐从512x512像素开始,逐步扩展至1024x1024像素,以平滑适应更高分辨率。为在同一统一模型中支持编辑,应用混合任务继续训练,联合训练文本到图像和图像到图像编辑样本。这种平衡混合充当能力回放,防止模型在学习精确编辑指令遵循时遗忘其开放式生成质量。最后,作者应用检查点合并以抑制瞬态步依赖偏差,并采用TwinFlow进行少步蒸馏,利用共享DiT骨干和双输出头交替优化生成器和伪评分估计器。

实验

LLaDA-Image作为一个统一模型,在文本到图像生成和基于指令的图像编辑两方面进行了评估,使用了一套全面的基准测试,评估视觉质量、提示对齐、文字渲染、组合理解和双语编辑。在通用生成方面,它在Qwen-Image-Bench上建立了新的开源最先进水平,在质量、美学和对齐方面均有广泛提升,同时显示出平衡的双语文字渲染和强大的物体组合能力,但存在计数方面的弱点。在编辑方面,该模型成功地在英文和中文提示下保持了语义一致性,但感知质量落后于专门的编辑系统,指出了未来改进的方向。

理解训练阶段对约260万条打包序列(每个序列16,384个token)进行思维链监督微调。训练在512×512分辨率下进行4个epoch,全局批大小为512。监督通过块扩散(块大小为32)掩码答案token。CoT SFT使用约260万条打包序列,每个序列16,384个token。训练在512×512分辨率下运行4个epoch,全局批大小为512。监督通过块扩散方案(块大小32)中的掩码答案token应用。

生成训练管线在仅图像预训练、中期训练、监督微调和少步蒸馏阶段累计使用2.2亿样本。分辨率从256²提升至1024²,同时批大小减小,采样步在中期训练中引入,然后在微调阶段减少至2–4步。所有阶段均使用Muon优化器。预训练在256²分辨率下进行,全局批大小为24,576,而后续阶段逐步降低批大小并提高分辨率。监督微调从512²的文本对齐阶段开始,然后过渡到1024²进行细化和编辑。中期训练使用50个采样步,而监督微调阶段将其减少到2–4步,少步蒸馏作为最后阶段应用。

闭源模型在英文Qwen-Image-Bench上领先,GPT-Image 2取得了最高的总体分数65.23,以及最强的创意生成分数75.34。LLaDA-Image以53.53的总体分数建立了新的开源最先进水平,比之前的最佳开源模型高出1.87分。创意生成是所有列出模型中表现最佳的维度。GPT-Image 2在总体分数(65.23)和每个维度上均领先,创意生成达到75.34。LLaDA-Image以53.53的总体分数建立了新的开源最先进水平,比Z-Image Turbo高出1.87分。

在中文Qwen-Image-Bench上,闭源模型排名领先,GPT-Image 2以明显优势取得了最高的总体分数。所有列出模型在创意生成上表现最佳,在真实世界保真度上表现最弱。LLaDA-Image以53.38的总体分数建立了新的开源最先进水平,超越了次佳开源模型。GPT-Image 2在每个维度上均领先,创意生成达到75.23,总体分数为64.69,远超下一个闭源模型。创意生成是所有模型中最强的维度,而真实世界保真度始终得分最低,揭示了照片级真实渲染的共同弱点。

在LongText-Bench上,LLaDA-Image的长文本渲染分数为0.923(英文)和0.913(中文),低于若干竞争对手。英文最高分数为Qwen-Image 2512的0.956,中文最高分数为Boogu-Image 0.1 Turbo的0.977。LLaDA-Image的英文长文本渲染分数(0.923)落后于Qwen-Image 2512(0.956)以及Boogu-Image 0.1的两个变体。在中文长文本渲染方面,LLaDA-Image(0.913)被Boogu-Image 0.1 Turbo(0.977)和Boogu-Image 0.1 Base(0.969)超越。

该模型通过多阶段管线训练,分辨率从256²扩展到1024²,同时逐步减少采样步数,使用块扩散掩码和Muon优化器。在Qwen-Image-Bench上,它在英文和中文两方面均建立了新的开源最先进水平,创意生成是所有模型中最强的维度。然而,在长文本渲染基准上,它落后于若干竞争对手,且真实世界保真度仍是评估模型中的共同弱点。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供