HyperAIHyperAI

Command Palette

Search for a command to run...

通过概念缩放与密集监督释放图像编辑潜力

Long Cui Xiaoqian Liu Qi Qin Yi Xin Tao Lin Jianguo Li Linfeng Zhang

摘要

现有图像编辑框架主要遵循文本到图像扩散模型的训练范式。然而,将这一范式扩展到图像编辑会凸显两个固有差异,即对编辑概念粒度的关注不足,以及稀疏监督信号导致的训练低效。为解决这些问题,我们建立了一个包含 1000 多个细粒度编辑概念的全面层级分类体系,并通过改进的合成框架构建了 ConceptEdit-12M,一个包含 1200 万高质量编辑对的大规模数据集。这种以库为驱动的方法有效纠正了生成数据的分布坍缩,同时保证了较高的数据保真度。此外,我们提出了一种密集监督训练策略,将多个互不干扰的概念合成到单张图像对中。通过提供更丰富的学习信号,该策略显著提升了训练效率和整体模型性能。训练结果验证了我们的策略,显著优于先前工作。最后,我们提出了 ConceptEdit-Bench,这是一个细粒度评估套件,旨在诊断模型在大量真实世界场景中的能力。

一句话总结

来自上海交通大学和蚂蚁集团的研究人员针对图像编辑的局限性,构建了包含 1000 多个细粒度编辑概念的层次化分类体系以及包含 1200 万对样本的数据集 ConceptEdit-12M,并提出一种稠密监督训练策略,将多个互不干扰的概念合成到单个图像对中,以提升训练效率和性能;同时提出了用于细粒度评估的 ConceptEdit-Bench。

核心贡献

  • 本文提出编辑概念扩展,将数据扩展从源图像多样性转向编辑概念丰富度,通过包含 1000 多个细粒度类别的层次化分类体系实现。该分类体系是 ConceptEdit-12M 的基础,这是一个包含 1200 万对样本的编辑数据集,通过 LLM 蒸馏的合成框架和实例特定 VQA 过滤构建,以保证覆盖率和保真度。
  • 稠密监督训练策略将多个互不干扰的编辑组合到单个图像对中,提供更丰富的学习信号。该策略使训练收敛速度提升 1.5 倍,并改善单概念和多概念编辑性能。
  • ConceptEdit-Bench 作为覆盖细粒度分类体系的细粒度评估套件被提出,所提方法取得了最先进的结果,在多种真实场景中优于 ScaleEdit 和 UnicEdit 等基线。

引言

近期的文本到图像扩散模型使基于指令的图像编辑变得实用,能够在保持原始图像上下文的同时进行局部修改。然而,此前的编辑数据集和训练流程主要扩展源图像多样性,很少关注编辑概念的多样性和细粒度。它们还将编辑视为稠密全局合成,尽管编辑在空间上是稀疏的,这限制了训练效率。作者认为编辑概念的丰富度才是泛化的真正瓶颈。他们提出一种结构化范式,包括超过 1000 个细粒度编辑概念的层次化分类体系、将多个局部编辑合成到单个图像对中的稠密监督策略,以及带实例特定 VQA 过滤的 LLM 引导合成框架。由此得到 ConceptEdit,这是一个包含 1200 万样本的数据集和细粒度基准,旨在提升编辑能力和训练效率。

数据集

作者引入了两个相关的数据集产物:

  • ConceptEdit-12M:1200 万对经过验证的图像编辑对,通过改进的合成框架生成。该数据集围绕一个包含 1000 多个细粒度编辑概念的编辑概念库构建。
  • ConceptEdit-Bench:一个评估基准,由从同一概念库中选取的 1000 个不同编辑类别构建。源图像采样自高质量开源数据集,覆盖多样的视觉类别。

数据集构建与处理

  • 编辑概念库构建:该过程从一个较小的人工初始化种子分类体系开始。LLM 通过合并或剪除冗余概念、外推新的中间子类别以及填充具体的叶节点来迭代扩展该体系。随后人类专家对分类体系进行细化,以解决语义重叠并补充缺失的边界情况。
  • 语义匹配与指令生成:对于源图像,作者采样一个大小为 NNN 的候选概念子集。然后 VLM 输出匹配的概念、编辑指令和 VQA 验证标准。类别频率被跟踪,采样权重被自适应调整以防止分布坍缩。随机探索机制还可以允许 VLM 在候选集之外提出新的概念。
  • 图像合成:编辑模型根据文本编辑指令生成目标图像。
  • 实例特定 VQA 过滤:生成的问答对被用作实例特定验证。VLM 检查容易发生编辑失败的局部区域,执行 Chain-of-Thought 推理,并支持通过重新描述丢弃低质量样本或细化指令。

数据使用方式

  • ConceptEdit-12M 作为高质量图像编辑对的大规模来源,每个样本连接源图像、目标图像、编辑指令和生成的 VQA 验证标准。
  • ConceptEdit-Bench 用于跨 1000 多个编辑概念的细粒度评估,可以有选择地监控特定能力,而不是仅依赖单一综合分数。
  • 所提供的文本未明确说明 ConceptEdit-12M 的训练、验证或测试集划分比例。

方法

作者指出图像编辑泛化中的一个关键瓶颈:编辑概念的分布坍缩。当前流程依赖视觉语言模型(VLM)基于有限的粗粒度类别随机生成指令。这种无约束的依赖导致严重偏差。例如,在“风格迁移”类别中,随机采样导致排名前 5 的风格占据 74.6% 的生成指令,而数十种其他风格占比不到 1%。

为克服这一问题,作者提出从随机 VLM 生成转向结构化、库驱动方法的范式转变。通过显式地用 1000 多个细粒度类别填充指令空间,可以确保对各种视觉变换的均匀覆盖,并建立稳健的概念基础。

基于这些见解,作者提出一种改进的合成框架,旨在生成具有可控概念分布的高保真图像编辑对。该流程包含四个关键阶段。

该框架的核心是构建一个全面的编辑概念库。作者不再局限于少量人工预定义的粗粒度类别,而是将规模扩展到 1000 多个细粒度类别,以确保高概念密度。从一个轻量级、人工初始化的种子分类体系开始,LLM 被提示持续评估并动态扩展分类树。在每次迭代中,LLM 合并或剪除冗余概念,外推新的中间子类别,并填充跨多个领域的高度具体的叶节点。这个自扩展循环重复进行,直到语义扩展收敛。最后,人类专家对分类体系进行细化,以解决语义重叠并补充缺失的边界情况。

概念库的极端细粒度需要严格的语义对齐,以确保概念与图像上下文之间的兼容性。作者使用 VLM 生成器 Φ\PhiΦ。对于源图像 III,采样一个大小为 NNN 的候选概念子集 CcandClib\mathcal{C}_{\mathrm{cand}} \subset \mathcal{C}_{\mathrm{lib}}CcandClib,匹配过程形式化为:

Φ(I,Ccand){(ck,tk,vk)}k=1M,s.t.MN\Phi \big(\mathbf{I}, \mathcal{C}_{\mathrm{cand}} \big) \mapsto \big \{(c_{k}, t_{k}, v_{k}) \big \}_{k=1}^{M}, \quad \text{s.t.} M \leq NΦ(I,Ccand){(ck,tk,vk)}k=1M,s.t.MN

其中 ckCcandc_{k} \in \mathcal{C}_{\mathrm{cand}}ckCcand 表示匹配的概念,tkt_{k}tk 是生成的编辑指令,vkv_{k}vk 表示随附的 VQA 验证标准。通过跟踪 1000 多个类别的频率,Ccand\mathcal{C}_{\mathrm{cand}}Ccand 的采样权重被自适应调整以防止分布坍缩。此外,随机探索机制允许 VLM 以预定义概率自主提出新概念。在指令生成之后,调用编辑模型根据文本指令生成目标图像。

为确保合成编辑对的质量,作者实施实例特定 VQA 过滤。利用指令阶段生成的定制问答对 vkv_{k}vk,有针对性的查询引导 VLM 检查容易发生编辑失败的局部区域。这种结构化询问促进了 Chain-of-Thought 推理,使 VLM 能够系统地评估指令与视觉修改之间的一致性,从而提高对细微错位的检测能力。

单概念编辑的固有稀疏性限制了整体训练效率,因为被修改区域通常只占图像的一小部分。为解决这个问题,作者提出将多个互不干扰的编辑概念组合到单个图像对中,这一策略被形式化为通过组合实现稠密监督。VLM 驱动的聚合器 Ψ\PsiΨ 执行组合选择和指令聚合。对于源图像 III,采样候选概念子集 {(cn,mn)}n=1N\{(c_{n}, m_{n})\}_{n=1}^{N}{(cn,mn)}n=1N,其中 cnClibc_{n} \in \mathcal{C}_{\mathrm{lib}}cnClib 是编辑概念,mnm_{n}mn 是其对应的编辑区域。该过程形式化为:

Ψ(I,{(cn,mn)}n=1N)(Tcomp,Vcomp,{(ck,mk)}k=1M),s.t.mimj=,ij,MN\Psi \big(\mathbf{I}, \{(c_{n}, m_{n})\}_{n=1}^{N} \big) \mapsto \big(T_{\mathrm{comp}}, V_{\mathrm{comp}}, \{(c_{k}, m_{k})\}_{k=1}^{M} \big), \quad \text{s.t.} m_{i} \cap m_{j} = \emptyset, \quad i \neq j, \quad M \leq NΨ(I,{(cn,mn)}n=1N)(Tcomp,Vcomp,{(ck,mk)}k=1M),s.t.mimj=,i=j,MN

其中 MMM 表示成功选择的概念数量。约束 mimj=m_{i} \cap m_{j} = \emptysetmimj= 确保所选编辑区域在空间上不相交,从而防止视觉或概念干扰。该映射产生一条统一的指令 TcompT_{\mathrm{comp}}Tcomp、一份全局验证清单 VcompV_{\mathrm{comp}}Vcomp 以及所选概念对的集合。这一策略起到空间数据压缩的作用,显著提高每个样本的信息熵。通过在单次前向传播中提供稠密监督信号,模型被迫将更多表示容量分配给学习结构变换,而不是背景保持,从而在经验上加速收敛。

实验

实验使用 Z-Image 框架在 ImgEdit-Bench 和 GEdit-Bench 上评估所提出的 ConceptEdit 数据集,训练规模分别为 2M 和 5M。对比结果表明,ConceptEdit 持续优于 UnicEdit 和 ScaleEdit,收益主要集中在指令遵循准确率上,反映了细粒度编辑概念的益处。消融实验进一步验证,扩展概念多样性可以改善泛化,混合复合编辑可以提供稠密监督并降低数据需求,实例特定 VQA 过滤比通用验证更有效地检测局部伪影和幻觉。

具有稠密监督的 ConceptEdit 在 2M 和 5M 训练规模下均取得可比方法中最高的 ImgEdit-Bench 综合得分,并且在更大规模下相对最强基线的领先优势扩大。将编辑概念多样性从 10 个概念扩展到 1000 个概念带来稳定收益,而添加复合编辑在不同规模下提供进一步的一致改进。复合监督的收益在 5M 规模下扩展到 Adjust、Replace 和 Act 等类别。具有稠密监督的完整 ConceptEdit 框架在 2M 和 5M 规模下均领先整体性能,在 5M 规模下相对 ScaleEdit 的差距更大。将编辑概念从 10 扩展到 1000 在两个规模下均改善整体性能,ConceptEdit1000 在 5M 规模下明显优于 ConceptEdit10。添加复合编辑在不同规模下持续提高综合得分,在 5M 规模下 Adjust、Replace 和 Act 的收益显著,且超出复合任务本身。ConceptEdit 在 Add、Style、Background 和 Action 等类别上相对先前基线表现出明显的类别级优势。

在 2M 规模下,ConceptEdit 变体在英文和中文的指令遵循及 GEdit-Bench 综合得分上均领先 ScaleEdit 和 UnicEdit。带复合稠密监督的完整配置取得了最强的整体和指令遵循结果,而将概念类别从粗粒度扩展到细粒度带来显著收益。5M 规模的结果同样显示概念扩展改善了两种语言的指令遵循。带复合监督的完整 ConceptEdit 配置在 2M 规模下取得了英文和中文中最高的整体和指令遵循得分。稠密监督在英文指令遵循上明显优于 ConceptEdit1000 基线。将概念类别从 10 扩展到 500 或 1000 可以提高指令遵循,5M 结果显示英文和中文均有收益。

在按 Gemini-3-Pro 伪标签判断时,实例特定 VQA 过滤流程在精确率、召回率、F1 分数和准确率上均优于通用 VLM 验证基线。最大的改进在召回率上,表明定制的区域感知检查比统一的整体提示捕获更多局部幻觉和细微失败。过滤后的结果更接近伪标签参考,但未达到完全一致。召回率在所有评估指标中增益最大,这与局部伪影检测的改进一致。精确率、F1 分数和准确率均相对通用验证有所提升,但仍低于 Gemini-3-Pro 伪标签上限。

实验在 2M 和 5M 训练规模下评估 ConceptEdit,测试了稠密监督、将概念多样性从 10 扩展到 1000 个类别以及添加复合编辑。稠密监督、更广泛的概念覆盖和复合监督持续改善英文和中文的整体图像编辑及指令遵循,并在 Add、Style、Background 和 Action 上获得类别级收益。所提出的实例特定 VQA 过滤也优于通用验证,尤其在召回率上,表明其能更好地检测局部幻觉和细微失败。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供