HyperAIHyperAI

Command Palette

Search for a command to run...

图像生成

WithEveryone:面向群组图像生成的统一规划与身份锚定框架

Hengyuan Xu Qixun Wang Yiji Cheng Miles Yang Zhao Zhong Wei Cheng Xingjun Ma Yu-Gang Jiang

摘要

当场景需要包含多个指定人物时,保持身份一致的图像生成会变得愈发不可靠。除了保留每个身份外,模型还必须将每个参考图像绑定到不同的人物和位置,而训练时的身份损失则需要在多个带噪声的预测人脸之间建立对应关系。我们提出 WithEveryone,一个可生成最多包含十个参考身份的群组图像的统一框架。WithEveryone 将每个选定身份作为带地址的令牌注入,预测结构化的身份–布局规划,并将该规划渲染为视觉条件。其核心目标——布局锚定的身份损失(Layout-Grounded ID Loss),利用标注的人脸区域直接监督预期的身份,避免了不稳定的基于嵌入的人脸匹配;身份表征强制(ID Representation Forcing)则在图像合成前额外为每个身份训练一个预测。在一个身份不相交的基准测试上,WithEveryone 取得了最高的目标上下文身份相似度,将人脸相似度从 GPT-Image 2 的 0.462 提升至 0.499,同时将复制粘贴伪影从 0.169 降低至 0.055。此外,它覆盖了 97.3% 的请求身份,重复率仅为 2.8%。这些结果表明,显式的身份–布局锚定使身份保持生成能够扩展到更大规模的群组,而无需依赖直接的参考人脸复制。

一句话总结

复旦大学、腾讯和香港大学的研究者提出 WithEveryone,一个统一的群组图像生成框架,通过注入地址化身份 token、预测结构化的身份–布局计划,并使用 Layout-Grounded ID Loss 直接监督目标人脸,在最多十人的身份相似度上达到 0.499(对比 GPT-Image 2 的 0.462),并将复制粘贴伪影降至 0.055(对比 0.169),实现最先进的性能。

核心贡献

  • WithEveryone 是一个统一的多模态框架,通过将每个参考身份绑定到一个地址化 token、预测结构化的身份–布局计划,并将该计划渲染为视觉条件,生成最多包含十个参考身份的群组图像。
  • Layout-Grounded ID Loss 利用标注的人脸区域直接监督目标身份,避免不稳定的基于嵌入的人脸匹配,而 ID Representation Forcing 在图像合成前增加逐身份的监督预测。
  • 在身份不相交的基准上,WithEveryone 实现了最高的目标上下文身份相似度 0.499(对比 GPT-Image 2 的 0.462),将复制粘贴伪影从 0.169 降至 0.055,并覆盖了 97.3% 的请求身份,重复率为 2.8%。

引言

统一多模态模型现已能够从文本生成高保真图像,但面向大群组(五到十人)的身份保持生成仍未解决:现有方法只能处理少数身份,随着人数增加,身份信号被稀释,人脸出现重复,空间关系被破坏。先前的身份损失依赖基于嵌入的匹配,当生成的人脸在训练早期几乎相同时,监督会相互抵消。作者提出 WithEveryone,一个统一框架,将每个参考身份绑定到一个地址化 ID token,应用 ID Representation Forcing 保持身份区分,并引入 Layout-Grounded ID Loss,利用布局标注在各自区域内监督每张人脸,从而消除匹配问题。结构化的 Layout Chain of Thought 规划人物位置、姿态和身份–布局绑定,实现连贯的多人图像生成。在五到十人的基准上,WithEveryone 的身份相似度更高,复制粘贴伪影更少,优于 GPT-Image 2 等专有系统。

数据集

作者从真实群组照片构建训练数据集,每张照片包含多人。每个样本按因果顺序包含以下部分:

  • 照片中出现的个体的参考图像,以及文本提示。
  • 身份选择ID 加载步骤,确定使用哪些身份。
  • 布局规划,指定每个人的边界框和面部关键点。
  • 从规划的框和关键点生成的渲染布局条件
  • 群组场景的重新描述(文本描述)。
  • 身份预测(每张人脸的目标 ArcFace 嵌入)。
  • 目标群组图像本身。

完整的标注流水线(从真实照片自动提取这些信号)详见附录 C.1。数据集以因果、下一步预测的方式训练模型:文本 token(连接文本、布局 token、摘要、重新描述)通过下一 token 预测进行监督;目标图像潜变量通过流匹配进行监督;身份预测通过余弦对齐损失进行监督。

一个关键处理细节是 Layout-Grounded ID Loss。由于布局标注为每个参考身份提供固定的目标人脸边界框,预测图像和目标图像在这些相同区域进行裁剪。这无需任何匹配步骤即可得到完美配对的人脸裁剪,使得身份监督即使在五到十人的群组中也能可靠工作。裁剪结果由 ArcFace 编码,损失仅在低于某个时间步阈值时应用,此时一步干净图像估计包含可识别的人脸。

方法

作者提出 WithEveryone,一个用于从文本提示和五到十个参考身份生成群组图像的模型。该模型采用 transfusion 风格的混合 transformer 多模态架构。在此框架中,文本和结构化推理通过自回归预测,目标图像潜变量通过流匹配学习。这种共享的因果上下文使得图像生成前的高层决策能够直接条件化后续的图像 token。

参考框架图:

在合成目标图像之前,模型准备三种互补条件。它选择参与场景的参考身份并为每个身份加载紧凑表示,预测结构化的多人布局以及身份与规划人物之间的关联,最后从累积的上下文中预测目标身份表示。渲染的布局条件和表示支架共同条件化基于流的图像生成。

为处理身份绑定,模型首先从可用参考中识别参与身份。对于每个选定的人物,作者提取 512 维 ArcFace 嵌入,通过轻量级 MLP 映射到模型隐藏维度,并在对应的 ID token 位置注入。选择和绑定是有序的,而非相互依赖。模型输出选定的身份列表,并为每个选择加载一个 ID token,与具体人物的绑定在布局阶段完成。这种 ID–布局绑定为每个加载的身份赋予空间角色。

然而,加载 ID token 并不能保证图像生成会使用它们。为此,作者引入 ID Representation Forcing。对于每个具有目标对应关系的选定参考身份,在目标图像前放置一个表示 token。主干网络根据前置的提示、视觉参考、ID token 和布局推理计算其隐藏状态 hirep\mathbf{h}_i^{\mathrm{rep}}hirep,输出投影器 goutg_{\mathrm{out}}gout 将其映射到 ArcFace 空间:

e^i=gout(hirep),LRF=1Mi=1M(1cos(e^i,eitgt)),\hat{\mathbf{e}}_i = g_{\mathrm{out}}(\mathbf{h}_i^{\mathrm{rep}}), \qquad \mathcal{L}_{\mathrm{RF}} = \frac{1}{M} \sum_{i=1}^{M} \left(1 - \cos\left(\hat{\mathbf{e}}_i, \mathbf{e}_i^{\mathrm{tgt}}\right)\right),e^i=gout(hirep),LRF=M1i=1M(1cos(e^i,eitgt)),

其中 eitgt\mathbf{e}_i^{\mathrm{tgt}}eitgt 是目标图像中对应人物的 ArcFace 嵌入,MMM 是受监督的身份数量。该损失直接对齐来自共享上下文的连续身份预测,生成的隐藏状态因果性地对后续图像 token 可用,形成用于生成的身份支架。

对于空间关系,作者形式化了一个结构化的 Layout Chain of Thought(CoT)。模型自回归地预测身份–布局绑定、人物和人脸区域、身体范围以及姿态关键点,使用离散化的坐标词汇。各阶段按固定因果顺序输出,因此每个决策都条件化于已确定的身份和区域。预测的计划随后被解析并渲染为画布,将规划的人脸区域、身体区域和姿态骨架绘制到目标宽高比的空白图像上,并作为条件图像插入上下文。

如下图所示:

每个训练样本按因果顺序交错排列参考图像和提示、身份选择和 ID 加载、布局规划、渲染的布局条件、重新描述、身份预测以及目标图像。

为在生成的人脸中保持身份,作者引入 Layout-Grounded ID Loss(LG-ID Loss)。不依赖在群组规模增大时失效的噪声匹配算法,对应关系已由监督 Layout CoT 的标注所知。每个参考身份携带固定的目标人脸边界框及其关键点。在相同区域裁剪预测图像和目标图像,使得每对裁剪结果在构造上正确。裁剪结果由 ArcFace 编码,损失仅在低于某个时间步阈值时应用。给定噪声潜变量 xt\mathbf{x}_txt 和反向流约定下的预测速度 vθ(xt,t)\mathbf{v}_\theta(\mathbf{x}_t, t)vθ(xt,t),LG-ID Loss 使用的一步干净图像估计为:

x^clean=xttvθ(xt,t).\hat{\mathbf{x}}_{\mathrm{clean}} = \mathbf{x}_t - t \mathbf{v}_\theta(\mathbf{x}_t, t).x^clean=xttvθ(xt,t).

总体目标结合了文本和布局 token 的下一 token 预测、目标图像潜变量的流匹配以及身份预测的余弦对齐:

L=LNTP+λFMLFM+λRFLRF+λIDLID.\mathcal{L} = \mathcal{L}_{\mathrm{NTP}} + \lambda_{\mathrm{FM}} \mathcal{L}_{\mathrm{FM}} + \lambda_{\mathrm{RF}} \mathcal{L}_{\mathrm{RF}} + \lambda_{\mathrm{ID}} \mathcal{L}_{\mathrm{ID}}.L=LNTP+λFMLFM+λRFLRF+λIDLID.

作者设置 λFM=1.0\lambda_{\mathrm{FM}} = 1.0λFM=1.0λRF=1.0\lambda_{\mathrm{RF}} = 1.0λRF=1.0λID=0.5\lambda_{\mathrm{ID}} = 0.5λID=0.5。推理时,模型自回归地预测身份选择、Layout CoT 和重新描述,渲染器根据预测的计划确定性地构建布局条件。目标身份嵌入仅作为表示强制的训练目标。

实验

评估使用一个包含 210 张群组图像的新基准,其中包含 5–10 个未见过身份以测试泛化能力。跨模型比较显示,WithEveryone 实现了最高的目标上下文身份相似度和覆盖率,且复制粘贴伪影较低,随着群组规模增大,性能下降更平缓。消融实验揭示,基于布局的身份监督(LG-ID Loss)对身份和构图提升贡献最大,而布局规划质量仍是关键瓶颈。分析证实,人脸尺寸不能解释规模退化,且 Representation Forcing 催生了身份特定的注意力。

WithEveryone 实现了最高的目标上下文身份相似度和几乎完整的参考身份覆盖,重复率极低,同时复制粘贴伪影保持较低水平。通用开源模型通常无法组成完整群组,覆盖率低于 0.42。某些模型(如 GPT-Image 2)的高参考相似度伴随着更高的复制粘贴,表明其倾向于僵硬的人脸复制而非上下文适应。WithEveryone 达到最高的 Sim(Tgt)(0.499)和覆盖率(0.973),且重复率最低(0.028),其 Sim(Ref)(0.540)仅次于 GPT-Image 2(0.583)。GPT-Image 2 更高的参考相似度伴随着 0.169 的复制粘贴分数,是 WithEveryone 的 0.055 的三倍以上,表明人脸复制更僵硬。

消融实验表明,基于布局的身份监督(LG-ID Loss)在身份保持和构图方面提供了最大的单一提升。模型预测的布局(Layout CoT)也带来收益,而使用真实布局作为 oracle 显示规划质量仍是关键瓶颈。结合所有组件的完整模型取得最高分数,但相对于仅使用 LG-ID 的增益不能归因于任何单一添加,因为存在并发更改。单独添加的组件中,LG-ID Loss 带来的增益最大,显著提升了身份相似度和构图指标。用真实布局替换模型预测布局(oracle)进一步改善所有指标,表明更好的规划可以显著增强身份和构图。

实验评估了与目标上下文的身份相似度、参考身份覆盖率、重复率和复制粘贴伪影。WithEveryone 实现了最佳平衡,提供高覆盖率和低重复率,且复制粘贴极少,不同于那些以僵硬人脸复制换取相似度的模型。消融研究揭示,基于布局的身份监督是身份保持和构图的主要驱动力,而改进的布局规划进一步提升性能,表明规划质量是关键瓶颈。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供