HyperAIHyperAI

Command Palette

Search for a command to run...

音视频模型中的注意力三角

Sagi Polaczek Noa Kraicer Gal Metzer Zhuo Ning Ali Mahdavi-Amiri Daniel Cohen-Or Raja Giryes

摘要

音视频扩散模型依赖跨模态注意力来协调文本、声音和视觉内容,然而这一机制也可能引入细微且系统的语义泄漏。我们通过探测和分析“注意力三角”(即连接文本、音频和视频流的三个跨注意力边)来研究这些模型,并考察生成过程中语义信息如何在模态间路由。我们的分析揭示,音频-视频边的路由是双向的:音频可以影响视频生成,视频也可以影响音频生成。这条边受到模型参数中编码的偏差影响,并成为泄漏的主要来源:当提示与学习到的先验相冲突时,跨模态交互可能覆盖预期的条件作用,并将语义重新路由至视觉上典型但错误的结果。这些效应表明,语义伪影不仅源于注意力扩散至预期目标之外,更源于沿特定路径的结构化、偏差驱动的交互。基于这一视角,我们提取注意力衍生信号,揭示语义如何在模态间分布和锚定,并将其用作诊断工具,既用于分析,也用于在受控条件下故意引发泄漏。这使我们能够探测跨模态路由的内部动态,并隔离单个交互的作用。我们进一步利用这些信号指导推理时干预,以促进更一致的跨模态对齐。大量实验支持我们的分析,并展示了在保持生成质量的同时改善语义锚定的效果。

一句话总结

来自特拉维夫大学和西蒙弗雷泽大学的研究人员分析了音频-视频扩散模型中的“注意力三角”,揭示了由参数偏置塑造的双向音频-视频交叉注意力边,在提示与学习先验冲突时会导致语义泄漏,并引入了基于注意力的诊断信号来探测和有意诱发泄漏,从而指导推理时干预,在保持生成质量的同时改善跨模态对齐。

核心贡献

  • 分析了音频-视频扩散模型中的“注意力三角”,表明音频-视频交叉注意力边是双向且受偏置驱动的,当提示与学习先验冲突时,它是语义泄漏的主要来源。
  • 引入了基于注意力的诊断信号,揭示语义如何在模态间分布,从而能够在预训练生成器中实现受控的泄漏诱发和单个跨模态交互的隔离。
  • 将这些信号应用于无需训练的推理时干预,以改善跨模态对齐,在 LTX-2 上的实验表明,在保持生成质量的同时实现了更好的语义锚定。

引言

扩散模型,尤其是扩散 Transformer(DiT),已将注意力作为条件生成的核心机制,利用交叉注意力将文本、音频和视频模态绑定在一起。然而,注意力以全局且柔和的方式混合信息,缺乏显式约束,导致属性泄漏和不稳定的语义绑定。在三模态音频-视频生成中,这一问题更加复杂:模型必须协调文本意图、音频时间结构和视频时空实现,但相互竞争的信号和模态主导性常常导致语义关联扩散到非预期实体。先前关于文本到图像模型中泄漏的研究将其视为注意力路由失败,并应用推理时干预,但音频-视频模型继承并放大了这一问题,尤其是在音频-视频路径上,一维音频嵌入对三维视频片段的注意力会剥离空间区分性,使声源锚定约束不足。

作者通过文本、音频和视频之间的“注意力三角”结构分析这种泄漏,重点关注源归因失败。他们识别出音频-视频边为薄弱环节,其中学习到的跨模态偏置可能覆盖提示指定的绑定,并将声音语义重新路由到视觉上典型但错误的来源。在此基础上,他们提取基于注意力的信号作为诊断工具,用于探测和有意诱发泄漏,然后利用这些信号指导推理时干预。实验表明,仅引导单个三角边只能部分解决问题,例如修复外观而不修复归因,反之亦然,而联合引导所有边则能在多样提示下恢复一致的声音到源锚定。

方法

作者引入了一种无需训练的推理时引导算法,旨在缓解联合文本到视频和文本到音频生成模型中的语义泄漏。他们将模态间的交互形式化为“注意力三角”,其中文本、音频和视频 token 通过成对交叉注意力连接。这种耦合系统允许语义信息直接或间接路由,但常常导致本应属于某一实体的属性泄漏到另一实体,例如鹦鹉的语音被错误归因于海盗。为解决此问题,该方法同时对三个交叉注意力面施加 softmax 前的加性 logit 偏置。

参考框架示意图:

引导偏置由来自单次无引导基线传递的三类锚点构建:

  1. 文本锚点:用户在提示中标注预期声源、声音或动作,以及可选的竞争来源。这些短语映射到特定的 token 索引。
  2. 视觉锚点:基线帧被解码并使用以预期来源文本为提示的分割模型处理,为来源和竞争区域生成硬二值掩码。
  3. 音频锚点:由于未使用外部音频分割器,软声音掩码通过聚合音频查询和文本键注意力权重(针对声音短语 token)在去噪步骤中推导得出。

该算法对三角的边施加特定偏置以重新锚定各流:

音频-视频边:作者计算一个软一致性矩阵 GVA\mathbf{G}_{VA}GVA,为预期来源-声音对和非来源/非声音对赋予高值,而为不匹配对赋予低值。施加偏置以抑制不匹配的音频-视频 logit:

BAV=λ(1NV×NAGVA),BVA=BAV\mathbf{B}_{A \to V} = -\lambda(\mathbf{1}_{N_V \times N_A} - \mathbf{G}_{VA}), \quad \mathbf{B}_{V \to A} = \mathbf{B}_{A \to V}^\topBAV=λ(1NV×NAGVA),BVA=BAV

其中 λ>0\lambda > 0λ>0

文本条件边:对于文本到视频和文本到音频面,该方法定义“预期”和“冲突”单元掩码。对于视频查询和文本键面,预期掩码 MVTint\mathbf{M}_{VT}^{\text{int}}MVTint 将来源视频补丁与来源文本 token 配对,而冲突掩码 MVTconf\mathbf{M}_{VT}^{\text{conf}}MVTconf 将来源补丁与竞争文本配对,反之亦然。偏置公式为:

BTV=βMVTintγMVTconf\mathbf{B}_{T \to V} = \beta \mathbf{M}_{VT}^{\text{int}} - \gamma \mathbf{M}_{VT}^{\text{conf}}BTV=βMVTintγMVTconf

对文本到音频面使用音频掩码施加对称公式。作者在实验中采用固定超参数,对抑制冲突关联赋予比增强预期关联更大的权重。

如下图所示:

该可视化展示了完整联合引导的必要性。基线生成表现出强烈泄漏,海盗继承了说话角色。文本引导恢复了海盗的外观,但未能正确定位语音。音频-视频引导将语音正确定位到鹦鹉,但留下外观泄漏。只有完整的三角引导才能联合恢复正确外观并将声音定位到预期来源,确认需要处理所有三条边才能闭合三角并消除残余泄漏。

实验

评估通过注意力可视化、定性比较和人类偏好研究验证了所提出的引导框架。一阶和二阶注意力分析确认该方法将音频介导的注意力从错误来源重定向到预期来源,缓解了开放域场景中四种反复出现的泄漏模式。与原生基线、有界注意力改编和部分引导变体的比较表明,只有完整干预能同时保持外观并正确锚定声音;消融实验隔离了文本和音频-视频边引导的互补作用。定量指标和成对用户研究一致偏向完整方法在归因、泄漏和整体质量上的表现,所有偏好差异均具有统计显著性。

所提出的完整干预在所有方法中实现了最高的声源归因得分以及最佳的视觉一致性和美学质量,同时在音频-文本对齐方面保持竞争力。部分变体表明,仅引导音频-视频边能改善归因,但不如完整干预,而仅视频基线不参与归因评分。完整干预在声源归因上优于原生基线和所有其他变体,相对于有界注意力基线提升最大。仅引导音频-视频边比仅引导文本边获得更高的归因得分,但完整干预结合两者取得最佳结果。完整干预相对于原生基线保持或改善了视觉一致性和美学质量,音频-文本对齐变化可忽略不计。

评估将完整干预与部分变体和基线进行比较,表明其在保持视觉一致性和美学质量的同时实现了最高的声源归因,对音频-文本对齐的影响可忽略不计。仅引导音频-视频边比引导文本边更能改善归因,但结合两者的完整干预取得了最佳结果。最大的归因提升出现在有界注意力基线上,仅视频基线不参与归因评分。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供