HyperAIHyperAI

Command Palette

Search for a command to run...

SANA-Video 2.0:融合注意力残差的混合线性注意力机制实现高效视频生成

摘要

我们提出 SANA-Video 2.0,一个在统一架构下实例化为 5B 和 14B 规模的混合视频扩散 Transformer。该模型旨在单 GPU 上生成高达 720p 的高质量视频,其质量可与全 softmax 视频 DiT 相媲美,同时保留了线性注意力在长序列上的良好扩展性。为避免全局二次注意力,混合线性–softmax 注意力将门控线性注意力(以 O(N) 为主进行混合)与周期性的门控 softmax 锚点以 3:1 的比例结合,恢复了纯线性注意力所缺失的全秩 token 交互。为将这些更新后的表示在深度上传播,块注意力残差(AttnRes)将已完成的块摘要路由至后续线性层,实现了锚点特征复用,并将深层有效秩提升约 12%。通过从头训练,SANA-Video 2.0 直接学习完整的混合机制,而非将预训练模型线性化,降分辨率代理实验确立了 25% 的 softmax 比例为质量与效率的最优权衡。采用 40 步采样,SANA-Video 2.0 在单张 H100 上以 13.2 秒生成 480p 视频,VBench 得分为 84.30,以极低的延迟与规模大得多的 softmax 视频 DiT 保持竞争力。其编译后的 DiT 前向传播在 720p/60s 条件下比匹配的全 softmax 基线快 3.2 倍,且这一差距随视频时长增加而扩大。此外,全栈 Sol-Engine 优化(核融合、缓存和稀疏注意力)进一步将这一硬件友好的骨干网络加速 3.58 倍,使 5B 流水线在 720p/5s 下达到 13.06 秒,比单张 H100 上的 Wan 2.2-A14B 快 120 倍。总体而言,我们的混合设计以大幅降低的成本恢复了 softmax 级别的表达能力,为可扩展的长时长、高分辨率视频生成开辟了道路。

一句话总结

NVIDIA 的 SANA-Video 2.0 是一种视频扩散 Transformer,它结合了混合线性-softmax 注意力(以 3:13:13:1 比例周期性插入 softmax 锚点)和块注意力残差来恢复全秩交互,从头开始训练以实现高效的高分辨率生成,其优化后的流水线比 softmax 基线快 3.2×3.2\times3.2×,同时相对 Wan 2.2-A14B 实现 120×120\times120× 的加速,且质量与 DiT 相当。

核心贡献

  • 本文提出一种混合视频扩散 Transformer,将 75% 的门控线性注意力与 25% 的周期性门控 softmax 锚点相结合,在避免平方代价的同时恢复了纯线性注意力所缺失的全秩 token 交互。
  • 引入块注意力残差(AttnRes),将已完成的注意力块摘要路由到后续线性层,实现跨深度的锚点特征复用,并将深层有效秩提升约 12%。
  • 通过降低分辨率代理研究进行的从头训练识别出 25% softmax 为最优的质量-效率权衡,得到的 5B 模型在单块 H100 上以 13.2 秒生成 480p 视频时 VBench 得分达 84.30,其 DiT 前向传递比对应的全 softmax 基线在 720p/60s 快 3.2 倍,并经过全栈 Sol-Engine 优化后相对 Wan 2.2-A14B 实现 120 倍的加速。

引言

视频生成依赖于具有全 softmax 注意力的大型扩散 Transformer,但其平方代价严重限制了长时高清剪辑的生成速度。先前的工作要么为了精度而坚持昂贵的 softmax,要么为了效率而转向纯线性注意力,但会牺牲时空细节的表达能力。最近的语言模型表明,以大部分线性层并周期性插入 softmax 锚点和跨层残差路由可以恢复秩能力,但将这种混合设计适配到视频扩散的独特需求尚待探索。作者提出 SANA-Video 2.0,一种混合注意力视频扩散 Transformer,将 75% 的自注意力层替换为门控双线性线性注意力,在规则深度上插入 25% 的 softmax 锚点,并通过块注意力残差在深度上路由更新后的表示,全部从头训练。该设计在质量上与强大的全 softmax 基线相匹敌,同时随着视频时长增加而实现大幅加速。

数据集

作者从大型原始视频语料通过统一处理流水线构建视频数据集,然后将其划分为具有逐步更严格质量与运动标准的训练子集。

  • 来源与处理流水线: 原始视频语料经过六阶段流水线处理,包括镜头分割、去除黑边和字幕,并过滤低分辨率、模糊、静态帧或曝光缺陷的片段。质量和运动在多个轴向上评分,而不是聚合成单一指标;这样防止选择坍缩为只有视觉上干净但几乎静态的片段,同时仍能包含高质量的低运动内容。

  • 渐进式质量/运动漏斗: 处理后的片段按质量和运动阈值分层,构成一个漏斗状子集:

    • 预训练 使用宽松阈值的大范围池以最大化覆盖。
    • 持续训练 提高质量和运动要求,丢弃较低层级的片段。
    • SFT(监督微调) 集中于具备最严格质量和运动底线的小型可信子集。
  • 描述文本与元数据构建: 描述文本随子集演进:早期阶段混合长短描述,后期转为密集、结构化描述。当存在运动描述符时,将其量化并附加到文本中,将运动选择信号转化为条件提示。

  • 在模型训练中的使用: 同一组质量和运动轴也指导预训练的时间步策略:初期使用广泛覆盖,随后训练阶段集中于保真度和提示遵循。子集按顺序使用:先在大规模宽松池上进行预训练,再在中层级上进行持续训练,最后在小型高质量子集上进行 SFT,每个阶段调整描述。

方法

作者提出 SANA-Video 2.0,一种视频扩散 Transformer(DiT),它在深度上集成了混合序列注意力和块残差注意力。模型处理来自 LTX-VAE 2.3 的潜变量,并在每一层通过交叉注意力整合 Gemma-2-2B-IT 的文本特征。局部处理路径始终保持无卷积。

混合注意力与块残差 该架构采用混合注意力设计,将双向门控线性注意力层与门控 softmax 锚点以 3:1 的比例交错排列。这种配置在保持 token 混合的线性复杂度的同时,每四层使用一次 softmax 锚点来刷新被压缩的线性状态无法完全表示的交互。为了进一步增强信息流,作者引入块注意力残差(AttnRes)。Transformer 层被分组为连续的块,通常每块 8 层。在前向传播过程中,各子层的输出被累积为运行部分和。当块完成时,将此部分和冻结为块摘要。每一层的路由器汇总初始 token 嵌入、已完成的块摘要以及当前部分和以计算表示。

hl(x)=viVlαil(τ)(x)vi(x),αil(τ)(x)=softmaxi((w(τ)+ϕτ(t))RMSNorm(vi(x)))h_{l} (x) = \sum_{v_{i} \in \mathcal{V}_{l}} \alpha_{i \rightarrow l}^{(\tau)} (x) v_{i} (x), \quad \alpha_{i \rightarrow l}^{(\tau)} (x) = \underset{i}{\mathrm{softmax}} \Big ((w^{(\tau)} + \phi_{\tau} (t)) ^{\top} \operatorname{RMSNorm} (v_{i} (x)) \Big)hl(x)=viVlαil(τ)(x)vi(x),αil(τ)(x)=isoftmax((w(τ)+ϕτ(t))RMSNorm(vi(x)))

为优化内存,模型使用共享路由查询,具体来说,在所有深度复用单个注意力查询和单个 FFN 查询,而不是为每层学习独立的查询。

训练配方与数据策划 训练过程遵循一个全面的流水线,包括数据策划、分辨率和时长课程,以及基于偏好的后训练。数据策划采用统一的处理流水线,包括镜头分割和清理,随后进行多轴质量和运动评分。这创建了一个渐进式质量和运动漏斗:预训练使用广泛池,后续阶段如持续训练和 SFT 则聚焦于更高的质量和运动阈值。

训练使用流匹配,采用对数正态时间步密度。作者提出内容感知流偏移(TQD)来解决运动-质量困境。TQD 将富含运动的片段路由到高噪声区间,该区间负责全局结构,而将美学干净且低运动的片段路由到低噪声区间,该区间负责精细细节。在后期阶段,采用 token 计数感知流偏移,基于潜在 token 计数对偏移值进行插值,以持续处理不同的分辨率和时长。

后训练与对齐 后训练阶段利用 Diffusion-DPO 进行视觉偏好对齐。通过裁判模型得到的排名,作者构建偏好-拒绝对,并优化一个损失,促使策略模型减小偏好样本和拒绝样本之间的流匹配误差差距。此外,还使用在线强化学习——基于奖励反馈学习(ReFL)。这涉及展开去噪轨迹,并使用冻结的图像奖励模型提供帧级反馈,无需通过完整采样轨迹反向传播即可优化模型。

系统设计与部署 在部署方面,作者使用 Sol-Engine 堆栈来优化推理。骨干网络设计为对内核友好,避免时序卷积 FFN,以便高效映射到标准注意力核。优化堆栈包括内核融合、残差复用(评估部分去噪步骤),以及在 softmax 锚点上进行稀疏注意力。

该模型还在物理 AI 场景中展现能力。通过在真实机器人和自我中心视频上微调,模型生成物理上合理的操作视频,在机器人任务中表现出与更大模型相当的竞争力。

实验

实验验证了 SANA-Video 2.0 的设计选择和效率。时间步分层验证表明 25% 的 softmax 注意力比率提供了强大的质量-速度权衡,而与时间步无关的 AttnRes 路由器恢复了表示秩并实现了跨深度复用。主流 VBench 结果确认了具有竞争力的大幅速度优势,在线 RL 后训练同时提升了所有奖励信号。部署优化,包括缓存和低精度推理,进一步减少延迟同时保持生成质量。

训练课程分为三个阶段:在约 3000 万个 480p 片段上进行预训练,在 1000 万个片段上进行持续训练,并随分辨率和时长的提升,最后在一个仅有 1 万个 720p 片段的紧凑 SFT 阶段收尾。流偏移从预训练时的常数基础加上内容感知调制(TQD),变为后期阶段的 token 计数感知调度,随着片段时长增加,将概率质量移向高噪声。训练目标从早期的 TQD 加 Self-Flow 缩减到 SFT 阶段的标准流匹配,并且最后阶段的学习率减半。预训练使用固定的流偏移 1 并附加 TQD,将富含运动的片段路由到高噪声,美学干净片段路由到低噪声。持续训练将分辨率从 480p 提升至 720p,片段时长从 5 秒延长到 8 秒,流偏移变为 token 计数感知,并从 3 扩至 6,使较长片段获得更多高噪声概率。SFT 在仅 1 万个 720p 片段的数据集上运行,使用标准流匹配,不包含 TQD 或 Self-Flow,并采用减半的学习率 5×10^{-5}。片段数量在各阶段跨越三个数量级,从约 30M 降至约 10M 再降至约 10k,反映了从广泛结构学习向精细质量优化的转变。

SANA-Video 2.0(5B,81 帧)VBench 总分达 84.30,其中质量分 85.61 在所有比较模型中最高,超越了 Wan 2.1 14B 等模型。只有大得多的 Bernini-R 14B 在总分和语义指标上稍占优势,但 SANA-Video 2.0 在相同硬件上快 30 倍以上。扩展到 121 帧将总分提升至 85.29,同时仍远高效于竞争对手。SANA-Video 2.0 的质量分 85.61 在 VBench 比较中领先所有模型,略高于 Wan 2.1 14B(85.59),尽管参数少得多。5B 模型在单块 H100 上生成 81 帧视频仅需 13.2 秒,比稍优于其总分和语义分的 Bernini-R 14B 快 31.8 倍。

针对残差注意力的设计探索显示,从路由器中移除时间步输入改善了早期短程损失,共享查询投影匹配了每层损失且大幅削减了内存开销。在继续训练后,保留残差注意力在多数噪声区间上以微弱优势胜出,块跨度为 8 被选为平衡的工程默认值。显式移除时间步输入将早期训练损失从 0.962 降至 0.920。共享注意力查询与每层查询的损失几乎相同(0.495 vs. 0.496),同时将内存开销从 +16% 降至 +4%。

将 Sol-Engine 部署堆栈应用于 SANA-Video 2.0,在 B200 和 H100 GPU 上逐步降低生成延迟。内核优化先将耗时减半,然后通过扩散缓存配合残差复用减少去噪步数,最后在 softmax 锚点上施加稀疏注意力,最终在 B200 上实现 3.58 倍加速,在 H100 上实现 2.84 倍加速,分别相对于各自 GPU 的未优化基线。仅内核优化就在 B200 上带来 2.04 倍加速(H100 上 1.60 倍),是堆栈中最大飞跃。扩散缓存将函数评估次数从 50 降至 33,并将联合加速比提升至 B200 的 3.00 倍和 H100 的 2.37 倍。加入稀疏注意力进一步加速流水线,最终延迟为 B200 上 17.52 秒(加速 3.58 倍),H100 上 33.43 秒(加速 2.84 倍)。三个阶段正交:内核优化保持精确计算,而缓存和稀疏注意力引入近似以获取额外收益。

使用 MXFP4 权重和 MXFP8 激活的量化感知训练(QAT)保持了 BF16 基线的整体质量,训练后量化(PTQ)则有轻微下降。两种低精度配置均将静态模型存储减少约 68%,峰值分配内存减少约 57%,但推理延迟仅降低 5.8%,因为只有线性 GEMM 层被量化,注意力运算保持全精度。QAT 的 VBench 总分与 BF16 基线一致,而 PTQ 分数略低。低精度推理使静态模型大小减少 67.9%,峰值内存减少 56.9%。延迟仅改善 5.8%,因为线性 GEMM 在运行时间中占比很小,而注意力运算停留在 BF16。

SANA-Video 2.0 的训练课程采用三阶段渐进式策略,从带内容感知时间步调制的广泛结构学习转向在高分辨率小数据集上的精细质量优化,表明自适应流偏移和目标缩减可以有效扩展生成。关于残差注意力的设计探索确认,从路由器中移除时间步输入并共享查询投影能减少内存开销而不损害损失,最终得到实用的块跨度配置。VBench 上的基准测试显示,5B 模型在质量指标上处于领先,可与大得多的模型匹敌或超越,同时在相同硬件上生成视频的速度快 30 倍以上。Sol-Engine 部署堆栈整合了内核优化、扩散缓存和稀疏注意力,累计加速最高达 3.58 倍;量化感知训练结合混合精度在保持完整质量分数的同时,削减了模型存储和内存使用,但由于注意力运算保持全精度,延迟增益有限。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供