HyperAIHyperAI

Command Palette

Search for a command to run...

KeyFrame-Compass:面向关键帧条件视频生成综合评估的基准

摘要

视频生成日益依赖基于关键帧的工作流程,创作者通过指定一系列参考图像来引导生成过程。尽管近期模型支持多关键帧条件控制,但它们能否在保持整体视频质量的同时忠实复现指定关键帧仍不明确。我们提出KeyFrame-Compass,首个用于评估关键帧条件视频生成的综合基准。该基准包含386个精心策划的样本,覆盖三个应用领域、两种视频结构、两种提示粒度、两种条件格式和四种关键帧密度,可在多样化生成设置下进行受控分析。我们进一步引入自动化评估框架,联合衡量关键帧执行度和整体视频质量。具体而言,我们将关键帧执行度分解为六个互补指标,涵盖存在性、保真度、时序顺序、定位、持久性和唯一性,同时通过基于证据的多模态大语言模型判断并结合专用感知模型来评估整体视频质量。在九个代表性视频生成系统上的实验揭示了若干根本性局限。当前模型在忠实的关键帧执行与自然的视频合成之间存在明显权衡。随着关键帧约束变得更加密集,其性能进一步下降,且大多数开源模型无法将故事板网格输入解释为时序有序的关键帧序列。

一句话总结

香港科技大学(广州)、Kling Team、北京大学等机构提出 KeyFrame-Compass,这是首个面向关键帧条件视频生成的综合基准。该基准包含 386 个精心筛选的样本,覆盖多样化的应用领域、视频结构和关键帧密度,并将关键帧执行分解为六个互补指标,采用基于证据的多模态大语言模型判断,揭示了在九个代表性系统上评估时,忠实关键帧还原与自然合成之间的权衡,且约束越密集该权衡越明显。

核心贡献

  • KeyFrame-Compass 是首个面向关键帧条件视频生成的综合基准,包含 386 个精心筛选的样本,系统性控制了关键帧密度、视频结构、提示粒度、输入格式和应用领域等因素。
  • 自动化评估框架将关键帧执行分解为六个互补指标,涵盖存在性、外观保真度、时间位置、顺序、持久性和唯一性,并将其与基于证据的多模态大语言模型判断以及专门感知模型增强相结合。
  • 在九个代表性视频生成系统上的分层实验揭示了忠实关键帧执行与自然视频合成之间的权衡,更密集的关键帧约束下性能下降,以及大多数开源模型无法将故事板网格输入解释为时序关键帧序列。

引言

作者针对日益增长的关键帧条件视频生成需求,即模型需要根据有序的参考图像集合和提示,生成保持每个关键帧精确外观、顺序和时间的连贯视频。该任务处于现代创意工作流程的核心,但现有通用视频生成基准仅评估感知质量、时间一致性或单图条件,均未衡量完整关键帧序列是否被忠实还原。作者提出 KeyFrame-Compass,这是首个专门为多关键帧条件视频生成设计的诊断基准。它包含 386 个精心策划的案例,涵盖五个可控因素和两个评估轴:六个关键帧-响应指标(存在性、保真度、顺序、时间、持久性和唯一性)评估规划执行,而基于证据的质量框架利用多模态大语言模型和感知模型衡量整体视频质量。这种分离揭示了保真度与自然度之间持续的权衡,以及随着关键帧约束变密集而出现的系统性失败。

数据集

作者构建了 KeyFrame-Compass,一个用于评估关键帧驱动视频生成的基准。

  • 数据集组成与来源

  • 该基准从两个来源获取叙事数据:现有故事数据集(ViStoryBench、VIST、ROCStories)以及真实视频与生成的叙事字幕配对。

  • 两个来源被统一为结构化的故事摘要,构成每个测试用例的骨干。

  • 关键细节与子集

  • 最终数据集包含 386 个测试用例,覆盖三种视频结构/时长设置:

  • 一镜到底视频(5–10 秒)

  • 短多镜头视频(5–10 秒)

  • 长多镜头视频(10–45 秒)

  • 样本按关键帧数量分布:

  • 3 个关键帧:75 个案例

  • 6 个关键帧:112 个案例

  • 9 个关键帧:110 个案例

  • 12 个关键帧:89 个案例

  • 每个故事平均有 3.73 个独特角色,大多数故事涉及 3–5 个角色。

  • 场景标注强调动作、建立、交互和收尾镜头(占所有标签的 67.2%)。主要镜头运动为横移/跟拍、跟拍镜头、摇镜和推进;常见镜头尺度为中景、全景和广角。

  • 论文如何使用数据

  • KeyFrame-Compass 是专用的评估基准。作者不将其划分为训练/验证集;它仅用于测试视频生成模型。

  • 每个样本以两种输入格式和两种提示变体交付,同时包含完整的元数据,从而能够系统评估关键帧对齐和叙事一致性。

  • 处理与元数据构建

  • 每个故事摘要扩展为结构化 场景规范,包括叙事概要、视频结构、主体描述、镜头定义、时间布局、目标关键帧位置和电影化标注。

  • 关键帧图像使用 GPT-Image-2 和 Nano Banana Pro 生成,然后通过多模态一致性检查和人工审核筛选,以确保视觉质量、跨帧主体一致性和叙事相关性。

  • 场景规范随后由 Gemini 3.1 Pro 改写为面向视频的提示,保留主体身份、空间关系和视觉状态。经质量审查和安全筛选后,装配最终元数据。

  • 未明确应用裁剪策略;元数据捕捉镜头运动和镜头尺度标注,以表征电影化多样性。

方法

作者通过多阶段流水线构建 KeyFrame-Compass 数据集,包括原始数据整理、规范转换、规范驱动生成和严格过滤。

参照框架图。

流程始于原始数据整理与预处理,作者利用两个主要叙事来源。第一来源包括现有数据集,如 ViStoryBench、VIST 和 ROCStories,提供故事板参考、文本故事和图像序列。第二来源涉及真实视频转录,其中多模态大语言模型从源视频生成叙事字幕。两条流均经过故事信息密度、内容安全和样本多样性过滤,以生成结构化故事摘要。

在摘要到规范转换阶段,这些摘要通过多模态大语言模型转化为结构化场景规范。每个规范作为统一表示,包含故事概要、视频结构、主体定义、关键帧位置和电影化标注。这确保了贯穿样本的一致主体身份、场景布局和时间对齐。

规范驱动构建阶段利用这些规范进行两项并行任务。对于关键帧候选生成,时间锚点被转化为涵盖主体外观、动作状态和空间布局的图像约束。使用 GPT-Image-2 和 Nano Banana Pro 等最先进的文本到图像模型生成多个候选关键帧。然后通过多模态大语言模型评估和人工审核筛选这些候选,以验证跨帧主体一致性和叙事相关性。同时,对于视频提示适配,场景规范被改写为面向视频的提示。作者生成两个提示级别:提供全局视频级指令的极简提示,以及详细描述镜头级序列和生成目标的片段特定提示。

最后,流水线包含质量审查与安全过滤。作者评估样本的规范符合性、视觉质量和身份一致性。应用安全筛选以避免公众人物、暴力、性内容和儿童伤害,最终得到一个经过精心策划的数据集,涵盖不同关键帧数量、领域和结构。

实验

KeyFrame-Compass 基准评估视频生成模型,要求它们忠实再现指定时间位置的关键帧图像,并在多样的提示类型和视频结构下合成连贯过渡。结果表明,强关键帧还原并不保证平滑运动,因为 LTX-2.3 在关键帧保真度上表现出色,但存在突兀的过渡,而 Gemini-Omni-Flash 将关键帧视为松散的语义提示而非视觉锚点,经常重新布局场景。Seedance 2.0 实现了最佳的整体平衡,随着视觉约束密度增加,指令遵循度持续下降。开源模型大多无法理解故事板网格,频繁生成静态网格复制,人类评估确认自动指标与人类判断高度一致。

现有的图像条件视频生成基准普遍缺乏关键帧响应指标,即它们不评估模型是否在预期时间位置忠实还原有序关键帧。仅 LongAV-Compass 支持多粒度提示控制,且大多数基准依赖单图条件,留下 KeyFrame-Compass 填补的空白,即评估不同关键帧数量下的关键帧遵循度和时间放置。所比较的基准均未包含关键帧响应指标,因此未评估规定关键帧的时间放置。LongAV-Compass 是唯一支持多粒度提示控制的基准,其他所有基准仅使用单一条件(如单图或未报告)。

KeyFrame-Compass 基准包含 386 个测试用例,分布在三种视频结构-时长组合(一镜到底 5-10 秒、多镜头 5-10 秒、多镜头 10-45 秒)和三个应用领域(日常、产品、电影)。多镜头视频占样本大多数,其中 5-10 秒多镜头类别最大,而产品领域代表性最低。5-10 秒多镜头视频构成最大子集(166 个案例),同时长一镜到底视频最小(61 个案例)。日常领域以 190 个样本占主导,产品领域仅贡献 53 个案例,分别是出现频率最高和最低的领域。

Seedance 2.0 在短视频排行榜上以 0.807 的综合得分领先,展示了在所有维度上的均衡表现。在某一领域表现出色的模型,如 LTX-2.3 在关键帧保真度方面或 Gemini-Omni-Flash 在视频质量方面,在联合评估中落后,揭示了单一指标聚焦会错过的排名反转。Seedance 2.0 在时空连贯性和指令遵循度上排名第一,在其他所有维度上排名第二,取得最高综合得分。LTX-2.3 获得最佳关键帧保真度(0.855)和时间组织(0.899),但因视频质量得分较低(0.557)而降至综合第四。

Seedance 2.0 通过平衡关键帧控制、视频质量和指令遵循度,实现了最佳整体性能,而 LTX-2.3 在关键帧保真度方面出色,但受较低视频质量阻碍,Gemini-Omni-Flash 则优先考虑视频质量和视听协调,牺牲关键帧相似度。增加关键帧数量会降低视觉指令遵循度,开源模型通常无法解释故事板网格,而是将整个网格复制为静态视频。Seedance 2.0 总体排名第一,在时空连贯性和指令遵循度上领先,同时在其他所有维度保持强劲表现。LTX-2.3 在所有评估系统中实现了最高的关键帧保真度和时间组织,但其较低的一般视频质量导致整体排名较低。Gemini-Omni-Flash 拥有最高的视频质量和视听协调得分,但其关键帧保真度相对较低,且经常重新布局镜头,而非保留输入帧的视觉内容。所有专有模型在从极简提示切换到片段特定提示时,视觉指令遵循度均下降,表明更密集的视觉约束会削弱时间和视觉控制。接收故事板网格的开源模型通常无法分解它,生成近乎静态的网格视频,这表明它们未学习故事板理解。

在片段特定提示下,随着关键帧数量增加,整体指令遵循度下降,从 3 个关键帧时的 0.849 降至合并 9&12 组时的 0.756。这一下降完全由视觉与运动遵循度(VMA)成分驱动,而音频遵循度(AMA)在所有关键帧密度下几乎保持不变。从 3 个关键帧增至 6 个,指令得分从 0.849 降至 0.818,进一步降至 9&12 组的 0.756。VMA 从 3 个关键帧时的 0.861 急剧下降至 9&12 组的 0.682,而 AMA 在所有组中保持在 0.830–0.837 之间。退化集中在视觉和时间控制上;音频遵循度不受关键帧数量影响。

KeyFrame-Compass 填补了现有基准的空白,通过在 386 个时长、结构和应用领域各异的测试用例上评估视频生成模型的关键帧遵循度和时间放置。评估显示,Seedance 2.0 通过平衡关键帧保真度、视频质量和指令遵循度而整体领先,而其他模型在这些维度间权衡,例如 LTX-2.3 在关键帧保真度上出色但视频质量较低。增加关键帧数量持续降低视觉和时间指令遵循度,开源模型通常无法解释故事板网格,反而生成网格布局的静态视频。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供