Command Palette
Search for a command to run...
SemComp-Bench:视频生成中语义任务完成的基准评测
SemComp-Bench:视频生成中语义任务完成的基准评测
Keyu Tu Zhuowei Chen Mengqi Huang Yuxin Wang Jiahao Zhu Zhendong Mao Yongdong Zhang
摘要
我们提出了语义任务完成视频生成,这是一种以结果为导向的视频生成任务。在该任务设定下,成功既要求实现预期结果,也要求具备语义锚定。语义锚定刻画了参考图像与生成结果之间在与任务相关的高层语义上的对应关系。评测聚焦于生成结果,既不要求呈现完整连续的中间任务步骤,也不要求与参考图像保持传统的外观一致性。为支持系统性评测,我们构建了 SemComp-Data,这是一个覆盖六个领域的评测数据集。每个实例包含一张参考图像、一条详细指令、一条简短指令和一个以结果为中心的视频片段。一个可扩展的四阶段数据整理流程将原始视频转换为标准化的 SemComp-Data 实例。我们进一步提出了 SemComp-Bench,一种利用视觉语言模型(VLM)回答结构化二值问题的评测协议。SemComp-Bench 分别报告用于结果达成度的 OA Score 和用于生成可靠性的 GR Score。在代表性视频生成模型上的实验表明,在保持参考图像中与任务相关的语义锚定的同时实现预期结果仍然具有挑战性。
一句话总结
来自中国科学技术大学、FrameX.AI 和中山大学的研究者提出了 SemComp-Bench,这是一个用于视频生成中面向结果的语义任务完成的基准,包含跨六个领域的 SemComp-Data,以及一个基于视觉语言模型的协议,报告 OA 和 GR 分数;研究者证明当前模型在与任务相关的语义对齐上仍存在困难。
核心贡献
- 本文将语义任务完成视频生成(Semantic Task Completion Video Generation)定义为一项新任务,要求生成的视频在实现指令所指定结果的同时,保留与参考图像之间与任务相关的语义关系。
- 引入可扩展的四阶段筛选流程来构建 SemComp-Data,将原始视频转换为图像-文本-视频实例,并配有简短指令和详细指令对,同时保持任务真实性和细粒度属性对齐。
- 本文提出 SemComp-Bench,这是一个基于 VLM 的评估协议,通过基于证据的二元判断来衡量结果达成(Outcome Achievement)和生成可靠性(Generation Reliability);在代表性视频生成模型上的实验表明,这些能力仍存在明显局限。
引言
近期视频生成模型在视觉保真度和时间一致性上表现强劲,但是否能够在参考输入的语义约束下完成指令指定的结果仍未得到充分探索,例如将给定钞票折叠成折纸乌龟,而不是将其替换为无关的乌龟。现有基准主要评估视觉质量、时间一致性、主体身份和物理合理性,并未直接测试结果达成与高层语义对齐的联合能力。作者将这一挑战定义为 Semantic Task Completion Video Generation,并贡献了 SemComp-Data,这是一个从完整上下文的真实世界视频构建的精选图像-文本-视频数据集,以确保任务可行性和细粒度对齐;同时贡献了 SemComp-Bench,这是一个基于 VLM 的基准,通过基于证据的二元判断来衡量结果达成和生成可靠性。
数据集
作者从 Koala-36M 中的完整上下文视频构建 SemComp-Data。每个实例是一个结构化的图像-文本-视频三元组:
- 参考帧 ri:定义初始上下文。
- 指令对 Ti=(iibrief,iidetailed):两条对齐的指令,在不同具体程度上描述同一预期结果。
- 以结果为中心的视频片段 oi:描述成功完成,且与参考帧来自同一任务实例。
数据集构建采用四阶段流程:
-
候选过滤:
- 来源池:Koala-36M。
- 基于标题的关键词过滤移除依赖旁白的视频,例如脱口秀、访谈和新闻。
- 帧被采样到基于马赛克的视频摘要中,用于 VLM 分类。
- VLM 将每个视频分配到六个领域之一:Arts and Precision、Beauty and Fashion、Crafts and DIY、Food and Cooking、Gardening and Pets、Sports and Fitness。
- 视觉证据不足的视频被标记为 Uncertain 并丢弃。
- 参考状态和结果状态按任务类别手工定义。
-
状态挖掘:
- 使用类别特定的状态定义来定位参考帧和结果帧。
- State Grounding 是帧级时间戳定位,而不是完整结果片段定位。
- VLM 识别所演示的任务和预期结果,然后定位两个状态的时间戳。
- 质量检查通过让 VLM 从未标记的帧对中识别结果帧来验证帧对。
- 如果 VLM 无法唯一识别结果帧,则丢弃该帧对。
-
视频扩展:
- 使用经验证的结果时间戳作为时间锚点。
- 镜头检测和同场景合并遵循 Panda-70M 的流程。
- 包含结果帧的核心片段与视觉一致的相邻片段合并,直到片段达到至少 3 秒。
- SemComp-Data 中以结果为中心的视频片段平均约为 4.03 秒。
-
指令结构化:
- 从参考帧和以结果为中心的片段生成两种指令变体。
- 归一化关系描述使用模板 Verb + Main Subject in ri + Preposition + Main State in oi 创建不超过 30 个词的简短指令。
- 属性选择选择四种对齐类型之一:Object Element、Person Identity、Object Appearance、Scene。
- VLM 确定哪些参考属性应被保留或丢弃。
- 指令组合将简短指令扩展为详细指令,加入对齐类型、保留/丢弃约束以及细粒度结果特征,例如背景、光照、颜色、形状和组件级细节。
- 两种变体在不改变底层参考或结果的情况下,支持对指令具体程度进行受控评估。
论文描述 SemComp-Data 适用于指令具体程度评估,并可能对未来面向特定任务的训练有用。本节似乎没有详述训练划分或混合比例。对齐类型、领域和高频简短指令词的分布在论文中进行了总结。
方法
作者将 SemComp-Data 构建为结构化图像-文本-视频三元组 xi=(ri,Ti,oi) 的集合,其中 Ti=(iibrief,iidetailed) 表示对齐的指令对,在两种具体程度上描述同一预期结果。参考帧 ri 定义初始上下文,配对的指令指定期望结果,以结果为中心的视频片段 oi 描述成功完成。ri 和 oi 均来自同一任务实例,确保视觉元素的真实关联。为此,作者开发了一个四阶段筛选流程,从完整上下文视频中构建标准化评估实例。
如下图所示:
在第一阶段,候选过滤中,作者使用 Koala-36M 数据集作为来源池。采用基于标题的关键词过滤以排除依赖旁白的视频,保留视觉上自包含的候选。均匀采样的帧被排列成称为视频摘要的马赛克表示。高级 VLM 将每个视频分配到六个领域之一及关联的任务类别,并丢弃标记为 Uncertain 的视频。
第二阶段,状态挖掘通过 State Grounding 和质量检查挖掘可靠的参考-结果帧对。State Grounding 被定义为帧级时间戳定位。给定完整上下文视频和状态定义,VLM 识别所演示的任务,并定位与参考状态和结果状态匹配的时间戳。提取的帧对随后通过基于 QA 的质量检查进行验证,即由 VLM 从未标记的帧对中识别结果帧。预测与已标注结果不匹配的帧对将被丢弃。
第三阶段,视频扩展中,作者取完整上下文视频和经验证的结果时间戳。按照镜头检测和同场景合并流程,视频被划分为具有一致摄像机视角的片段。使用经验证的时间戳作为时间锚点,通过选择包含结果帧的核心片段并合并视觉一致的相邻片段,直到达到至少 3 秒的最短时长,提取以结果为中心的片段 oi。
最后阶段,指令结构化通过归一化关系描述、属性选择和指令组合生成两个对齐的指令变体。为捕捉关键的参考-结果关系,归一化关系描述约束 VLM 按照特定模板生成不超过 30 个词的简短指令 iibrief。同时,属性选择通过从 Object Element、Person Identity、Object Appearance 和 Scene 中选择对齐类型,确定保留或丢弃哪些参考属性。指令组合将简短指令扩展为详细指令 iidetailed,将所选择的对齐属性与已完成结果的细粒度视觉特征相结合。得到的详细指令同时指定期望结果及其参考对齐要求。两个变体在不同具体程度上描述同一任务实例,从而支持对指令具体程度的受控评估。
所构建数据的对齐类型和领域分布,以及指令中的高频词,如下图所示:
实验
这些实验使用 SemComp-Bench 评估生成的视频,该基准通过结构化二元问题在采样帧上对结果达成和生成可靠性进行评分。实验设置在精选的 SemComp-Core 实例上测试开源和闭源的图像条件与文本条件模型,并通过重复的 VLM 判断来衡量任务忠实度和视觉可靠性。关键发现表明,即使是最强的模型,结果达成仍然是主要挑战;生成可靠性通常较高,但受限于场景内时空不稳定性。图像条件一致地改善语义对齐和实体一致性,详细指令改善任务结果但可能降低连贯性,表明规格说明与生成难度之间存在权衡。
在详细指令下,HunyuanVideo-1.5-720P-I2V 在整体结果达成上领先,Wan2.2-I2V-A14B 紧随其后,而所有评估模型的联合通过率均未超过 40%。模型表现出互补优势:Seedance 2.0 在结果实现(Outcome Realization)和语义对齐(Semantic Grounding)上表现强劲,但在基于参考的实体一致性(Grounded Entity Consistency)和全局视觉连续性(Global Visual Continuity)上较弱;Wan2.2-TI2V-5B 则呈现相反特征,一致性和连续性较高,但任务忠实度较低。这些模式表明,稳健的结果达成同时依赖任务忠实度和结果视频有效性。HunyuanVideo-1.5-720P-I2V 取得最高的整体结果达成,Wan2.2-I2V-A14B 紧随其后,在四个指标上的通过率相对均衡。Seedance 2.0 在结果实现和语义对齐上较强,但在基于参考的实体一致性和全局视觉连续性上较低;Wan2.2-TI2V-5B 在后两个指标上领先,但在结果实现和语义对齐上较弱。最佳整体结果达成仍低于 40%,互补的模型特征表明任务忠实度与结果视频有效性之间存在权衡。
在详细指令下,Seedance 2.0 取得最高的生成可靠性分数,Wan2.2-I2V-A14B 是最强的开源模型。排名靠前的模型在视觉清晰度和无伪影渲染上表现良好,而场景内时空一致性是所有模型中可靠性最弱的指标。生成可靠性与结果达成排名并不完全一致:Seedance 2.0 在可靠性上领先,但在结果达成上明显较弱;HunyuanVideo-1.5-720P-I2V 在结果达成上领先,尽管可靠性较低。Seedance 2.0 记录最佳整体生成可靠性分数,Wan2.2-I2V-A14B 在开源模型中领先。场景内时空一致性是主要瓶颈,所有模型在这一指标上的通过率最低。视觉清晰度和无伪影渲染相对较强,尤其是对排名靠前的模型。可靠性排名与结果达成排名出现分化,而 Wan2.2-I2V-A14B 在两个维度上均位列第二。
在详细指令下,所有报告模型家族中,图像到视频变体的整体结果得分始终高于文本到视频变体,提升主要集中在语义对齐、基于参考的实体一致性和全局视觉连续性,而不是结果实现。在文本到视频设置中,详细指令通过更强的结果实现和语义对齐产生高于简短指令的整体得分,而简短指令往往改善实体一致性和连续性,但联合通过率非常低。报告的最高联合通过率出现在 HunyuanVideo 图像到视频详细指令设置中。在详细指令下的图像到视频条件在所有三个报告模型家族中均一致地产生高于文本到视频条件的整体结果达成。图像到视频的优势主要来自更好的语义对齐、基于参考的实体一致性和全局视觉连续性,而结果实现仍然大致相当。在文本到视频生成中,详细指令在整体得分上优于简短指令,但简短指令在基于参考的实体一致性和全局视觉连续性上往往得分更高。在报告设置中,使用图像条件和详细指令的 HunyuanVideo 记录最高的整体结果得分。
这些实验在详细指令和简短指令下,跨结果达成和生成可靠性指标评估图像到视频和文本到视频模型。HunyuanVideo-1.5-720P-I2V 在结果达成上排名最高,Wan2.2-I2V-A14B 排名第二,但没有模型达到超过 40% 的联合通过率。Seedance 2.0 在生成可靠性上领先,但在结果达成上较弱;图像到视频条件通过语义对齐、基于参考的实体一致性和全局视觉连续性持续改善整体结果,优于文本到视频条件;场景内时空一致性仍然是主要可靠性瓶颈。