Command Palette
Search for a command to run...
VideoChat3:面向高效通用视频理解的全开源视频多模态大语言模型
VideoChat3:面向高效通用视频理解的全开源视频多模态大语言模型
摘要
视频理解领域的最新进展涵盖了运动、长视频和流式交互,推动该领域走向实际应用。尽管取得了这些进展,当前的开源模型仍存在若干局限。它们往往难以泛化到多样化的视频类型,仅在特定领域有效。高计算需求进一步限制了其效率和可扩展性。此外,大多数模型仅部分开源,训练代码、策略或数据集等关键组件不可获取,这阻碍了可复现性并减缓了社区驱动的发展。为解决这些问题,我们提出了VideoChat3,一个完全开源、高效且通用的以视频为中心的多模态大语言模型。VideoChat3通过两项互补设计推进视频理解。在效率方面,我们引入了膨胀3D视觉变换器(I3D-ViT)和自适应帧机制,实现高效的时空表示,并降低训练和推理中处理视频输入的成本。在有效性方面,我们开发了一个可扩展的视频数据合成流水线,策划了三个多样化、高质量的训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K,覆盖通用、长视频和流式视频场景,提升了模型跨领域的泛化能力。通过整合这些设计,VideoChat3在广泛泛化与计算效率之间实现了罕见的平衡。在通用、长视频和流式基准测试上的实验表明,VideoChat3仅以4B参数和更高效率,超越了参数规模相当或更大的先前开源模型。通过发布模型权重、训练代码、训练策略和完整训练数据集,我们旨在提供一个完全可复现的基础,帮助开源社区弥合数据获取和训练资源方面的差距,促进现实世界视频理解系统的更广泛发展。
一句话总结
南京大学、上海人工智能实验室及其合作者提出 VideoChat3,一个完全开放的视频多模态大语言模型,将膨胀 3D 视觉 Transformer(I3D-ViT)和自适应帧分辨率相结合,实现高效时空表示,并配套可扩展的数据合成管线,在仅 4B 参数下取得超越先前开源模型的广泛泛化能力,使可复现的真实世界视频理解成为可能。
核心贡献
- VideoChat3 引入一种高效架构,结合膨胀 3D 视觉 Transformer(I3D-ViT)和自适应帧分辨率,在训练和推理中降低时空视频处理的计算成本。
- 一个可扩展的数据合成管线构建了三个多样化的高质量数据集(VideoChat3-Academic2M、VideoChat3-LV116K、VideoChat3-OL617K),覆盖通用、长视频和流式视频场景,增强了跨领域泛化能力。
- 该工作公开了完整的训练资产——模型权重、代码、策略和数据集——确保完全可复现,且 4B 参数模型在通用、长视频和流式基准上以更高效率超越先前类似或更大规模的开源模型。
引言
视频理解是构建通用多模态智能的核心,因为视频捕捉了支撑自动驾驶到实时人机交互等应用的连续时空动态。然而,现有的视频多模态大语言模型(MLLMs)往往专注于狭窄的视频设定,难以应对长视频或流式视频中密集视觉 token 的计算成本,并且缺乏开放、可复现的训练流程。作者通过 VideoChat3 解决这些问题,这是一个系统性框架,将高效的膨胀 3D 视觉 Transformer 与自适应帧分辨率相结合,大幅降低 token 开销,同时一个可扩展的数据整理管线为离线和流式任务生成三个高质量指令数据集。通过完全开源模型权重、训练代码、数据和构建管线,VideoChat3 为通用视频理解提供了强大且可复现的基础,性能超越同类开源模型。
数据集
为 VideoChat3 构建的数据集结合了三个互补的子集,每个子集针对特定的监督挑战:短片段上的密集指令遵循、长视频上的推理以及主动流式响应。
-
VideoChat3-Academic2M(约 200 万样本)
-
来源:聚合自公开的学术视频数据集,涵盖字幕生成、问答和细粒度运动感知。这些数据集提供广泛的任务覆盖和人工验证的标签。
-
处理:原始标注通常较短(选择题字母、名词短语、简短的事实性答案)。作者使用 Qwen3‑VL‑235B 将其改写为基于证据的、全面的回答,同时保留原始答案的语义。然后进行一致性验证阶段,将每个改写后的回答与原始标签进行比较;仅保留语义一致的样本。这产生了密集的目标,明确描述视觉证据和推理逻辑。
-
输出:增强的指令-响应对,包含更丰富的视频特定信息,但仍受限于原始学术标签的可靠性。
-
VideoChat3-LV116K(116.2K 行)
-
来源:新收集的来自不同领域(娱乐、教育、体育、新闻、科学、游戏)的长视频。丢弃严重损坏、视觉质量低、过度重复或语义内容有限的视频。
-
处理:
-
分割:使用 PySceneDetect 将每个视频分割为连贯的时间单元,结合镜头检测和时长约束以避免过短或过长的片段。
-
片段标注:Qwen3‑VL‑235B 为每个片段生成结构化描述(实体、动作、场景、事件转换、OCR 线索)。质量过滤器移除重复、通用或不一致的描述。
-
证据账本:经过验证的、带时间戳的片段描述构成整个视频的文本证据账本。
-
训练合成:一个前沿 LLM 消费交错的时间戳和片段描述,为三个任务族生成监督信号:时间定位(单区间和多区间)、视频时间线和长视频问答。问答样本经过过滤,排除仅凭单帧、单片段或语言先验即可回答的问题。
-
结果:116.2K 条 JSONL 行,每个分片的平均时长从 156 秒到约 1300 秒不等,提供需要跨片段聚合和事件级推理的长程监督。
-
VideoChat3-OL617K(617K 样本)
-
来源:高质量视频-问题-答案三元组。
-
处理:
-
视觉线索定位:一个视觉-语言模型识别包含回答查询所需关键证据的时间区间。
-
线索验证:从原始视频中裁剪出候选线索区间。模型重新评估裁剪后的片段;仅保留仅凭裁剪片段即可正确推断答案的样本。
-
流式构建:将验证后的线索区间视为收集证据的时刻。对应的视频窗口被标记为
</Standby>token。在线索区间结束后,模型必须发出</Response>后跟答案。所有其他窗口接收</Silence>token,教会模型抑制过早响应。 -
输出:交错的流式序列,包含视频窗口和响应状态 token,将离线问答监督转化为具有明确证据获取和响应时机信号的主动在线问答数据。
数据使用方式 训练期间所有三个子集被合并使用,以教会 VideoChat3 多种能力。VideoChat3-Academic2M 提供短片段和多样化任务上密集的、基于证据的指令遵循示例。VideoChat3-LV116K 将时间上下文扩展到分钟或小时,迫使模型定位事件、跨片段聚合信息并在稀疏证据上推理。VideoChat3-OL617K 训练模型充当流式助手,监控视频流并在累积足够视觉证据的精确时刻做出响应。数据集联合使用;未报告明确的混合比例。
方法
作者通过引入 VideoChat3,一个统一的面向视频的感知架构,来解决视频 MLLM 中视觉感知质量与计算效率之间的根本矛盾。该框架建立在这样一个原则之上:视频的时空结构应尽早建模,冗余信息应在视觉 token 传递给语言模型之前尽可能减少。
为了实现具有时空建模的高效视频 token 化,作者引入了膨胀 3D 视觉 Transformer(I3D-ViT)。I3D-ViT 不是将帧视为孤立图像,而是通过将预训练图像 token 化器的 2D 空间自注意力扩展为 3D 时空自注意力来进行膨胀。
如上图所示,视觉 token 化器将每个视频划分为最多 T 帧的连续帧块。在每个块内,模型保留预训练的空间位置嵌入,并为帧索引引入可学习的绝对时间嵌入。一个块内所有帧的 token 被展平为单个序列,使 I3D-ViT 块能够在原始输入分辨率下对空间和时间进行联合注意力。时空上下文化后,逐块时间池化沿时间维度聚合特征,将 token 数量减少 T 倍。结合空间下采样,这实现了高时空压缩比,同时保留了局部时间动态。
对于流式视频感知,作者设计了一种受人类视觉注意力启发的自适应帧分辨率机制。该模型将流式推理形式化为语言模型与视觉 token 化器之间的状态条件闭环。
如图表所示,在每个流式步骤,模型发出属于三种状态之一的响应状态 token:Silence、Standby 或 Response。该状态 token 作为下一个视觉输入的控制信号。一个确定性控制器根据预测状态 st 调整每帧像素配额 bt+1:
bt+1=⎩⎨⎧BlowBhighBlowif st=Silence,if st=Standby,if st=Response,其中 Blow=2242 像素,Bhigh=4482 像素。这使得模型能够在常规区间保持低成本监控,并在潜在证据出现时分配更高的视觉保真度。
为了构建高质量训练数据,作者将学术数据集视为可靠的语义锚点,并将其增强为更丰富的指令遵循响应。
如示例所示,简短或仅选项的答案被改写为全面的响应,使用大型视觉-语言模型明确描述视觉证据和推理。然后进行一致性验证阶段,过滤掉与原始标签矛盾或过度指定的改写响应,确保监督忠实于真实情况,同时提供更密集的训练信号。
对于长视频理解,作者构建了一个专用的合成管线来生成结构化标注。
该管线首先过滤候选长视频,并使用视觉场景检测将其分解为可管理的时间片段。每个片段独立标注,以捕捉可见实体、动作和事件转换。一个辅助模型评估这些片段描述,丢弃重复或缺乏支持的标注。最后,经过验证的片段描述被聚合为整个视频的密集、带时间戳的字幕,然后用于合成时间定位、时间线和长视频问答任务的训练标签。
整体训练方案分为四个阶段。在 Stage-0,作者以语言为基础预训练视觉 token 化器。他们从图像预训练模型初始化 I3D-ViT,附加一个轻量级投影器,并使用一个临时文本解码器。该阶段包括投影器预热,随后在大量图像-文本和视频-文本对上全参数微调。在 Stage-1,临时解码器被替换为目标语言模型进行视频-语言对齐,同样遵循从轻量级到联合的调度。Stage-2 通过在图像和视频问答及字幕样本的平衡混合上训练,将对齐后的模型转化为通用视频指令遵循模型。最后,Stage-3 使模型适应长视频和流式视频理解。对于流式行为,作者引入状态转换掩码策略来平衡状态 token 上的损失。令 st 为流式步骤 t 的目标状态。损失在转换位置 T={t∣st=st−1} 和均匀采样的延续位置子集 C(其中 C={t∣st=st−1} 且 ∣C∣=∣T∣)上计算。掩码状态损失为:
Lstate=−∑tmt1t∑mtlogpθ(st∣V≤t,y<t),mt=1[t∈T∪C].该目标迫使模型在决定维持或改变行为之前,将先前状态与当前视觉证据进行比较,从而有效学习时间响应策略和主动视觉预算策略。
实验
评估涵盖通用视频理解、流式感知、效率和消融研究。VideoChat3-4B 实现了强大的时间感知和定位能力,匹配或超越类似规模的开源模型,并与大型专有系统竞争,而其在线变体将这些能力扩展到主动流式,准确决定何时响应。该架构的早期时空压缩减少了视觉 token,将计算从二次复杂度的 LLM 阶段转移到线性复杂度的编码器,为长视频带来显著的延迟和内存节省。消融研究进一步证实,I3D-ViT 编码器、动态流式组件和增强的训练数据各自对模型的离线和在线性能有重要贡献。
VideoChat3 训练通过四个阶段进行,逐步将打包序列长度从 8K 扩展到 98K token,同时降低学习率。视觉 token 化器首先使用一个临时语言模型进行预训练,该模型随后被丢弃,最大的数据集(10.33M 样本)用于视频指令微调。可训练模块从仅投影器预热切换到全模型,最后切换到投影器和 LLM 进行流式适应。Stage 0 使用最高的学习率(1e-3)和批次大小(512)预训练视觉 token 化器,临时 LLM 随后被丢弃。打包序列长度在各阶段从 Stage 0 的 8,192 token 增加到 Stage 3 的 98,304 token,支持长视频和流式视频理解。
VideoChat3-4B,一个完全开放的模型,在时间感知、长视频理解、推理和时间定位方面实现了强大且均衡的性能。它在时间定位上优于或匹配类似规模的全开放模型,并超越了几个专有模型,同时在 19 个指标中的 18 个上相比 Qwen3-VL-4B 有所提升。最显著的提升出现在时间定位任务上,它显著超越了 VideoChat-Flash-7B 以及 GPT-5 和 Gemini 2.5 Flash 等专有对手。VideoChat3-4B 在 MotionBench(61.7)和 TempCompass(75.6)上取得了全开放模型的最佳结果,展示了强大的运动和时空动态理解能力。与 Qwen3-VL-4B 相比,VideoChat3 在 19 个直接可比指标中的 18 个上有所提升,仅在 VideoEval-Pro 的开放式拆分上下降。在时间定位上,相比 VideoChat-Flash-7B 的提升显著,在 TimeLens 拆分上达到 +16.4/+29.8/+34.3,在 VUE-TR v1/v2 上达到 +30.6/+30.1,在 MomentSeeker 上达到 +18.7。VideoChat3 在所有三个 TimeLens 拆分上超越 GPT-5 和 Gemini 2.5 Flash,并与 Gemini 2.5 Pro 保持竞争力。
VideoChat3-4B 有效地将其离线视频理解扩展到在线流式,在六个基准中的四个上取得了顶级的感知与记忆结果,并实现了强大的主动响应时机。它在没有辅助模块的情况下超越了专用模型,并在几乎所有指标上相比可比基线有所提升,展示了视频展开时的持续感知、上下文保持和及时响应。它在六个感知与记忆基准中的四个上领先,在 ODVBench 上比 StreamForest 提升 12.4 点,在 OVOBench、StreamingBench 和 River 上保持 0.9–2.9 点的一致优势。在主动响应时机上,它在 OVO‑Timing 上取得了 35.5 的平均 F1,比专用的 Em‑Garde 模型高出 4.5 点,且未使用辅助 2B 模块。在相同评估设置下与 Qwen3‑VL‑4B 相比,VideoChat3 在 11 个直接可比指标中的 10 个上有所提升,尤其是在在线时机和 ProactiveVQA 的 TV 子集上提升巨大。它在 ProactiveVQA 的四个子集中的三个上击败了 Qwen3‑VL‑4B,但仍落后于专用的 MMDuet‑2 模型。
VideoChat3 在视觉编码器中引入时空建模,增加了编码器延迟,但将传递给 LLM 的视觉 token 数量减半。这种权衡将计算从二次扩展的 LLM 转移到线性扩展的编码器,降低了长视频的总延迟、FLOPs 和 GPU 内存。收益随视频长度增长,使 VideoChat3 在长视频理解上显著更高效。对于相同数量的输入帧(从 256 到 1024 帧),VideoChat3 始终只产生 Qwen3-VL 一半的视觉 token。在 2048 帧时,VideoChat3 将总延迟减少一半以上(从 44.4 秒降至 20.4 秒),FLOPs 减少超过 60%,同时 GPU 内存降低 26.14 GB。
从 MoonViT 权重初始化的 I3D-ViT 提供了可比的图像理解性能,并有微小的平均提升。在视频任务上,它持续且显著地超越 MoonViT,这一收益归因于其 4 倍时间压缩,允许在训练和推理中采样近四倍的帧数。I3D-ViT 在图像基准上匹配或略超 MoonViT,平均得分 66.10 对比 65.30。I3D-ViT 在所有视频任务类别上大幅超越 MoonViT,利用了其更高的帧采样能力。
VideoChat3 通过四个阶段训练,打包序列逐渐增长,并在离线视频理解、在线流式和效率基准上进行评估。它取得了强大的均衡性能,在时间定位上超越类似规模的开源模型和专有系统,同时有效扩展到在线流式,取得了顶级的感知与记忆结果。该模型的时空编码器将视觉 token 减半,显著降低长视频的延迟和内存,其 I3D-ViT 初始化通过更高的帧采样带来了显著的视频收益。