HyperAIHyperAI

Command Palette

Search for a command to run...

TimeLens2:基于多模态大语言模型的通用视频时间定位

摘要

视频多模态大语言模型(MLLM)能够描述视频中发生的事件,但很少指明支撑证据出现的时间。我们研究通用视频时间定位任务,即由一个模型预测一组基数可变的证据时间区间,覆盖不同的视频长度、领域、查询形式和视角。现有的训练策略与该集合值任务不匹配:长视频标注通常依赖脆弱的单遍标注流程,而强化学习的奖励要么无法区分不重叠的预测,要么需要脆弱的片段匹配。TimeLens2 在整个监督和优化过程中将时间证据视为区间集合。TimeLens2-93K 通过基于字幕的提案生成、独立定位、跨智能体共识、语义验证和边界细化,构建了可靠的多片段监督信号。我们提出的时间 Wasserstein 奖励在合并后的区间支撑集上计算均匀分布之间的精确一维 W1 距离,在基数不等和等价碎片化情况下提供稠密、无需匹配的反馈;时间 IoU 则补充了精确重叠的反馈。在七个基准测试上,TimeLens2-2B 在所有基准上均优于同等规模的基线模型,而 4B 和 8B 版本取得了最先进的性能,超越了参数量高达 397B 的开源模型。2B、4B 和 8B 版本相较于其 Qwen3-VL 基座模型,mIoU 分别提升了 14.2、13.0 和 18.1 个百分点。

一句话总结

南京大学、上海人工智能实验室等机构的研究者提出TimeLens2,一种通用的视频时序定位模型,它将证据视为区间集合,并使用多跨度标注流程和时序Wasserstein奖励——即合并区间上均匀分布之间的精确1D W₁距离——在七个基准测试中取得领先性能,将Qwen3-VL骨干模型的mIoU提升最高达18.1。

核心贡献

  • TimeLens2-93K通过结合字幕衍生提案、独立定位、跨agent共识、语义验证和边界精化,为长视频和多样化视频提供可靠的单跨度和多跨度监督。
  • 时序Wasserstein奖励计算合并区间支撑上均匀分布之间的精确一维W₁距离,为集合值预测提供密集、无匹配的反馈,并由时序IoU补足以实现精确重叠度量。
  • 在七个基准测试中,TimeLens2模型(2B、4B、8B)均优于同等规模的基线;4B和8B版本达到领先性能,超过参数量高达397B的开源模型,并在Qwen3-VL骨干模型上提升13.0–18.1 mIoU。

引言

视频多模态大语言模型(MLLMs)可以描述视频中发生的事件,但用户也需要知道支持证据出现的时间;没有精确的时间区间,输出便无法验证。时序定位,即在不同视频长度、查询形式和视角下定位单个或多个证据区间的任务,因此对于使MLLM输出可追溯至关重要。先前工作面临两个结构性不匹配:长视频监督通常依赖单个全局标注,忽略重复证据并产生不精确的边界;而基于时序IoU奖励的优化会将所有不相交的预测置为零,无法区分接近失误和远离错误,尤其对于多跨度目标。作者提出TimeLens2,一种通用的时序定位MLLM,在整个训练过程中将证据视为一等区间集合。他们首先构建了TimeLens2-93K,一个分阶段的证据验证流程,用层次化字幕、独立重定位、共识和边界精化取代脆弱的单次标注,以产生可靠的多跨度监督。随后,他们提出时序Wasserstein奖励,计算合并预测和目标区间支撑之间的精确一维Wasserstein距离,为不相交和不等基数预测提供密集的、无匹配的几何反馈。使用该方法训练的紧凑TimeLens2模型在涵盖长视频、多跨度、问题形式和自我中心定位的七个基准测试中,优于大得多的开源模型。

数据集

作者构建了TimeLens2-93K,一个大规模时序定位数据集,旨在教会模型在长视频和多样化视频中搜索支持证据。数据集包含23,793个视频和93,232个定位实例,每个实例表示为视频、陈述性查询和可变基数的支持时间区间集合。其中,12,091个实例包含多个支持跨度,在完整视频上下文中统一了单跨度和多跨度定位。

数据来源与分层

  • 视频池来自34,867个YouTube视频,按五个时长范围(一分钟以下到一小时以上)和多样化视觉领域进行刻意分层。
  • 时长控制搜索范围和干扰负载,而领域广度确保证据类型多样。

构建流程 该流程通过分阶段分解将候选提案与标签确定分离:

  • 层次化时序字幕: 使用PySceneDetect将每个视频分割为语义连贯的20–60秒片段。然后由大型视觉语言模型(Qwen3-VL-235B-A22B)生成全局字幕和每个片段的逐段字幕,强调可观察事件和时间顺序。该层次化描述作为语义索引。
  • 片段感知查询合成: 另一个模型(Kimi-K2.5)联合生成非冗余的陈述性查询,并从字幕层次中选择所有支持片段,形成粗略的多跨度提案。
  • 双agent局部定位: 两个独立模型(Qwen3-VL-30B-A3B和TimeLens-8B)以一秒分辨率直接从视频片段中重新定位每个查询-提案对,返回一个或多个区间或空集。空输出拒绝无支持的提案;多区间输出保留重复证据。片段相对时间戳映射到原始视频时间线。
  • 跨agent共识与语义验证: 实例仅当两个agent的合并区间集达到集合级IoU > 0.9,并且通过Qwen3-VL-Embedding计算的查询与保留片段之间的归一化文本-视频余弦相似度至少为0.5时,才会被保留。这确保了时序可复现性和查询-证据对齐。
  • 边界聚焦局部精化: 对于每个保留的边界,一个强模型观测±3秒邻域并预测精化后的过渡点。相邻跨度若间隔不超过一秒则合并,将此类间隔视为边界抖动而非语义间断。

数据集使用 TimeLens2-93K用于训练时序定位模型,这些模型必须在完整长度视频中定位证据。可变基数的区间形式使模型能够从长视频、充满干扰的上下文中学习单跨度和多跨度检索。构建过程通过全局上下文提案和集中的局部验证的级联,提供高置信的区间集合标签。

方法

作者通过构建TimeLens2-93K数据集并开发相应的训练框架,解决了长视频中的根本监督挑战,用于通用视频时序定位。数据构建流程将候选构建与标签确定分离,以确保标注可靠。

如下图所示:

流程从长视频和多样化视频源池开始,按五个时长范围分层以控制搜索难度和干扰负载。为避免将视频理解、查询合成和定位混为一谈,作者将每个视频转换为层次化、带时间戳的描述。他们使用基于内容的边界将视频分割为语义连贯的片段,并使用Qwen3-VL-235B-A22B生成全局和片段字幕。这些字幕作为语义索引。对于片段感知查询合成,Kimi-K2.5以字幕为条件,联合生成陈述性查询并选择支持片段,形成粗略提案。

为了将这些粗略的文本匹配转化为可验证的视觉决策,作者采用双agent局部定位。Qwen3-VL-30B-A3B和TimeLens-8B独立地从短视频片段中重新定位每个提案。然后通过跨agent共识和语义验证进行过滤。时序可复现性使用集合级IoU度量检查:

IoUset(A,B)=merge(A)merge(B)merge(A)merge(B)\mathrm{IoU}_{\text{set}}(\mathcal{A}, \mathcal{B}) = \frac{|\operatorname{merge}(\mathcal{A}) \cap \operatorname{merge}(\mathcal{B})|}{|\operatorname{merge}(\mathcal{A}) \cup \operatorname{merge}(\mathcal{B})|}IoUset(A,B)=merge(A)merge(B)merge(A)merge(B)

保留IoUset>0.9\mathrm{IoU}_{\text{set}} > 0.9IoUset>0.9的实例,并要求归一化文本-视频余弦相似度至少为0.5以验证语义有效性。最后,边界聚焦局部精化对保留的边界进行锐化。Qwen3-VL-235B-A22B观测每个边界周围的局部邻域以预测精化后的过渡点,相邻跨度间隔不超过一秒的则合并。

对于模型训练过程,作者将能力获取与几何校准分离。长上下文监督定位在TimeLens2-93K、TimeLens-100K和Ego4D-NLQ的样本上微调Qwen3-VL。保留完整视频上下文迫使模型在竞争事件中隔离稀疏证据。为确保模型学习协议不变的区间语义,作者引入指令和响应格式的多样性,以多样的单跨度或多跨度格式呈现相同的真实标注。

然后使用强化学习直接优化解码后的区间集合。作者实现了基于回滚的困难样本挖掘,在GRPO期间,来自SFT检查点的平均tIoU得分较低的样本获得更高的采样权重,从而创建自适应课程。

为解决标准tIoU奖励的局限性(重叠平台和匹配伪影),作者引入时序Wasserstein奖励。

参见框架图:

总奖励结合集合级tIoU、时序Wasserstein奖励RTWR_{\mathrm{TW}}RTW和无效输出惩罚:

R(Y^,Y)=RtIoU(Y^,Y)+RTW(Y^,Y)1invalidR(\hat{\mathcal{Y}}, \mathcal{Y}) = R_{\mathrm{tIoU}}(\hat{\mathcal{Y}}, \mathcal{Y}) + R_{\mathrm{TW}}(\hat{\mathcal{Y}}, \mathcal{Y}) - \mathbf{1}_{\mathrm{invalid}}R(Y^,Y)=RtIoU(Y^,Y)+RTW(Y^,Y)1invalid

tIoU衡量恢复的支持度,但缺乏几何指导。作者将每个区间集合提升为在其合并支撑上的均匀时序分布:

μA(t)=1{tmerge(A)}(A)\mu_{\mathcal{A}}(t) = \frac{\mathbf{1}\{t \in \mathrm{merge}(\mathcal{A})\}}{\ell(\mathcal{A})}μA(t)=(A)1{tmerge(A)}

1-Wasserstein距离衡量对齐预测和目标质量所需的传输量:

W(Y^,Y)=W1(μY^,μY)=RFY^(t)FY(t)dtW(\hat{\mathcal{Y}}, \mathcal{Y}) = W_1(\mu_{\hat{\mathcal{Y}}}, \mu_{\mathcal{Y}}) = \int_{\mathbb{R}} |F_{\hat{\mathcal{Y}}}(t) - F_{\mathcal{Y}}(t)| dtW(Y^,Y)=W1(μY^,μY)=RFY^(t)FY(t)dt

该距离被转换为尺度归一化的相似度:

RTW(Y^,Y)=exp(W(Y^,Y)merge(Y)+ϵ)R_{\mathrm{TW}}(\hat{\mathcal{Y}}, \mathcal{Y}) = \exp\left(-\frac{W(\hat{\mathcal{Y}}, \mathcal{Y})}{|\operatorname{merge}(\mathcal{Y})| + \epsilon}\right)RTW(Y^,Y)=exp(merge(Y)+ϵW(Y^,Y))

这种形式确保奖励取决于证据所在位置,而非支撑如何划分,从而为多跨度定位提供密集的、划分不变的信用。

实验

TimeLens2在七个时序定位基准上使用mIoU和tIoU 0.5下的Recall@1进行评估,模型通过监督微调在精选数据集上训练,并使用时序Wasserstein奖励进行强化学习。该模型在长视频和多样化查询形式上一致优于先前开源和专用系统,展示出证据导向的时序搜索而非浅层边界拟合。消融实验表明,TimeLens2-93K数据集教会了模型可迁移的搜索能力,渐进式标签筛选去除了标注错误,而时序Wasserstein奖励提供密集的距离感知反馈,改善从接近失误中的恢复,并在群体相对优化中打破平局。

TimeLens2在不同模型规模和时序定位基准上均取得一致提升,优于同等规模的开源基线,并常常超越更大的专用系统。最小变体TimeLens2-2B已超过所有先前2B开源模型和之前的8B模型,而4B版本在七个基准中的六个上击败所有先前模型。在具有挑战性的多区间和问题形式任务上提升最大,该方法在骨干模型上增加高达27.8个mIoU点。TimeLens2-2B在所有七个基准上均优于三个同等规模的开源基线,平均mIoU达44.5——比Qwen3-VL-2B高14.2点,比之前的8B模型高2.4点。TimeLens2-4B在七个基准中的六个上超越所有先前模型,包括专用系统,在VUE-TR和VUE-TR-V2上分别比Qwen3-VL-4B骨干提升19.6和27.8 mIoU。

TimeLens2-93K的数据规模呈现两阶段模式:前5%数据带来最大的平均mIoU跳跃,从34.7升至42.8,而进一步增加到50%仅增加少量收益,在45.3附近趋于平稳。完整语料(45.8)主要改进更困难的设置如VUE-TR-V2和Ego4D-NLQ,且学习到的搜索能力跨查询形式迁移,将问题式MomentSeeker从15.3提升至25.8,尽管训练时使用陈述性查询。TimeLens2-93K的前5%数据将平均mIoU提升8.1点,占总改进的大部分。数据达20%后,平均mIoU在45.3饱和,后续扩展仅对长上下文和模糊边界基准有益。

渐进式标签筛选显示质量优于数量的模式:通过时序共识和语义验证过滤,训练集缩小至原始大小的约八分之一,同时将平均mIoU从42.0提升至44.1,而随后在相同缩减集上的边界精化带来最大阶段增益1.7点,达到45.8。完整级联整体上比原始Qwen标签提升3.8点,尤其在ActivityNet和QVHighlights上提升显著,尽管在VUE-TR和MomentSeeker上有轻微退步。时序共识和语义验证将标签池从超过735K缩减至93.2K QA轮次,同时将平均mIoU从42.0提升至44.1,表明即使在样本少得多的情况下,移除不稳定或不相关标签也能提升性能。在已过滤标签上的边界精化带来最大单阶段增益(+1.7 mIoU),表明一旦时序可复现性和语义相关性得到保证,边界噪声成为主要瓶颈。

将最大打包长度从16K token增加到100K token,平均时刻检索mIoU从44.4提升至46.4,最大增益在32K时出现。改进集中在长视频和自我中心基准如VUE-TR-V2和Ego4D-NLQ,而较短上下文任务仅显示边际变化。将打包长度从16K扩展到32K,平均mIoU提升1.0点,主要来自VUE-TR-V2(+2.6)和Ego4D-NLQ(+2.1)。超过32K后,增益递减:64K增加0.5点,100K再增加0.5点,大多数数据集达到接近平台性能。

在训练中多样化指令措辞和时序定位的响应格式,比固定模板基线提升性能。仅使用多样化响应格式带来明显增益,而仅多样化指令仅有边际提升。完全多样化设置达到最高平均mIoU,在所有数据集上优于基线。仅多样化响应格式相比固定基线有明显改善,而仅多样化指令措辞几乎无增益。多样化指令与多样化响应格式结合带来最佳总体性能,在所有评估数据集上一致提升。

TimeLens2在不同模型规模和时序定位基准上展示出一致改进,即使紧凑变体在挑战性多区间和问题式任务上也优于更大的模型。数据规模遵循饱和模式,前5%训练数据提供大部分增益,而渐进式标签筛选揭示,通过时序共识和语义验证的质量过滤比原始数据量带来更好的性能。更长的打包序列长度主要有利于长视频和自我中心基准,而在训练中同时多样化指令措辞和响应格式带来最稳健的总体性能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供