HyperAIHyperAI

Command Palette

Search for a command to run...

标注即轨迹:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li Guohong Mu Hao Li Shengsheng Qian Dingwen Zhang Qibin Hou Ming-Ming Cheng

摘要

多模态大语言模型(MLLM)已成为统一视频感知的主流范式。然而,在大规模多任务数据集上进行后训练仍面临挑战,因为现有强化学习方法在策略组中采样时,即使借助代价高昂的思维链(CoT)生成,高质量轨迹也寥寥无几。本文研究视频 MLLM 强化学习后训练的样本效率与可扩展性,并提出 OraRL。我们揭示了标注的一个被忽视的作用:除了对轨迹进行评分,每条标注还可以作为神谕轨迹进入其策略组,成为一个直接的正向优化目标。然而,直接引入神谕并非易事:高奖励的神谕会抬高组基线,导致原本正向的策略优势发生反转,我们将这一失效现象称为优势反转。OraRL 的核心是一个解耦优势估计器:策略轨迹确定一个无神谕基线,而神谕与策略之间的差距同时调制一个方向性增益和一个独立的分离式神谕优势。基于符号的平衡剪枝提升了效率:仅保留神谕和每个符号方向上最强的轨迹,OraRL 的步时间仅为 SFT 的 2.2 倍,不到带 CoT 的 GRPO 所需 4.9 倍的一半。OraRL 随模型规模和数据量扩展,在从 0.8B 到 9B 的骨干模型以及多达 100k 提示的 GRPO 上均超越基线。在不使用思维链的情况下,Video-ORA-9B 的解码时间为 130 毫秒,而非 4,780 毫秒。与此前各自的最佳模型相比,它将时序 mIoU 从 62.5 提升至 66.0,跟踪 AO 从 73.0 提升至 78.2,分割从 64.3 提升至 70.4,三项基准的空间智能宏平均从 51.0 提升至 56.1;在 VSI-Bench 上,其得分为 73.1,而 GPT-5 为 55.0,Gemini-3-Pro 为 55.1。

一句话总结

南开大学、西北工业大学和中国科学院的研究人员提出了OraRL,一种面向视频MLLM的强化学习后训练框架,该框架将标注视为oracle rollout,并采用解耦优势估计器来防止优势反转,从而实现无需思维链的高效可扩展训练,同时将时序mIoU从62.5提升至66.0,跟踪AO从73.0提升至78.2,分割从64.3提升至70.4,三个基准的空间智能宏平均从51.0提升至56.1,VSI-Bench得分达到73.1,而GPT-5为55.0,Gemini-3-Pro为55.1。

核心贡献

  • 本文提出了OraRL,一种面向统一视频MLLM的强化学习后训练框架,该框架将每个标注序列化为oracle rollout,将其转化为直接的正向优化目标,同时保留在策略探索。
  • 该框架通过解耦优势估计器识别并解决优势反转问题,其中策略rollout确定不含oracle的基线,而oracle与策略的差距则校准方向增益以及一个独立的分离式oracle优势。
  • OraRL引入了带有矩校正的符号平衡剪枝,将单步时间从92.5秒缩短至62.4秒,平均损失仅0.4个点,并在受控任务中优于SFT和GRPO,同时可扩展至0.8B到9B模型和最多100k提示。Video-ORA-9B在130毫秒内无需思维链解码(而非4,780毫秒),并将时序mIoU从62.5提升至66.0,跟踪AO从73.0提升至78.2,分割从64.3提升至70.4,VSI-Bench得分达到73.1。

引言

统一视频感知要求模型能够提供精确的时序定位、空间定位、分割、跟踪以及超越粗略描述的空间理解。通用多模态大语言模型(MLLM)正越来越多地结合这些能力,但在细粒度感知方面仍落后于任务专用专家,这一差距即便在专有规模和后训练提示下依然存在。核心问题是样本效率:监督微调将标注严格视为最大似然目标,缺乏任务级对比;而基于组的视频强化学习方法仅将标注用作评分参考,很少获得与精确标注匹配的在策略rollout,导致许多优化组缺乏可靠的正向锚点。作者提出了OraRL,一种强化学习框架,将每个人工标注序列化为oracle rollout,提供可靠的正向目标。通过将该oracle排除在优势基线之外,并结合符号平衡剪枝,OraRL避免了导致朴素oracle混合失效的优势反转,实现了高效、任务无关的训练,在多个模型规模、数据预算和七个视频感知任务族上均优于SFT和标准GRPO。

方法

作者提出了OraRL,一种将真实标注直接融入策略优化过程的强化学习框架。给定多模态查询 q=(v,x)q = (v, x)q=(v,x),策略模型采样 nnn 个在策略rollout Oop={oi}i=1n\mathcal{O}_{op} = \{o_i\}_{i=1}^nOop={oi}i=1n。OraRL并非丢弃人工标注,而是将每个标注 yyy 序列化为模型的响应格式,创建oracle rollout ogt=Ttask(y)o_{gt} = T_{task}(y)ogt=Ttask(y)。该oracle被附加到在策略组中,形成增强集合 Oaug=Oop{ogt}\mathcal{O}_{aug} = \mathcal{O}_{op} \cup \{o_{gt}\}Oaug=Oop{ogt}

如下图所示:

标准的组相对策略优化通过对整个增强组进行归一化来计算优势。然而,将高奖励oracle纳入基线会提高优势阈值,导致高于平均水平的在策略rollout获得负优势并受到惩罚。为解决这一优势反转问题,OraRL仅从在策略奖励中计算基线,并通过专门的缩放项编码oracle与策略的差距。

首先,作者定义了在策略优势估计。每个在策略rollout的基础优势计算为 Ai(0)=riμopA_i^{(0)} = r_i - \mu_{op}Ai(0)=riμop,其中 μop\mu_{op}μop 是在策略奖励的均值。通过省略方差归一化并将oracle排除在均值之外,任何优于在策略平均水平的rollout都能保证获得非负优势。为了捕捉oracle与策略的差异,他们基于纳入oracle后奖励离散度的变化计算方向增益 gqg_qgq

gq=clip[(σaugσop+ϵ)1/4,1,4]g_q = \mathrm{clip} \left[ \left(\frac{\sigma_{aug}}{\sigma_{op} + \epsilon}\right)^{1/4}, 1, 4 \right]gq=clip[(σop+ϵσaug)1/4,1,4]

该增益仅应用于具有正基础优势的rollout(Ai(0)>0A_i^{(0)} > 0Ai(0)>0),放大其信号而不影响低于平均水平的rollout。随后,将得到的优势重新中心化,以确保在策略组内总和为零,得到 AiopA_i^{op}Aiop

其次,该框架引入了分离式oracle优势。作者并非使用原始奖励差异,而是推导出一个校准尺度 AgtA_{gt}Agt,以适应剩余的监督差距。他们计算一个归一化权重 wqw_qwq,当在策略均值收敛至oracle奖励时,该权重趋近于零。该权重与最大正策略优势 Amax+A_{max}^+Amax+ 结合,以限制oracle的影响:

Agt=min(2wq,clip(1.2Amax+,0.05,1))A_{gt} = \min \bigl(2 w_q, \mathrm{clip} (1.2 A_{max}^+, 0.05, 1) \bigr)Agt=min(2wq,clip(1.2Amax+,0.05,1))

这确保了oracle提供强有力的锚点,而不主导梯度更新。

为提高计算效率,OraRL采用了符号平衡的优势剪枝。在策略前向和后向传播之前,该方法保留 KKK 个rollout的子集。oracle始终作为正向锚点保留。其余位置在正、负在策略rollout之间平均分配,按序列级优势的绝对值排序。这种符号配额保留了强化和抑制两种信号,不同于仅按幅度剪枝可能只选择单一符号的情况。

剪枝后,应用选择后矩校正以恢复统计特性。由于保留的集合偏向大幅度rollout且始终包含正向oracle,优势的均值和尺度会发生偏移。作者首先将优势重新中心化至零和。如果中心化会惩罚oracle,则投影向量以强制oracle优势非负,同时保持零和约束。最后,使用裁剪因子 λq\lambda_qλq 重新缩放优势,使所选子集的均方根与剪枝前的在策略RMS匹配,防止更新尺度不成比例。

随后,统一的策略更新利用这些校正后的优势 A^i\widehat{A}_iAi。目标函数最大化oracle和正策略rollout的似然,同时抑制负样本,使用标准的截断重要性比率 ρi,t\rho_{i,t}ρi,t

J(θ)=1NqiSqt=1oimin(ρi,tA^i,ρˉi,tA^i)\mathcal{J}(\theta) = \frac{1}{N_q} \sum_{i \in \mathcal{S}_q} \sum_{t=1}^{|o_i|} \min \left(\rho_{i,t} \widehat{A}_i, \bar{\rho}_{i,t} \widehat{A}_i\right)J(θ)=Nq1iSqt=1oimin(ρi,tAi,ρˉi,tAi)

其中 NqN_qNq 是保留的响应token总数。该流程确保策略从可靠的正向目标中学习,同时保持稳定且均衡的梯度更新。

实验

实验设置评估了OraRL在七个视频感知和空间智能任务族上的表现,与SFT、GRPO及其他RL范式在受控训练预算下进行比较。OraRL在所有任务上均取得一致提升,并随模型规模和数据扩展而增强,消融实验表明其oracle驱动的方向增益和分离式优势防止了困扰朴素oracle注入的优势反转。额外分析证实,视频数据有益于空间推理,无需思维链,且该方法可跨骨干网络泛化,训练和推理高效。

Video-ORA-9B在所有三个TimeLens基准上取得了最佳的时序定位结果,优于专有模型Gemini-2.5-Pro和专用模型TimeLens2-8B。在更严格的重叠阈值下,其相对于TimeLens2-8B的优势扩大,在ActivityNet上[email protected]提升6.7个点,这与标注提供的精确边界带来的益处一致。较小的4B变体也在10B参数以下的开放模型中排名第二,仅次于TimeLens2-8B。Video-ORA-9B在Charades-TimeLens、ActivityNet-TimeLens和QVHighlights-TimeLens的所有指标上均领先,mIoU比TimeLens2-8B高出2.3至5.0个点,并超过Gemini-2.5-Pro。在ActivityNet和QVHighlights上,随着所需时序重叠的收紧,其相对于TimeLens2-8B的差距进一步扩大,ActivityNet上最大的[email protected]优势为6.7个点。Video-ORA-4B在10B参数以下的开放模型中mIoU排名第二,仅次于TimeLens2-8B。

Video-ORA-9B在所有八个RefCOCO、RefCOCO+和RefCOCOg验证及测试划分上均领先空间定位,比最强基线高出0.5至2.7个[email protected]点。最大优势出现在RefCOCO+验证集上,该数据集排除了绝对位置词。这一模式与基于视觉外观和物体关系的更强定位能力一致。Video-ORA-9B在RefCOCO家族的所有划分上[email protected]均排名第一。相对于最强基线的优势在RefCOCO+验证集上最大,该数据集不含绝对位置词。

Video-ORA-9B在七个多项选择视频问答基准中的五个上取得了开源模型中的最佳结果,相比其Qwen3.5-9B骨干网络有显著提升。最大增益出现在VideoHolmes、VideoMME和MMVU上,而LongVideoBench仅略有提升。Video-ORA-9B在七个评估基准中的五个上排名第一。与骨干网络相比,跨基准的宏平均从61.9提升至66.8。性能跃升在VideoHolmes、VideoMME和MMVU上最为显著。LongVideoBench仅有1.6个点的微小提升。

在GOT-10k 32帧跟踪任务上,Video-ORA-9B在所有报告模型中取得了最佳的平均重叠率和每个IoU阈值下的召回率。Video-ORA-4B也优于同等规模的Qwen3.5模型,但仍低于OneThinker-8B和Video-ORA-9B。Video-ORA-9B相对于OneThinker-8B的领先优势在最严格的定位阈值下最大。Video-ORA-9B在平均重叠率和所有召回阈值上均领先所有列出的模型。两个Video-ORA模型相比其Qwen3.5对应模型均显示出显著的跟踪增益。Video-ORA-9B与次优模型之间的最大差距出现在最严格的IoU阈值下。

在时空视频定位上,Video-ORA-9B在时序和空间定位方面均领先所有比较模型。其相对于Qwen3.5-9B骨干网络的空间定位优势尤为显著。Video-ORA-4B也优于Qwen3.5-4B,并在时序指标上超过了更大的Qwen3.5-9B,同时取得了更强的空间分数。Video-ORA-9B在比较模型中取得了最高的时序和空间定位分数。Video-ORA模型在空间定位上的相对增益大于时序定位,尤其是相对于其Qwen3.5骨干网络。

Video-ORA在时序定位、空间定位、视频问答、目标跟踪和时空定位等任务上进行了评估,其中9B模型持续取得最先进的结果,优于Gemini-2.5-Pro等专有模型和专用基线。该模型受益于精确的边界标注,在更严格的重叠阈值下增益扩大,并在空间定位上相对于其Qwen3.5骨干网络显示出更大的相对提升。较小的4B变体也展现出强大的性能,在多项任务中于10B参数以下的开放模型中排名第二。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供