Command Palette
Search for a command to run...
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch:迈向下一代多模态深度研究智能体
摘要
我们提出 Video-DeepResearch(Video DR),将多模态智能体从静态图像拓展至连续视频流,这一设定要求密集的时空定位与开放网络探索相结合。初步评估揭示了当前模型的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而倾向于文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正的工具增强执行。为应对这些挑战,我们设计了 VIDEO-DEEPRESEARCH,其核心是一个解耦的感知-探索流水线,并采用分阶段工具解锁机制,迫使模型在网络检索前进行详尽的跨帧视觉定位。我们的框架采用两阶段训练方案——监督微调后接分组相对策略优化(GRPO)——实现自主探索,从而突破模仿学习的天花板。此外,我们精心构建了 VIDEODR-BENCH,这是一个人类与 AI 协同构建的基准,包含 200 个复杂的多跳视觉问答实例。实验结果表明,我们的 Video-DeepResearch-35B-A3B 模型以 64.0% 的平均准确率创下新的最优水平,超越闭源模型 Claude-4.5-Sonnet(59.0%)5.0 个百分点,并显著优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。30B-A3B 变体达到 59.3% 的准确率,与 Claude-4.5-Sonnet 相当,证明了我们的训练范式即使在紧凑规模下依然有效。
一句话总结
来自中国科学技术大学(USTC)、小红书及其他机构的研究者提出 Video-DeepResearch,一种多模态深度研究 agent,通过带有分阶段工具解锁的解耦感知-探索流水线将其扩展到连续视频流,使用监督微调和分组相对策略优化(Group Relative Policy Optimization,GRPO)进行训练,并在 VIDEODR-BENCH 上评估,Video-DeepResearch-35B-A3B 在该基准上达到了 64.0% 的平均准确率,刷新了当前最优水平,超越了 GPT-5 和 Gemini 2.5 Pro。
核心贡献
- Video-DeepResearch 框架采用带有分阶段工具解锁的解耦感知-探索流水线,强制在网络检索之前进行充分的视觉定位,以解决模态偏差和参数化知识泄漏问题,并使用两阶段 SFT-GRPO 训练方案实现自主探索。
- VIDEODR-BENCH 是一个由人类与 AI 共同构建的基准,包含 200 个多跳 VQA 实例,每个问题都同时要求密集的时空视频推理和外部知识检索。
- Video-DeepResearch-35B-A3B 在 VIDEODR-BENCH 上取得了 64.0% 的最优平均准确率,超越了 Claude-4.5-Sonnet(59.0%)、GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%),而 30B-A3B 变体得分为 59.3%,展示了在紧凑规模下的竞争性能和训练范式的有效性。
引言
研究者应对 Video-DeepResearch 这一新兴挑战,即 AI agent 必须在连续视频流中进行复杂的多步调查,从而在视觉丰富的环境中实现更全面的自主研究。先前的工作已从纯文本深度研究推进到基于图像的深度研究,但现有 agent 表现出对主动视觉探索的系统性回避,倾向于利用记忆中的知识而非真正基于视频证据进行推理。为解决这一问题,研究者引入了 VIDEO-DEEPRESEARCH,一个包含可扩展数据引擎及分阶段工具解锁的统一框架,并进一步贡献了 VIDEODR-BENCH,这是一个严格的基准,每个问题都同时要求视觉搜索和外部知识推理。
数据集
研究者构建了两个视频问答数据集,用于训练和评估一个通过使用外部搜索工具来回答问题的模型。
合成训练集:30k VQA 对
-
来源 视频来自多种既有视频基准和真实流媒体平台,涵盖广泛领域。
-
过滤规则 使用两阶段流水线清理视频池。 基于规则: 超出预定义时长范围的视频被丢弃。 基于 Agent: 使用 Qwen3.5-35B-A3B 模型对内容复杂度进行评分,并移除无信息量或过于简单的视频。 过滤后的视频池被分为训练子集和测试子集;测试子集随后用于生成评估基准。
-
元数据构建 对于每个视频,使用 agent 驱动流程(使用 Qwen3.5-397B-A17B)首先通过 CLIP 帧间相似度选择关键帧。同一模型通过边界框定位不同的视觉实体。这些裁剪区域用于视觉搜索,辅助模型(Qwen3.5-35B-A3B)验证裁剪区域与搜索结果之间的语义对齐。最终的元数据元组为:⟨关键帧,边界框,实体名称,搜索摘要⟩。
-
QA 生成 问题从整理好的元数据中按照两种模式合成: 单实体: 关于一个实体的基于事实的问题。 多实体: 需要对多个实体进行推理的复合问题。 浅层视觉属性问题(例如,“这辆车是什么颜色?”)会被降低权重。
-
记忆泄漏过滤 每个生成的 QA 对都经过参数化知识的压力测试。模型尝试在不使用任何工具的情况下回答该问题四次;如果有任何一次尝试成功,该实例将被永久丢弃。这确保了剩余的 30k 对需要通过外部搜索才能得到正确答案。
-
用途 该集合用于构建训练轨迹,很可能用于工具使用 agent 的监督微调或强化学习。
VIDEODR-BENCH:评估基准
-
来源 来自上述过滤视频池的人工精选子集,经过仔细采样和标注,以确保可回答性和高数据保真度。
-
人机协作标注 标注者观看视频并在关键时刻暂停。使用
Crop_Search工具查询显著视觉实体,严格验证检索到的外部证据与原始帧匹配。基于这些验证结果,为每个视频编写若干种子 VQA 对。 -
用于复杂多跳问题的多 agent 合成 种子被输入多 agent 流水线:
- 草拟 agent 进行语义扩展头脑风暴(例如,从“勒布朗·詹姆斯”到关于他的球队、配偶或奖项的相关关键词)并查询网络。
- QA 生成 agent 使用检索到的上下文构思新颖的多跳问题。
- 泄漏过滤器: 任何模型无需工具即可回答的问题被丢弃。
- 人类标注者根据检索到的证据验证可回答性。
- 排序 agent 对经过验证的候选问题进行评分,仅保留评分最高的问题。 这个评分最高的问题本身可以成为新的种子,形成一个迭代循环,将复杂度逐步提升至更高跳的推理任务。
-
特点 该基准包含复杂的多跳问题,这些问题明确依赖于外部网络搜索和视觉搜索,所有实例均经人工验证,确保可回答性并将参数化泄漏降到最低。
-
用途 VIDEODR-BENCH 作为主要评估集,用于衡量模型在工具增强下进行开放式视频深度研究的能力。
方法
研究者将视频深度研究(Video DeepResearch,Video-DR)形式化为一个序列化定位流水线,将视频概念化为关键实体轨迹的时间序列组合。为使该工作流可操作并弥合从以图像为中心的研究的差距,agent 配备了基础工具,用于隔离信息丰富的时刻并构建精确的视觉查询。Video-DeepResearch 流水线的整体框架如下所示:
形式上,给定一个复杂的研究查询 Q 和视觉输入 V={v1,v2,…,vT},目标是合成一个全面的回答 R。这被建模为一个序列化决策过程,其中 agent 基于历史轨迹 Hi 生成动作 ai∈A:
ai∼πθ(a∣Hi)其中 πθ 表示多模态策略。动作空间 A 包含所定义的视觉工具以及标准网络操作。时间工具选择一个索引 t 以隔离信息丰富的帧 vt,空间工具接收 vt 和一个边界框 B∈R4 以裁剪目标实体,产生一个局部视觉上下文 cvis=Crop(vt,B) 用于下游搜索。
为解决在朴素公式中观察到的严重模态偏差和参数化知识泄漏问题,研究者引入了一个全面的数据合成和 agent 训练流水线。
VQA 生成与轨迹构建 该流水线首先从多样化的原始视频集合中合成基础视频 QA 对。经过基于规则和基于 agent 的过滤后,通过 agent 驱动的元数据整理流程选择关键帧并定位不同的实体。这些实体被裁剪并用于执行视觉搜索查询,由辅助模型验证语义对齐。然后使用单实体和多实体模式合成 QA 对。为保证任务严格需要外部工具使用,通过进行无工具 rollout 对实例进行严格过滤;如果 agent 在没有工具的情况下回答正确,则丢弃该实例。
基于合成的 VQA 对,研究者使用解耦的轨迹构建流水线构建执行轨迹,该流水线明确将视觉感知与网络探索分开。为克服模态偏差,采用了分阶段工具解锁策略。在初始阶段,agent 被限制在仅包含视觉的动作空间中,仅包含 Select_Keyframe 和 Crop_Search,强制在多个关键帧上进行广泛的视觉检索。一旦视觉上下文足够,动作空间会扩展以包含文本工具,如 Search 和 Visit,以得出最终答案。这种两阶段范式迫使模型在进行网络探索之前,进行充分的跨帧、跨实体视觉定位。
多模态训练过程 研究者采用两阶段训练范式来训练 Video-DeepResearch agent。在第一阶段,执行监督微调(Supervised Fine-Tuning,SFT)以建立冷启动,并使模型与解耦的感知-探索工作流对齐。给定一个混合数据集 D,其中每个实例包含上下文 x 和目标输出序列 y={y1,…,yN},SFT 目标最小化标准的自回归负对数似然:
LSFT=−E(x,y)∼Di=1∑∣y∣logπθ(yi∣x,y<i)为解决文本工具利用不足的问题,训练语料库中增加了额外的纯文本 QA 实例。
在第二阶段,应用分组相对策略优化(Group Relative Policy Optimization,GRPO)以优化策略,并激励超越静态 SFT 模仿的内生探索。GRPO 通过组内相对奖励计算优势,消除了单独价值网络的内存开销。应用稀疏二元奖励,对正确答案分配 r=1,否则分配 r=0。为防止格式违规或重复循环主导更新,对应的优势以仅 20% 的概率进行降采样。GRPO 目标定义为:
LGRPO=G1i=1∑G[min(πold(oi)πθ(oi)A^i,clip(πold(oi)πθ(oi),1−ϵ,1+ϵ)A^i)]−βDKL实验
该论文在带有视觉和文本工具的 agent 设定下,在 VIDEODR-BENCH 和 VideoDR 任务上评估视觉语言模型,使用由独立模型评判的最终步骤预测。实验表明,结合了轨迹合成视觉定位、文本增强探索和强化学习的专门训练流水线,使 VIDEO-DEEPRESEARCH 显著优于闭源模型,并纠正了普遍存在的偏向参数化回忆的模态偏差。消融研究证实每个组件对稳健性能都是必要的,分析显示,有效的视频深度研究取决于精心的课程设计而非单纯的模型规模。
在朴素设定中,更大的模型规模并不能保证更好的视频深度研究性能。GPT-5 在准确率上与 397B 参数的 Qwen 模型持平,同时完全忽略视觉工具,依赖参数化文本知识。后续的强化学习阶段将准确率提升至 59.3%,表明训练方法的重要性超过原始规模。GPT-5 在零次视觉工具调用下达到 57% 的准确率,说明基准性能可以在没有真正视觉定位的情况下实现。397B 参数的 Qwen 模型仅达到 58% 的准确率,且很少使用视觉工具,表明仅靠规模并不能确保稳健的视频理解。在中等难度数据集上的强化学习将准确率提升至 59.3%,超越了大型 Qwen 和 GPT-5 模型。
VIDEODR-BENCH 包含短、中、长视频的均衡组合,近一半时长在两分钟以内。在经过筛选的、侧重于难度的数据集上进行强化学习,将基准准确率提升了 2.0 个百分点至 56.5%,表明学习到的探索策略能够泛化至不同视频长度。完整的训练流水线结合了视觉定位、文本深度研究和 RL,总体准确率达到 59.3%,突显了自主探索的必要性。短视频(≤2 分钟)占 VIDEODR-BENCH 的 46%,中等长度视频(2–10 分钟)占 34%,长视频(≥10 分钟)占 20%,构建了一个时间上多样化的评估。在 2K 中等难度数据集上应用 GRPO 强化学习,将 VIDEODR-BENCH 性能提升了 2.0 个百分点,表明获得的探索行为能够泛化至不同时长的基准质量视频。最终 RL 阶段在静态模仿的基础上进一步提升了 2.5 个百分点,将总体准确率推至 59.3%,确认了自主探索对于稳健的视频深度研究至关重要。
一个结合了视觉定位、文本深度研究技能和强化学习的专门训练流水线,使相对紧凑的模型能够在视频深度研究基准上确立新的最优水平。35B 变体超越了所有闭源模型,而 30B 变体与顶级闭源模型持平,并显著优于 397B 的开源模型,表明方法在该领域决定性地胜过规模。提升在知识密集型和娱乐类别中尤为显著,agent 从被动回忆转向主动视觉验证。35B 模型取得了最高的总体准确率(64.0%),并在 VIDEODR-BENCH 上领先(65.4%),超出 Claude-4.5-Sonnet 5.0 个百分点。30B 模型达到 59.3% 的平均准确率,与 Claude-4.5-Sonnet 持平,并优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。训练方法主导模型规模:一个 30B 模型轻松击败了缺乏专门流水线的 397B 开源模型(52.8%)。强化学习和视觉定位相较于基础模型,在知识类别上带来了 +20.3% 的绝对提升,在娱乐类别上带来了 +15.9% 的提升。agent 的工具使用行为发生转变,视觉操作从每次任务 0.10 次上升至 2.33 次,标志着从被动回答向主动视觉定位的转变。
VideoDR 上的模型常依赖参数化知识,GPT-5 的视觉工具调用为零,Qwen3.5-397B 仅 0.10 次。VideoDR-Bench 强制了更强的多模态交互,导致 GPT-5 的视觉调用增加至 0.31 次,文本调用增加至 1.43 次。所提出的 VIDEO-DEEPRESEARCH-30B 转向了平衡策略,在 VideoDR 上达到 2.33 次视觉和 4.24 次文本调用,纠正了基线中观察到的严重文本偏差。在 VideoDR 上,GPT-5 平均 0.00 次视觉工具调用,而 VideoDR-Bench 将该值提升至 0.31,在相同数据集上,文本调用从 0.12 次增长至 1.43 次。Qwen3.5-397B 表现出强烈的文本偏差,在 VideoDR 上为 0.10 次视觉和 1.27 次文本调用,而所提出的模型达到 2.33 次视觉和 4.24 次文本调用,实现了平衡的多模态搜索。
从 40.5% 的平均准确率基线出发,加入视觉定位轨迹(7K-SFT)将性能提升至 53.0%,在 VideoDR 上有更大的绝对增益。进一步融入纯文本深度研究数据将平均准确率提升至 56.8%,在中等难度集上的强化学习将其推至 59.3%,揭示了感知、文本探索和自主训练的互补作用。视觉定位 SFT 单独将平均准确率提高了 12.5 个百分点,VideoDR 从 38.0 跃升至 55.0,VIDEODR-BENCH 从 43.0 升至 51.0。加入 7K 纯文本 QA 实例带来了进一步的 3.8 个百分点的平均增益,直接缓解了 agent 的工具调用偏差。在 2K 中等难度样本上应用 GRPO 提供了额外的 2.5 个百分点提升,尤其使 VIDEODR-BENCH 受益,获得了 2.0 个百分点的改进。
利用涵盖不同视频时长的 VideoDR 和 VIDEODR-BENCH,实验表明更大的模型规模并不能保证更好的视频深度研究性能;经过精心设计的结合了视觉定位、文本推理和强化学习的训练流水线,使紧凑模型能够超越大规模同类模型。该流水线将 agent 行为从被动依赖参数化文本知识转变为主动视觉验证,在需要外部知识和娱乐理解的类别中提升尤为显著。总体而言,训练方法决定性地胜过了原始规模,自主视觉探索成为稳健视频理解的关键。