Command Palette
Search for a command to run...
StreamArena: 面向连续、交互式且长时程的智能体流式视频理解
StreamArena: 面向连续、交互式且长时程的智能体流式视频理解
Xichen Zhang Guankai Li Yinghao Zhu Shijian Wang Sitong Wu Shaozuo Yu Meng Chu Yuan Lu Jiaya Jia
摘要
在连续的真实世界环境中部署自主多模态智能体,需要其摄入无界的视听流并维持小时级的记忆。然而,当前的评测主要依赖简短片段和选择题形式。这种设计使得仅处理最后四帧的最小基线能够匹敌或超越复杂的流式模型,而答案选项也暴露了语言捷径。我们引入 StreamArena,一个面向小时级交互式流视频理解的基准。StreamArena 包含 243 段全长视频(平均时长 88.8 分钟)和 3,646 个严格标注的开放式问答对,评估实时感知、历史回溯、主动交互和多模态工具使用。在不同系统上的评估揭示了连续交互与长时程多模态理解之间的张力。仅保留近期帧的方法无法恢复久远事件,将过去观察转化为文本的方法丢失视觉证据,反复压缩视觉记忆的方法难以长期保留细粒度细节。我们通过 StreamMind 解决这一张力,它是一种双层架构,将延迟关键的交互和主动监测分配给独立调度的前端工作器,而后端工作器异步构建持久多模态记忆并执行历史回溯和外部搜索。StreamMind 在全部四项能力上均优于现有流式基线,并通过重用持久状态降低了查询到答案的延迟。
一句话总结
来自香港科技大学等机构的研究人员提出了 StreamArena,这是一个用于小时级交互式流媒体视频理解的基准,包含243个完整长度视频和3,646个开放式问答对;同时提出了 StreamMind,一种双层架构,将延迟关键的交互卸载到前端 worke r,而后端 worke r 异步构建持久多模态记忆,以改善长期理解并降低查询延迟。
核心贡献
- StreamArena 是一个用于小时级流媒体视频理解的基准,包含243个平均时长88.8分钟的视频和3,646个开放式问答对,共同评估实时感知、历史回溯、主动交互和多模态工具使用。
- 在五类系统上的实验表明,现有设计仅支持这些能力中的一部分,并暴露出特定的失败情况,例如文本转换丢失视觉证据、短期记忆无法恢复久远事件,以及重复压缩导致细节退化。
- StreamMind 架构将延迟关键的交互与异步记忆构建和检索解耦,通过独立调度的前端和后端工作器,在所有四项能力上超出最强流式基线53.7%至228.1%,并通过持久状态复用将查询到回答的延迟降低66.2%。
引言
作者针对构建持续、小时级场景中的永远在线多模态agent(如具身机器人和可穿戴设备)所面临的挑战展开工作。传统回合式模型被动处理预分割片段并等待用户提示,遗漏瞬时事件且无法主动干预。现有基准加剧了这一问题,使用短视频和选择题形式,使语言先验和近因捷径虚增分数,而当前的流式系统各自仅针对所需能力(实时感知、历史回溯、主动交互和工具使用)的一部分,且表现出显著权衡。作者贡献了 StreamArena(包含243个全长视频,约89分钟/个,3,646个开放式的、带有因果时间戳的任务)和 StreamMind(一种双层流式架构,将前端交互与异步记忆构建和检索解耦),在四个评估维度上均取得显著提升。
数据集
作者提出 StreamArena,一个用于评估在小时级视频上进行多轮交互的永远在线流式助手的基准。
数据集组成与来源
- 243个视频来自YouTube,覆盖七个领域(如vlog、教程、新闻)。
- 每个视频至少60分钟(平均88.8分钟,最长134.2分钟),分辨率1080p或更高,包含英文或中文音频。排除了敏感、不当和政治内容。
- 经过三阶段标注流程最终确定3,646个问答对:博士级标注者每个视频起草约20个多轮对话对,两位交叉验证者进行改进,第三位标注者审核问题、答案、证据和时间戳。约73%的草稿被保留,每个视频最终得到约15对。
- 所有问题及支持证据片段均带有明确时间戳;同一视频中的连续问题保持对话连续性。
子任务划分(基于评估能力)
- 实时多模态感知:263对,需要跨同步音频和视频进行联合推理。
- 历史回溯:877对,查询流媒体中的过去事件。证据到查询的时间差中位数为12.1分钟(IQR 5.7–25.7分钟);49个问题的最近证据在查询前一小时以上。20.6%的回溯问题超出30分钟间隔。
- 多模态工具使用:1,732对,需要外部搜索(如Google)以获取视频流或助手参数记忆中不可用的信息。
- 主动交互:774对,其中agent必须自主监控并在指定事件发生时发出警报,而无需在那一刻收到新提示。12.0%的主动任务需要监控超过4分钟。
- 此外,189个问题(21.6%)需要对至少两个不同的证据片段进行联合关注;要求最严格的问题涵盖15个片段。
数据集使用方式
- StreamArena 作为零样本评估基准。不提供训练或微调划分,模型直接在发布集上测试。
- 对于显式触发任务(回溯和工具使用),事实性答案准确度是主要指标,由Gemini 3.1 Pro根据标准答案进行严格二元检查评判。
- 工具使用问题的准确度反映端到端的工具赋能答案,而非工具调用轨迹。
- 主动任务根据内容正确性和时间敏感性进行评估:只有当警报内容与标准答案匹配且检测时间戳落在标注事件时间的[-0.5秒,+2.0秒]内时,才视为正确。
- 响应延迟从查询到达到回答交付衡量,针对被动任务,不包括查询之前的连续流处理。
方法
作者提出了 StreamMind,一种旨在将延迟敏感的交互与长期认知解耦的架构,以支持永远在线流式助手。为支持 StreamArena 基准所需的多样化能力,如实时多模态感知、历史回溯、多模态工具使用和主动交互(如下图所示),StreamMind 采用了双层架构。
如下图所示,系统分为与用户交互并执行任务调度的前端层,以及维护持久记忆并执行检索密集推理的后端层。
前端交互与调度 前端工作器(Front Worker)是交互网关和高级调度器。给定一个用户轮次、近期因果观察和对话状态,它在三条执行路径中选择。当上下文足够时立即回答;当请求需要历史或外部证据时,为后端制定检索概要;当用户要求系统观察未来条件时,实例化一个监控工作器(Monitor Worker)。每个监控工作器为其分配的条件维护独立的生命周期,仅在条件满足时通知前端,确保持续的监控不会占用前端工作器或延迟无关交互。
异步记忆构建 与前端交互并行地,记忆写入器(Memory Writer)持续将传入的帧和语音观察转换为记忆库。其层次化事件层将局部行为组织为微事件,并逐步聚合为宏事件和超事件。一个补充的实体关系图跨时间连接反复出现的人物、物体、地点及其关系。事件保留关键实体、时间边界、文本描述和代表性帧,同时保存紧凑的语义结构和可检索的视觉证据。由于记忆构建独立于用户查询,流媒体在后续问题揭示需要哪些证据之前就已整合完成。
后端检索与协调 当前端工作器委派任务时,路由工作器(Router Worker)充当协调者。它将请求分解为召回(Recall)和搜索(Search)子任务,并发执行独立的子任务,检查返回的证据,并决定是否进行新一轮检索或合成最终响应。召回工作器在事件层次和实体图上进行内容可寻址检索,返回相关描述、关系和历史关键帧。搜索工作器通过图像检索定位可见实体,并通过外部文本搜索获取视频流中不可用的信息。它们的组合支持多阶段请求:路由工作器可先通过召回恢复早期事件及其关键帧,然后将该帧作为搜索的视觉锚点。召回和搜索保持专用,不直接通信;路由工作器调解它们的证据交换和全局推理状态。
解耦执行 该架构支持两种执行模式。持续摄入驱动监控和记忆构建,而事件驱动消息仅在需要时创建监控器或激活后端召回或外部搜索。每次查询驱动的记忆读取均受对应查询时间的约束,保持对流的因果访问。通过将非思考型前端工作器与具备思考能力的后端工作器配对,StreamMind 支持低延迟交互、主动监控、历史回溯和外部工具使用。
实验
评估在 StreamArena 上进行,该基准包含3,646个多轮问答对,横跨243个长视频,要求实时多模态感知、历史回溯、工具使用和主动监控。五组架构在查询触发协议下进行比较。StreamMind——唯一结合了持续摄入、持久记忆、检索和主动监控的系统——在所有能力上显著优于流式基线,尤其在工具使用和长期理解方面。StreamMind 还通过复用预计算状态降低了在线响应延迟,诊断分析证实多模态证据、充分的时间覆盖和记忆检索对流式鲁棒性能至关重要。
现有的流式视频基准存在近因捷径的缺陷,缺乏真正的持续监控,而离线基准虽然支持长的全模态视频,却忽略了交互能力。StreamMind 为工具使用和主动触发引入了显式的工作器协调,相对流式基线取得了可观的提升,并通过状态复用将响应延迟降低约三分之二。诊断分析证实,视觉输入对实时感知至关重要,语音提供补充性改进。StreamMind 的工作器协调在工具使用上相对最强流式基线获得了228.1%的提升。在实时感知任务上,仅视觉输入达到26.8%准确度;加入语音后提升至32.4%,显示了多模态的互补收益。
StreamArena 的时间分层揭示了不同的需求分布:历史回溯问题分布在超过30分钟的不同时间跨度上,最大份额在5–15分钟区间,而主动交互问题绝大多数集中在30秒到4分钟的窗口内,突显了快速、无需提示的事件检测需求。超过半数的主动交互问题落入30秒到4分钟层,仅12%超过4分钟,强调了持续短延迟警觉的需要。历史回溯问题分布在四个层次中,峰值在5–15分钟(37.6%),但5分钟以下和30分钟以上的比例相似,表明广泛的时间回溯需求。三分之一的主动问题要求在30秒内响应,加剧了无显式查询的自主监控挑战。
StreamMind 在所有 StreamArena 的四项能力上持续取得流式系统中最高的准确率,较最强流式基线的相对提升分别达到实时感知58.4%、历史回溯53.7%、工具使用228.1%和主动监控54.7%。其检索增强的多模态记忆在每个长期回溯间隔上都带来了收益(24.0–73.0%),而人类在重新观看情况下历史回溯得分(HR)从80.7%降至不重新观看时的63.4%,突显了小时级流式回忆的困难。该系统独特地将持续摄入与所有四种能力类型统一起来,而离线回合式模型无法执行主动交互或在视频过程中保持状态。StreamMind 通过路由工作器、召回工作器和搜索工作器之间的显式协调,在工具使用上实现了对最强流式基线228.1%的提升。人类历史回溯在离线条件下平均80.7%,到流式条件下降至63.4%,显示出在长时间间隔内不重新观看而保留证据的内在挑战。
StreamMind 与运行离线推理的同一骨干相比,大幅降低了从查询到回答的延迟,同时保留了大部分准确率。在各类问题中,相对延迟降低幅度在实时感知上达84.6%,历史回溯上73.9%,工具使用上55.3%,系统的加权平均延迟为27.5秒,而骨干为81.4秒。StreamMind 还在所有受测模型(包括闭源替代方案)中录得最低延迟。使用共享的Qwen骨干,StreamMind 在实时感知上降低延迟84.6%,历史回溯73.9%,工具问题55.3%,同时保留了89.7%的综合准确率。StreamMind 的主动记忆构建实现了27.5秒的加权平均延迟,低于离线骨干的81.4秒,使其在所有比较系统中响应时间最快。
视觉输入在所有任务中都是必需的,仅ASR输入在实时感知和历史回溯上准确率极低,但在工具使用上中等。在视觉输入中加入音频为实时感知带来补充增益,对历史回溯有小幅提升,而工具使用准确率保持不变。多模态条件取得了最高的总体准确率,主要由视觉证据驱动。仅ASR输入在实时感知上准确率为4.2%,历史回溯上16.7%,但工具使用问题上相对较高,达42.5%。仅视觉输入将实时感知提升至26.8%,历史回溯提升至37.8%,证明视觉证据对这些任务至关重要。在视觉输入中加入音频进一步将实时感知提升5.6个百分点至32.4%,历史回溯提升3.3个百分点至41.1%。工具使用在视觉输入下的准确率(60.5%)与加入音频后(60.0%)基本一致,表明语音对该类别没有额外益处。
StreamMind 在 StreamArena 上进行了评估,该基准覆盖实时感知、历史回溯、工具使用和主动监控。其工作器协调和状态复用带来了显著的准确率提升和流式系统中最低的延迟。消融研究表明视觉信息至关重要,语音提供互补的多模态收益,而主动任务需要即时检测。该系统独特地将持续摄入与所有能力类型集成,同时人类在不重新观看时回忆会下降,突显了实时流媒体记忆的难度。