Command Palette
Search for a command to run...
OmniAssistBench:面向全模态大语言模型的助手式交互评测基准
OmniAssistBench:面向全模态大语言模型的助手式交互评测基准
Xianyun Sun Chaoyou Fu Zhengye Zhang Feiyang Duan Qingyuan Cao Yonghui Niu Sihang Yuan Ge Zhang Caifeng Shan
摘要
近年来,全模态大语言模型(Omni-LLM)展现出作为实时视频助手的巨大潜力,能够持续感知环境并引导用户达成特定目标。与传统的被动视频理解不同,交互式助手应主动结合视觉状态、用户目标与先验知识来提供有效帮助。评估这一能力颇具挑战,因为模型不可预测的响应会动态改变用户的后续行为,而静态离线数据集无法适应这种变化。为解决这一瓶颈,我们提出了 OmniAssistBench。针对交互路径发散问题(即同一用户目标可通过多种方式实现),我们为模型提供从源视频中提取的预定义先验,要求其引导用户沿完全相同的路径行进。由于真实交互视频稀缺,我们通过对现有互联网视频进行逆向工程来构建数据集:我们推断出合理的用户目标,并将视频分割为多轮片段以模拟连续交互。这一严谨流程耗费了超过 1000 人时的专家工作量。结果表明,闭源模型 Gemini-3-Pro 在满分 100 分中获得 66.4 分,而开源模型 Qwen3-Omni-Instruct 获得 51.2 分。尽管当前模型普遍能理解用户输入,但它们经常给出错误或不完整的回答。具体而言,模型难以处理视觉提示(如手势),在多轮交互中无法保持历史上下文,且无法将响应延迟至目标事件发生。这些结果表明,在模型成为可靠的助手之前,仍有巨大的改进空间。
一句话总结
南京大学、南开大学和滑铁卢大学的研究人员推出了 OmniAssistBench,这是一个用于全模态大语言模型 (Omni-LLM) 中助手式交互的基准测试,它利用源视频中的预定义先验和逆向工程的互联网视频来模拟连续交互。评估结果显示,Gemini-3-Pro 达到 66.4 分(满分 100 分),Qwen3-Omni-Instruct 达到 51.2 分,当前模型在视觉提示、历史上下文和延迟响应方面暴露出弱点。
核心贡献
- OmniAssistBench 是一个用于评估全模态大语言模型作为交互式实时视频助手的综合基准测试。
- 标注流水线通过从源视频中提取预定义先验来解决交互路径分歧。这些视频被逆向工程为多轮片段,以模拟连续的引导式交互。
- 在 OmniAssistBench 上的实验表明,Gemini-3-Pro 达到 66.4 分(满分 100 分)。分析揭示了在手势跟随、长上下文记忆、延迟响应时机和跨轮信息保留方面的失败。
引言
作者关注从被动视频理解向实时交互式全模态大语言模型助手的转变,其中模型的指导会改变用户的下一步行动,并产生分歧的交互路径。传统基准测试使用带有固定问答对的静态视频,因此无法使视频输入适应不可预测的模型响应,也无法枚举所有可能的交互轨迹。为了解决这个问题,作者推出了 OmniAssistBench,它通过逆向工程现有的互联网视频构建:从每个源视频中推导出显式的先验路径,固定该路径,并将视频分割为模拟助手与用户交互的多轮片段。该基准测试结合了基础感知层级和高级目标导向层级,以及拍摄的真实世界案例,评估揭示了在视觉提示跟随、长期记忆、延迟响应和跨轮上下文保留方面的局限性。
数据集
作者构建了 OmniAssisBench,一个完全由人工标注的基准测试,用于评估交互式视频助手。所有标签均来自人类专家,投入超过 1000 个专家小时。
-
数据来源与收集
- 原始素材主要来自 YouTube,并辅以来自动作识别、教学视频和情感分析数据集的精选片段。
- 对于难以在线找到的场景,包含少量家庭拍摄样本。
- 视频根据详细情节(例如,至少有三人的社交场景)而非宽泛关键词进行选择,收集旨在均匀覆盖常见的日常生活场景。
-
数据集构成
- 每个样本是一个嵌入视频中的开放式问答对。
- 真实答案由完整的答案段落和 1 到 3 个必须出现在正确回答中的关键点短语组成。
- 问题针对两个任务层级设计:
- 基础交互理解:关于视频中直接可见的物体或事件的问题。
- 高级交互理解:由用户目标和从视频中总结的先验知识驱动的问题;目标对象未被明确提及。
- 三个额外的真实世界场景测试案例(会议模拟、盲人辅助、手工艺过程跟踪)在更长的、脚本化的一次性视频中结合了多种能力。
-
处理与格式
- 为了模拟在线流媒体,用户提示通过 TTS 转换为语音,并临时嵌入到输入视频的末尾。视觉提示(手势、手写)以画中画片段的形式插入,用户目标以屏幕字幕的形式出现。
- 对于非时序任务,视频被手动修剪至 30 到 180 秒,同时保留所有教学线索;所有视频标准化为约 1080p 分辨率。
- 在质量精炼阶段,最先进的多模态大语言模型(例如 Gemini-3-Pro)检查标注完整性。如果模型产生逻辑正确但措辞不同的答案,则手动验证并添加为替代参考。
-
论文中的使用
- OmniAssisBench 仅用作评估基准测试,没有训练划分。
- 模型根据其在多轮、类似流媒体的环境中回答开放式问题的能力进行评估。
- 评估依赖于双因素指标:与真实答案句子的语义相似度以及所有关键点的包含情况。
方法
作者利用一个全面的四阶段流水线来构建数据集,包括场景设计与视频收集、问答设计、视频编辑与用户提示嵌入,以及质量精炼。
如下图所示:
在场景设计与视频收集阶段,人类专家与 LLM 合作,头脑风暴出挑战特定模型能力的关键场景。原始素材主要来自 YouTube 和精选数据集,并辅以针对难以在线找到的情节的家庭拍摄样本。作者确保收集的视频均匀覆盖常见的日常生活场景。
关于主题分布的框架图:
在问答设计阶段,专家根据源视频和任务类型制定问题。对于基础交互理解任务,问题针对特定物体或事件。相反,高级交互理解任务依赖于用户目标和总结的先验知识来建立固定的交互路径。为了解决开放式评估的挑战,每个样本都标注了一个真实答案句子和 1 到 3 个关键点。评估指标同时评估与真实答案的语义相似度以及所有关键点的包含情况,防止标准过于僵化。
在视频编辑和用户提示嵌入阶段,问题通过 TTS 转换为语音并临时嵌入。手势和手写等视觉提示以画中画形式插入,用户目标以屏幕字幕形式出现。非时序任务的视频被修剪至 30 到 180 秒,以适应上下文窗口限制,所有视频标准化为 1080p 分辨率。在最后的质量精炼阶段,最先进的多模态大语言模型评估标注完整性,逻辑正确但措辞不同的回答经人工验证后添加为替代参考。
在基础交互理解和高级交互理解的分类指导下,作者提炼出关键能力,制定了 7 个主要任务和 16 个子任务。
关于任务构建概述的框架图:
基础交互理解侧重于基本感知任务,如社交感知(识别身份和情绪)、时间感知(回忆非显著细节)、指代感知(区分所指对象)和非音频提示跟随(解读手势或文本)。高级交互理解评估更高层次的能力,如上下文感知响应(根据特定环境提供可操作的建议)、主动响应(确定何时回答)和过程跟踪(协助长期任务)。
如下图所示:
为了解决大规模数据构建不切实际的复杂场景,作者捕捉了三个真实世界案例,旨在单个故事中评估多种能力。
关于这些真实世界案例示例的框架图:
这些案例包括会议模拟,测试在连续视频流中的长期记忆和说话人识别;盲人辅助,评估为视障用户描述环境和导航;手工艺过程跟踪,结合了多方社交互动和过程跟踪。
实验
实验在 OmniAssisBench 上评估了闭源和开源多模态模型,使用并发的视频和音频输入、带有主动弃权的统一助手提示,以及基于 GPT-5 的评分标准。结果表明,模型通常能理解口头指令,但在视觉感知、手势解读、长期上下文保留、响应时机和任务跟踪方面存在困难,其中开源和真实世界场景的差距最大。消融实验证实,移除任一模态通常会损害性能,尽管仅视觉输入通过减少音频干扰改善了主动响应,而评判模型一致性高,教师强制或较低视频分辨率仅带来有限增益。
数据集包含七个任务,涵盖单轮感知和多轮交互场景。交互轮次较多的任务通常涉及更长的视频和更多的问答对,单轮任务平均时长低于 80 秒,多轮任务平均超过 200 秒。单轮感知任务(社交、时间、指代)各有一轮,平均视频长度在 40 到 77 秒之间。多轮任务如主动响应(4 轮)和过程跟踪(5 轮)与显著更长的视频相关,平均分别为 209 秒和 249 秒。过程跟踪在所有任务中贡献了最多的问答对(246 对),反映了其复杂的多步骤性质。非音频提示跟随是一个两轮任务,仅有 30 个视频产生 76 个问答对,表明每个视频的交互密度更高。
在基础交互理解任务上,领先的闭源模型 Gemini-3-Pro 总体平均达到 66.4 分(满分 100 分),而最佳开源模型 Qwen3-Omni-Instruct 得分为 51.2,显示出明显的性能差距。当前的多模态大语言模型通常能解读口头提示,但难以提供完全准确和全面的回答。在闭源模型中,Gemini-2.5-Pro 在社交感知上取得了最高平均分(69.6),略高于 Gemini-3-Pro(66.2),尽管两个模型在 CE 子任务上得分较低(59.0 和 62.8)。非音频提示任务暴露出严重的不平衡:MiMo-V2-Omni 在 GPF 上仅得 27.2 分,而在 OPF 上达到 62.6 分,凸显了该类别内能力的不均衡。在整体基准测试中,顶级开源模型落后最佳闭源模型超过 15 分,表明交互理解中存在显著的可及性与性能权衡。
Gemini-3-Pro 记录了最强的总体平均分,并在大多数评估任务类别中领先,Gemini-2.5-Pro 是最接近的闭源竞争对手。性能因能力而异,MiMo-V2-Omni 在 CR 上最强,Doubao-Seed-2.0-lite 在过程跟踪上领先,但这些模型未能达到领先模型的整体水平。报告中的顶级开源模型得分低于比较中的所有闭源模型,表明闭源模型具有明显优势。Gemini-3-Pro 取得了最佳的总体平均分和大多数任务级指标的最佳结果,尽管并非在所有方面都领先。论文中报告的顶级开源模型得分低于比较中最低的闭源模型,显示出巨大的能力差距。
该基准测试包含七个任务,涵盖单轮感知和多轮交互场景,多轮设置中视频更长、问答对更多。对领先多模态模型的评估表明,像 Gemini-3-Pro 这样的闭源系统大幅优于开源替代方案,在所有任务类别中显示出明显的能力差距。尽管一些模型在特定能力上表现出优势,但整体交互理解仍然具有挑战性,且子任务间的性能往往不均衡。