Command Palette
Search for a command to run...
CLBench-V:从上下文锚定到知识获取的多模态上下文学习评测
CLBench-V:从上下文锚定到知识获取的多模态上下文学习评测
Lai Wei Chengqi Li Jiapeng Li Ruina Hu Yue Wang Weiran Huang
摘要
现实世界中的任务往往要求模型从任务特定的上下文中学习,而非仅依赖预训练知识。尽管近期研究将这种能力强调为上下文学习,但现有评测主要聚焦于文本上下文。然而,在许多实际场景中,需要学习的上下文是多模态的:科学发现通过图表和表格传达,金融指标分散在转换后的报告中,空间决策则依赖于地图、场景或网页。我们提出了 CLBench-V,一个面向多模态上下文学习的基准,通过围绕三个维度组织任务——上下文锚定、新信息应用和新知识学习——来解决难以定位上下文使用在何处失效的问题。CLBench-V 将转换后的公开基准与新构建的数据集相结合,涵盖科学、金融、长文档理解、空间推理和基于网页的视觉问答等领域。为降低构建领域特定上下文学习任务的成本,我们进一步对新构建的数据集采用了自动化构建与过滤流程。在 3,443 个实例和六个近期多模态模型上,最佳总体得分仅为 0.2847,表明多模态上下文学习远未饱和。此外,InternVL3.5-30B-A3B 在上下文锚定和新知识学习上表现最佳,而 Qwen3.5-Plus 在新信息应用上表现最优。我们进一步分析了评判可靠性、上下文长度、图像数量以及代表性失败案例。
一句话总结
上海交通大学、中关村学院和上海创新研究院推出 CLBench-V,这是一个多模态上下文学习基准,围绕上下文 grounding、新信息应用和新知识学习组织任务,组合了覆盖科学、金融、长文档理解、空间推理和基于网页的视觉问答的转换公开数据集和自动构建数据集,在 3,443 个实例和六个最新多模态模型上,最佳总得分仅为 0.2847,凸显了多模态上下文学习中尚未解决的挑战。
核心贡献
- CLBench-V 引入了一个面向多模态上下文学习的诊断性基准,包含 3,443 个实例,覆盖科学、金融、长文档理解、空间推理和基于网页的视觉问答,融合了转换的公开数据集以及通过自动构建和过滤创建的新任务。
- 该基准定义了一个三层层次结构(上下文 grounding、新信息应用和新知识学习),用于隔离失败是由缺失证据、误用上下文特定信息还是无法获取和迁移上下文定义的知识造成的。
- 对六个最新多模态模型的评估得出的最佳总得分为 0.2847,表明多模态上下文学习远未饱和;各维度的细分结果显示 InternVL3.5-30B-A3B 在上下文 grounding 和新知识学习上领先,而 Qwen3.5-Plus 在新信息应用上表现最佳,并进一步分析了评判可靠性、输入复杂度和失败案例。
引言
大语言模型越来越多地利用推理时提供的上下文来解决问题,从中提取任务相关的事实、规则或模式,而不是仅仅依赖参数化知识。这种上下文学习能力对于模型在遇到未见文档和动态环境的实际部署至关重要,而相关证据通常以多模态格式出现,如文本、图形、表格、图表和布局。现有的上下文学习基准大多仅支持单一模态和文本,未能评估模型在多模态上下文中定位、应用和获取新知识的能力。先前的长上下文研究表明,即使具有大输入窗口的模型也可能无法内化上下文定义的规则、解决跨模态冲突或迁移新提供的信息,但这些研究通常缺乏诊断精度以查明上下文使用在何处失效。作者引入 CLBench-V,一个围绕三层层次结构组织的多模态上下文学习基准:L0 上下文 grounding,L1 新信息应用和 L2 新知识学习。这一设计能够分离在多模态证据定位、误用访问到的上下文或忽略上下文定义的知识而倾向于先前知识中的失败。该基准结合了转换的公开数据集与新构建的领域特定任务,例如医学论文结论推断和财务报告 ROE 分析,并在统一框架下对六个多模态模型的 3,443 个实例进行评估。
数据集
作者构建 CLBench-V 作为一个多模态评估基准,数据来源于两个互补的渠道,全部按统一模式组织,并按能力分类:上下文 grounding、新信息应用和新知识学习。
-
数据整合(公开基准)
- 源基准的选择涵盖了视觉事实验证、长文档理解、科学不一致推理、高分辨率搜索、多图像推理和上下文定义的规则遵循(例如,Pix2Fact、MMLongBench、PRISMM-Bench、ReasonMap、InSight-o3、MIRBench、ZeroBench、CourtSI-Bench、BrowseComp-V、CL-Bench)。
- 强制执行四项准入标准:
- 视觉依赖性:答案不能仅通过纯文本捷径得出。
- 低不相关上下文:任务专注于信息应用和知识学习,而非纯粹的针搜索。
- 多跳偏好:样本需要跨多个证据片段进行组合推理。
- 范围排除:排除视频和准视频任务,以保持聚焦于静态多模态上下文学习。
- 筛选时使用 Qwen3.5-Plus 作为自动检查器,拒绝可通过捷径解决的实例,随后通过人工审核的质量、多样性和与三个能力轴的匹配度。
- 保留的样本经过规范化处理:MCQ 项嵌入选项,如有可用则保留 Markdown 和图像渲染的文档变体,保留拓扑字段用于路线结构验证,并将外部搜索证据移入上下文。该流水线生成了集成的公开基准部分。
-
数据构建(新领域特定任务)
- 构建了两个任务以填补现有基准的空白,同时共享相同的模式和评估器接口。
- 财务报告 ROE 分析:最近的财务报告从 PDF 转换为 Markdown 风格的多模态表示。模型必须执行杜邦分解(通过净利润率、资产周转率、权益乘数计算 ROE),使用分布于多个页面和视觉结构中的数值。这主要评估新信息应用。
- 论文结论推断:将近期医学论文转换为多模态 Markdown。创建两个截断版本:参考构建版本,包含直至 Result 部分的内容(用于生成参考发现);评估版本,在 Result 部分之前停止。在测试时,模型仅接收评估版本,必须推断出论文结果可能支持的科学发现。经过筛选,保留了 581 个干净样本。评分通过 max(0, (命中数 - 额外数) / 参考计数) 公式惩罚过度预测。
-
数据使用方式
- 该基准仅用于评估。没有训练分割;所有任务为零样本或少样本评估设置。
- 任务输出采用确定性评估器对结构化答案进行评分,对开放式输出采用基于评判的语义评估。
- 统一模式支持在三个能力维度上进行直接比较,将上下文学习与捷径检索隔离开来。
方法
作者设计 CLBench-V 以评估多模态大语言模型从提供的多模态上下文中学习并将该知识应用于解决现实场景中任务的能力。该基准围绕统一的转换、推理和评分框架构建,支持跨级别的可比性和对失败模式的细粒度诊断。
参考框架图。
为使该能力可测量和可诊断,作者将多模态上下文学习组织为一个三层的能力层次结构。该层次结构隔离了失败是由于缺失证据、误用上下文特定信息还是未能获取上下文定义的知识。
- L0: 上下文 Grounding:在此级别,模型必须从新提供的多模态上下文中定位、读取和组合证据,而无需学习新的规则系统。该级别的任务测试证据访问和 grounding 的保真度,包括视觉搜索、计数、空间定位和跨图像绑定。
- L1: 新信息应用:在此级别,模型必须使用来自上下文的新事实、值或文档特定信息,同时依赖其现有的推理技能。这些任务测试模型是否能够正确绑定上下文特定的值并在现有推理过程中使用它们,避免过时的先验知识。
- L2: 新知识学习:这是最具挑战性的级别,要求模型从上下文中获取新规则、经验模式或科学结论并应用它们。模型必须综合上下文定义的知识并将其迁移到答案生成中。
该基准由两个互补的来源构建:集成的公开基准和新构建的领域特定任务。两个来源都映射到一个规范化的模式中。
对于数据集成,作者对公开基准应用了明确的策管标准,以确保它们评估上下文学习而非捷径检索。这些标准包括视觉依赖性、低不相关上下文、多跳偏好和范围排除。候选实例在转换时经过拒绝采样和人工审核,以保留满足标准的高质量样本。
对于数据构建,作者创建了领域特定任务以针对能力缺口。
- 财务报告 ROE 分析:模型进行杜邦式推理,从转换后的财务报告中计算 ROE。该任务需要识别和组合数值,如净收入、收入、总资产和股东权益。使用标准的三因素杜邦分解:
- 论文结论推断:模型从近期医学论文中推断论文特定的科学发现。PDF 被转换为 Markdown 风格的多模态表示。评估版本包含 Result 部分之前的内容,要求模型综合实验动机、方法和多模态证据来预测科学发现。论文级别的得分计算如下:
其中 Nref 是参考发现的数量,Nhit 是正确模型预测发现的数量,Nextra 是无支持额外发现的数量。该减法项惩罚过度预测。
所有数据集在统一框架下使用任务特定指标进行评估,结构化输出使用确定性评估器,开放式输出使用基于评判的语义评估。
实验
CLBench-V 在上下文学习的三个层次上评估多模态模型,范围从在提供的输入中 grounding 证据(L0)到应用新信息(L1)和学习新知识(L2)。整体模型性能仍然较低,最难的 L2 任务需要合成和迁移上下文定义的知识,没有单一的模型在所有层级上占主导。该基准揭示了不同的能力轮廓和失败模式,如证据错误绑定和先验覆盖,而简单的输入长度和图像数量度量并不能强有力地预测性能。
CLBench-V 基准按能力级别组织多模态上下文学习任务,L0 级别包含跨越六个数据集的 1,074 个实例,通过地铁地图推理、视觉搜索和体育空间智能测试上下文 grounding。每个任务使用确定性评估器处理结构化输出,而开放式输出依赖基于评判的语义评估,其中评判模型的选择可测量地影响报告的分数。L0 级别汇集了来自六个数据集的 1,074 个样本,涵盖地铁地图路线规划、高分辨率视觉搜索、困难视觉问答和体育空间智能。开放式任务的基于评判的语义评估引入了不可忽视的分数变化,因此透明地报告评判模型对于可靠比较至关重要。
最佳模型 InternVL3.5-30B-A3B 达到的整体得分仅为 0.2847,表明多模态上下文学习仍具挑战性,基准远未饱和。能力轮廓差异显著:InternVL3.5-30B-A3B 取得了 L0 grounding 和 L2 知识的最高分,但在 L1 信息上是最弱的,而 Qwen3.5-Plus 和 Qwen3.6-27B 在 L1 上领先,但在 L2 上落后。这些对比鲜明的优势,加上对额外图像的模型依赖性敏感性,揭示了当前系统以互补的方式失败。InternVL3.5-30B-A3B 整体领先,并在 L0 grounding 和 L2 知识上领先,但其 L1 信息得分(0.1313)低于其他所有模型,表明其难以应用小的、文档特定的事实。Qwen3.5-Plus 和 Qwen3.6-27B 分享了最强的 L1 信息得分(分别为 0.2954 和 0.2878),但它们的 L2 知识得分显著较低,显示出使用新提供的知识和获取上下文定义的知识之间的权衡。Kimi-K2.6 整体排名第二,L2 知识排名第二,而 GPT-5.4 在 L0 grounding 上排名第二,但在 L2 上排名最低,表明没有单一的模型家族在所有上下文学习水平上表现卓越。额外的图像改善了 InternVL3.5-30B-A3B 的排名(尤其是在排除了极长的财务报告之后),而 Qwen3.6-27B 的排名并未受益,这表明额外视图对一个模型来说是更丰富的证据,而对另一个模型则是视觉干扰。所有模型的整体性能仍然很低;仅输入长度不能解释失败,主要障碍源于可用的上下文限制和模型对视觉证据的特定处理。
多模态上下文学习对当前模型来说仍然困难,没有单一的系统在所有能力水平上都表现卓越。InternVL3.5-30B-A3B 在文档级知识任务(如论文结论推断)上领先,但由于上下文限制在长财务报告上失败,而 Qwen3.6-27B 和 Qwen3.5-Plus 分别在 grounding 和信息提取方面更强。InternVL3.5-30B-A3B 在论文数据集上得分最高,但在财务报告 ROE 上得分为零,超出了其最大上下文长度。Qwen3.6-27B 以大幅优势获得最强的 L0 Grounding 结果。Kimi-K2.6 在 L0-L1 边界任务上显著优于其他模型。Qwen3.5-Plus 达到最佳的 L1-L2 边界得分,反映了在应用所提供信息方面的优越能力。Doubao-Seed-2.0-Lite 和 GPT-5.4 在 L2 知识总分上并列最高。InternVL3.5-30B-A3B 获得最佳的 L0-L1 边界得分 0.0680,远低于 Kimi-K2.6 的 0.6800,显示其在跨级别 grounding 上的困难。
不同的 LLM 评判在相同的多模态任务上产生显著不同的分数,五个评判模型的平均分数变化超过 0.05。最小的评判模型 Qwen3-VL-4B-Instruct 给出了最高的平均分数,而最大的评判模型 Qwen3-VL-32B-Instruct 给出了最低的分数。这强调了透明报告评判和校准的必要性。评判选择会导致不可忽视的分数变化;平均分数范围从 0.1564 到 0.2122。Qwen3-VL-4B-Instruct(最小的模型)给出了最高的平均值,而 Qwen3-VL-32B-Instruct 给出了最低的平均值。
CLBench-V 评估使用六个 L0 数据集测试多模态上下文学习,采用确定性和基于评判的语义评分,评判模型的选择可测量地改变报告的分数。所有模型的整体性能较低(最佳总分 0.2847),能力轮廓截然不同:InternVL3.5‑30B‑A3B 在 grounding 和知识上领先,但在信息提取上几乎失败,而 Qwen 变体取得了最高的信息分数但在知识上落后,额外的图像对一个模型是帮助性证据,对另一个模型是视觉干扰。单独的评判实验表明,较小的评判模型给出的平均分数显著高于较大的模型,强调了透明报告评判和校准的必要性。