HyperAIHyperAI

Command Palette

Search for a command to run...

MMOOC:面向多模态大语言模型上下文外评估的综合基准

Wenjie Zhu Yabin Zhang Wenjun Zeng Lei Zhang

摘要

多模态大语言模型(MLLM)在众多视觉语言任务上取得了强劲的性能,但在不完美或发生偏移的上下文下却经常失败。一个可靠的 MLLM 应当拒绝那些发生主体级上下文偏移的真正上下文外(OOC)问题,同时仍能回答那些发生非主体上下文偏移的偏移上下文内(Shifted IC)问题。现有基准主要针对 OOC 或视觉上无法回答的问题,却忽略了可回答的 Shifted IC 情形,且覆盖的 OOC 偏移类型有限。为填补这一空白,我们提出了 MMOOC,一个用于评估 MLLM 拒绝与鲁棒回答能力的大规模基准。MMOOC 包含超过 4.1 万个图像-问题对,涵盖可回答的 Shifted IC 情形和不可回答的 OOC 情形,横跨三种问题格式、八种偏移类型和六种视觉场景,并通过基于 MLLM 的筛选与人工验证确保数据质量。我们使用准确率和拒绝率评估模型回答,并进一步引入 LLM-as-a-Judge 指标来评判模型推理的正确性。在多种 MLLM 上的实验表明,当前模型在偏移上下文下仍难以平衡可回答性与拒绝能力。我们进一步分析了关键失败模式,并表明后训练可以提升鲁棒性。MMOOC 将公开发布。

一句话总结

来自香港理工大学、宁波东方理工大学和哈尔滨工业大学(深圳)的研究人员提出了MMOOC,一个包含超过41K图像-问题对的多模态基准,涵盖可回答的上下文偏移(shifted-in-context)和不可回答的越上下文(out-of-context)场景,覆盖八种偏移类型和六种视觉场景。他们使用LLM-as-a-Judge方法,证明当前多模态大语言模型难以在可回答性和拒绝回答之间取得平衡,而训练后优化能够提升模型的鲁棒性。

核心贡献

  • 论文识别了多模态大语言模型中的一个可靠性缺口:一个鲁棒的模型必须在面对真正越上下文的问题时拒绝回答,同时仍然回答那些尽管存在干扰性上下文偏移但仍可回答的上下文偏移查询,并指出现有基准测试忽视了这一双重需求。
  • 提出了MMOOC,一个包含超过41K图像-问题对、涵盖三种问题格式、八种偏移类型和六种视觉场景的基准,其中明确区分了上下文偏移和越上下文类别,以便对拒绝回答和鲁棒回答进行联合评估。
  • 对18个开源和闭源多模态大语言模型进行的系统实验表明,当前模型难以在保持回答和适当拒绝之间取得平衡,进一步分析揭示,训练后对齐和提示工程可以提升鲁棒性,而仅凭更强的通用能力并不能保证更好的越上下文表现。

引言

近年来,多模态大语言模型(MLLM)在视觉-语言任务上取得了进展,但现实中的视觉输入未必总能完全支持用户查询。这可能导致产生幻觉的回应或过度拒绝,两者都会损害可靠性。一个鲁棒的MLLM必须在面对真正越上下文(OOC)的问题时拒绝回答,同时当查询在干扰性线索存在的情况下仍然有效时保持可回答性。现有的基准测试仅评估该问题的有限方面,通常只关注不可回答的场景,而忽视了拒绝回答并不合适的上下文偏移场景。作者引入了MMOOC,一个全面的基准,涵盖三种问题格式、六种视觉场景和41K图像-问题对,明确区分了五类不可回答的OOC类别与三类上下文偏移类别。这种设计使拒绝回答和鲁棒回答的联合评估成为可能,揭示出当前MLLM难以在这两者之间取得平衡。

数据集

作者提出了MMOOC,一个旨在评估多模态大语言模型(MLLM)如何处理上下文可靠性失败的基准。该数据集系统性地将模型暴露于视觉上下文不足、具有误导性或部分不支持的图像-问题对中,要求模型要么拒绝回答,要么给出经过严格约束的答案。

数据集组成与来源

  • MMOOC通过两条互补的流水线构建:
    • 新采集的图像:多个MLLM(Qwen3.5-122B-A10B、GPT-4o、o1)通过上下文学习范式生成有根据的图片描述、上下文偏移(IC)和越上下文(OOC)问题,以及相应的解释。这增加了语言风格和推理的多样性。
    • 重用的基准样本:额外的OOC样本通过自动打乱(Auto Shuffle)技术从现有的VQA数据集(MME、MMStar、OK-VQA)中衍生而来。该方法保留了人工生成的视觉内容,同时引入了不匹配或不足的上下文设置,以贴合真实的用户查询。
  • 还包括人工设计的问题,以覆盖自然且具有挑战性的OOC场景。

层级类别结构 每个样本首先被分类为上下文偏移(图像-问题证据仍支持回答)或越上下文(证据不足,无法可靠回答)。然后,每个样本根据其主要失败来源被分配到一个单一的类别。数据集包含八个类别:

  • 越上下文(5个类别)
    1. 多模态歧义(MA):不清晰的视觉证据或模糊的文本。
    2. 视觉错误前提(VFP):不正确或不受支持的视觉前提。
    3. 不确定的空间与物理上下文(USPC):缺失空间/物理/视点信息。
    4. 不清晰的逻辑与符号(ULS):逻辑/推理查询的证据不足。
    5. 缺失知识与背景(MKB):图像或世界知识中无法获取的实例特定知识。
  • 上下文偏移(3个类别)
    1. 误导性前提(MP):错误/不确定的前提,但核心视觉查询仍可回答。
    2. 部分可回答性(PA):多个子查询,只有部分得到支持;模型应回答支持的部分。
    3. 图像-问题不匹配(IQM):全局场景不匹配,但目标视觉事实仍然可以恢复。

筛选与质量控制

  • 自动化一致性筛选:GPT-4o、o1和o3独立判断每个图像-问题对是否可以根据视觉证据(以及稳定的世界知识)来回答。只有当三个模型对可回答性判断达成一致时,样本才被保留,从而移除不稳定或错误的样本。
  • 人工验证:标注人员检查可回答性、参考答案的正确性、解释的一致性、类别分配以及自然度。小错误被修正,无效样本被丢弃,分歧由另一位标注者解决。
  • 质量指标:该数据集显示出较低的Self-BLEU(2.00)和相似度得分(0.09),同时平均回答长度较长(26.69),表明答案多样且不重复。最终的集合在视觉场景上保持平衡。

数据使用方式 MMOOC被用作一个零样本评估基准。MLLM被提示处理每个图像-问题对,必须在上下文不足时拒绝回答,或在证据充分时提供精确答案。该基准不包含训练集,仅用于衡量模型识别上下文可靠性边界的能力。

方法

作者通过一个结构化的流程构建了MMOOC基准,该流程始于一个层级分类法设计,用于组织上下文可靠性失败。样本首先被分类为上下文偏移或越上下文。越上下文实例被定义为视觉证据和一般世界知识不足以提供可靠答案的图像-问题对。作者定义了五个越上下文类别:多模态歧义、视觉错误前提、不确定的空间与物理上下文、不清晰的逻辑与符号,以及缺失知识与背景。上下文偏移情况涉及误导性或部分不受支持的上下文,但核心查询仍可回答,其类别分为误导性前提、部分可回答性和图像-问题不匹配。

为了多样化视觉内容和问题表述,作者采用了两条互补的数据生成流水线。他们采用上下文学习范式,使用多个大语言模型为新采集的图像生成有根据的图片描述、问题和解释。此外,他们还加入了人工设计的问题,并通过自动打乱技术从现有基准中衍生出越上下文样本,以引入不匹配或不足的上下文设置,同时保留人工创作的内容。

为确保数据的高质量,作者实施了一套严格的筛选与验证流程。他们首先使用多个独立模型评估每个生成的图像-问题对是否可以可靠回答。只有当所有模型就可回答性判断达成一致时,样本才被保留。保留的样本随后经过人工审核,标注人员验证可回答性判断、参考答案、解释、类别一致性和问题清晰度。

在评估方面,作者采用多裁判协议,使用独立模型评估回答的合理性,以最小化评估者偏差。对于上下文内样本,他们计算准确率和回答合理性。准确率的定义为:

Acc=1NICi=1NICI(y^i=yi)\mathrm{Acc} = \frac{1}{N_{\mathrm{IC}}} \sum_{i=1}^{N_{\mathrm{IC}}} \mathbb{I}(\hat{y}_i = y_i)Acc=NIC1i=1NICI(y^i=yi)

其中 NICN_{\mathrm{IC}}NIC 是上下文内样本的数量,y^i\hat{y}_iy^i 是预测值,yiy_iyi 是真实答案,I()\mathbb{I}(\cdot)I() 是指示函数。回答合理性分配一个分数 siic{0,0.25,0.50,0.75,1.00}s_i^{\mathrm{ic}} \in \{0, 0.25, 0.50, 0.75, 1.00\}siic{0,0.25,0.50,0.75,1.00},最终得分为:

Accrat=1NICi=1NICsiic\mathrm{Acc}_{\mathrm{rat}} = \frac{1}{N_{\mathrm{IC}}} \sum_{i=1}^{N_{\mathrm{IC}}} s_i^{\mathrm{ic}}Accrat=NIC1i=1NICsiic

上下文内的总体得分是这两个指标的平均值:

SIC=12(Acc+Accrat)S_{\mathrm{IC}} = \frac{1}{2} \left( \mathrm{Acc} + \mathrm{Acc}_{\mathrm{rat}} \right)SIC=21(Acc+Accrat)

对于越上下文样本,作者使用拒绝率和拒绝合理性。拒绝率衡量正确的弃权行为:

Rref=1NOOCi=1NOOCI(ri=1)\mathrm{R}_{\mathrm{ref}} = \frac{1}{N_{\mathrm{OOC}}} \sum_{i=1}^{N_{\mathrm{OOC}}} \mathbb{I}(r_i = 1)Rref=NOOC1i=1NOOCI(ri=1)

其中 NOOCN_{\mathrm{OOC}}NOOC 是越上下文样本的数量,ri=1r_i = 1ri=1 表示正确的拒绝。拒绝合理性评估拒绝推理的质量,分配一个分数 siooc{0,0.25,0.5,0.75,1.0}s_i^{\mathrm{ooc}} \in \{0, 0.25, 0.5, 0.75, 1.0\}siooc{0,0.25,0.5,0.75,1.0}

Rrat=1NOOCi=1NOOCsiooc\mathrm{R}_{\mathrm{rat}} = \frac{1}{N_{\mathrm{OOC}}} \sum_{i=1}^{N_{\mathrm{OOC}}} s_i^{\mathrm{ooc}}Rrat=NOOC1i=1NOOCsiooc

越上下文的总体得分通过平均这些指标计算得出:

SOOC=12(Rref+Rrat)S_{\mathrm{OOC}} = \frac{1}{2} \left( \mathrm{R}_{\mathrm{ref}} + \mathrm{R}_{\mathrm{rat}} \right)SOOC=21(Rref+Rrat)

作者进一步通过人工评估验证了这些结果,与自动化裁判达到了很高的一致率。

实验

对18个多模态大语言模型在越上下文视觉问答上的评估使用多裁判协议来评估拒绝的准确性和合理性,其与人工判断的高度一致性证实了这些指标的可靠性。模型在处理不受支持的查询时表现挣扎,且性能对问题格式和越上下文类别高度敏感,规模增大并未带来持续的改进。训练后对齐改善了拒绝行为,但可能降低通用多模态评分,而思维链提示比明确的拒绝指令提供了更好的权衡。像o1这样的闭源模型整体领先,但仍易受误导性提示的影响,并且在上下文偏移场景中并没有一致地占据主导地位。

MMOOC是最大且最全面的越上下文评估基准,提供了41K个问答对,其突出之处在于同时覆盖了真正不可回答的情况和核心问题仍可回答的上下文偏移场景。相比现有基准,它提供了更广泛的问题格式多样性、更多的偏移类型和更广泛的视觉场景,并且是唯一一个评估干扰鲁棒性的基准。MMOOC是本次比较中唯一一个评估干扰鲁棒性的基准,这一能力在所有先前的基准中均不存在。它涵盖了八种偏移类型和三种问题格式(是/否、多项选择、开放式VQA),而早期的基准仅限于最多四种偏移类型和一到两种格式。

MMOOC产生的回答平均长度最长,且实现了最低的Self-BLEU和语义相似度得分,表明其词汇和语义重复少于其他数据集。HaloQuest表现出最多的重复输出,其Self-BLEU和相似度最高,回答长度最短。其余的基准介于这两者之间,UPD显示出低重复但回答简短,而MoHoBench长度适中但重复率高。MMOOC在所有对比数据集中的平均回答长度最长,Self-BLEU和相似度得分最低。HaloQuest记录了最高的Self-BLEU和相似度,同时平均回答长度最短,使其成为重复度最高的基准。UPD保持了较低的词汇和语义重复,但其回答和HaloQuest一样短。MoHoBench实现了适中的回答长度,但表现出比MMOOC高得多的词汇重叠和语义相似度。

开源模型在越上下文任务上的表现普遍偏低,且随问题格式和类别的变化非常剧烈。YesNo格式持续表现最差,而VQA得分更高,像USPC和ULS这样的类别最具挑战性。模型大小并未可靠地提升OOC处理能力,即便是最强的闭源模型也表现不一致。YesNo始终产生最低的OOC分数,而VQA在所有类别中得分最高。USPC和ULS是最困难的OOC类别,许多模型在YesNo上的得分低于30。更大的模型并不总是优于较小的模型;Qwen3.5-122B-A10B在几个类别上的表现不如Qwen3-VL-30B。像o1这样的闭源模型取得了更强的整体OOC表现,但在特定类别上仍显示出明显的弱点。Gemma-4系列取得了最强的开源OOC表现,而一些更大的模型在几个OOC类别上仍然较弱。

上下文偏移任务的整体准确率高于越上下文设置,但性能仍然脆弱,其中VQA中的部分可回答性成为最具挑战性的子类别。最大的开源模型并未持续优于较小的变体,且闭源模型在这些上下文偏移评估中并未一致地占据主导地位。VQA中的部分可回答性在上下文偏移类别中得分最低,表明上下文偏移仍然会干扰可靠的回答。最大的开源模型Qwen3.5-122B-A10B在YesNo IC任务上仅获得80.25分,明显低于Qwen3-VL-8B(90.00),表明规模增大并未持续提升上下文偏移的鲁棒性。闭源模型在上下文偏移任务上并未一致地超越开源模型,并且在VQA中的部分可回答性上表现出类似的弱点。

训练后方法,尤其是监督微调(SFT),提高了Qwen3-VL变体的越上下文拒绝率和合理回答率,但降低了在MMStar上的通用多模态准确率。直接偏好优化(DPO)带来的拒绝率提升较小,且准确率的权衡也较温和。SFT还持续提高了上下文内准确率,而DPO对上下文内表现的影响则好坏参半。SFT大幅提高了Qwen3-VL-2B和-8B在OOC任务上的Rref和Rrat,表明更强的拒绝行为和更合理的回答。SFT和DPO都导致MMStar准确率下降,其中2B模型在SFT下的下降幅度最大(从64.2降至59.0),突显了安全对齐与多模态能力之间的权衡。

MMOOC作为最大且最全面的越上下文基准被提出,涵盖八种偏移类型和三种问题格式,同时独特地评估了干扰鲁棒性,其回答比先前数据集的回答更长且重复度更低。越上下文表现普遍偏低,YesNo问题以及像USPC和ULS这样的类别被证明是最困难的,且模型大小并未可靠地提升处理能力。上下文偏移任务取得了更高的准确率,但仍然脆弱,尤其是在VQA中的部分可回答性上,并且更大的模型并未持续优于较小的模型。像监督微调这样的训练后方法提升了越上下文任务上的拒绝率,但降低了通用多模态准确率,突显了安全对齐与能力之间的权衡。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供