Command Palette
Search for a command to run...
面向开放式生成评估的双层元评分量规:事实完整性基准 GAMUT
面向开放式生成评估的双层元评分量规:事实完整性基准 GAMUT
Xilun Chen Zhaleh Feizollahi Ross Goodwin Seungwhan Moon Scott Yih Pinar Donmez Babak Damavandi Luna Dong
摘要
对长文本生成的事实性评估长期侧重于精确度,即衡量模型所生成主张的正确性。主流的“分解-搜索-验证”流程能有效捕捉错误主张,但几乎无法判断回答是否包含了所有应包含的信息。衡量事实完整性——事实性缺失的另一半——更为困难:这需要枚举一个完整回答应包含的全部事实,而这些事实很少构成一个扁平列表。它们通常涉及以覆盖率为核心的开放式集合、有序过程以及事实间的关系,这些是独立布尔检查列表所无法捕捉的。我们提出了一个用于评估开放式生成的双层元评分量规框架,并将其实例化为 Gamut(多模态事实性有据评估),一个面向长文本生成事实完整性的基准。该框架基于双层量规表示:一个结构化的元量规捕捉所需内容的组织结构和重要性,然后被机械地编译为一个扁平的、二值的、可由机器评分的检查清单,由 LLM 评判器可靠地评分。我们基于真实可穿戴图像,构建了覆盖 10 个不同领域的 1,813 个问题,每个问题都配有经专家人工标注员验证的、有证据支撑的量规。由于该框架与模态无关,我们还发布了一个纯文本变体。对 14 个前沿和开源模型进行评估后,我们发现该基准确实具有挑战性(最高分来自 Gemini 3.1 Pro,为 58.7%),区分度很高,且对评判器的选择具有鲁棒性。
一句话总结
Meta AI 推出 GAMUT,一个用于长篇生成中事实完整性的基准测试。该基准采用两级元评分标准框架——一个捕捉内容组织和重要性的结构化元评分标准,通过机械方式编译为可机器评分的二进制检查表——来评估开放式回答,对于 14 个前沿模型(最高分 58.7%,由 Gemini 3.1 Pro 获得)在 1,813 个多模态和纯文本问题上表现出挑战性。
核心贡献
- 本文提出了一个两级元评分标准框架,将完整答案的结构化表示(开放式集合、有序过程、关系、重要性层级)与机械编译的扁平二进制检查表分离,从而解决了表达性与可靠自动化评分之间的权衡。
- 该框架被实例化为 Gamut,一个包含 1,813 个多模态问题的事实完整性基准测试,这些问题基于真实的可穿戴设备图像,横跨 10 个领域,每个问题都配有由专家标注者验证过的证据支持的评分标准;评估表明最佳模型 Gemini 3.1 Pro 仅达到 58.7%。
- 该工作发布了一个与模态无关的纯文本变体,实证分析表明,该基准测试能够区分模型,在不同 LLM 评分者下保持稳定的排名,并且性能差异主要反映了知识的完整性,而非仅仅感知能力。
引言
长篇生成评估主要侧重于精确性,通过分解-搜索-验证流水线逐一检查每个声明,而事实召回和完整性则受到的关注较少。这两种方法都有一个更深层的局限:它们将事实性简化为一份独立的布尔事实检查的扁平列表,无法表示开放式可接受答案集合、有序过程或重要性加权分组。作者们提出了 Gamut,一个基准测试和两级评分标准框架,解决了这一矛盾。结构化的元评分标准捕获所需内容的组织、顺序和重要性,然后通过机械方式编译为扁平的二进制检查表,使评分保持可靠且低方差。Gamut 在基于真实可穿戴设备图像的日常深度研究问题上实现了这一设计,表明事实完整性对于当前模型来说仍是一个重大未解决的挑战。
数据集
作者构建了 Gamut,一个用于评估基于可穿戴设备图像的日常深度研究问题的基准测试。该数据集用作评估集,而非训练集,并围绕一个细粒度的评分协议,衡量答案的完整性。
-
数据集构成和来源
- 1,813 个问题,每个问题配有一张来自 CRAG-MM 基准测试的以自我为中心的图像。
- 图像是使用智能眼镜拍摄的真实照片,其中感兴趣的对象通常很小、旋转、被遮挡或光线不足。
- 实体横跨 10 个日常领域:植物、食品、动物、车辆、本地场所、日常物品、消费产品等。
- 每个问题都附带一份人工验证的二进制评分标准(平均 15.2 个检查项)和一个捕获列表、过程和关系的结构化元评分标准。
-
问题创建流程
- 一个前沿多模态 LLM 提出候选的开放式问题,这些问题需要多步骤研究,仅通过通用术语指代图像实体,并通过“陌生人测试”(不能预设实体身份)。
- 专家标注者经过多轮审查、修订或丢弃候选问题。第二个 LLM 通道剔除诱导性问题,选择最具研究密集性和多样性的候选问题,并在需要时播种新的多样化建议。
- 此流程为每个图像产生一个被接受的问题,在最终评分标准清理前有 1,843 个问题。
-
评分标准创建和精炼
- LLM 从网络来源的证据中起草结构化元评分标准,并将其编译为二进制评分标准。
- 自我精炼阶段重新验证所有片段,检索缺失的证据,然后重建评分标准。
- 一个小型内部团队在人工两轮中,直接修订二进制评分标准,将元评分标准作为支架。
- 上游错误(错误实体、模糊问题)在 12 个案例中手动更正,当无法产生合理评分标准时,丢弃 30 个问题,最终留下 1,813 个示例。
-
评分标准统计和结构
- 评分标准平均有 15.2 个二进制检查项:约 5.9 个答案关键(Answer-Critical)检查,约 5.8 个有价值(Valuable)检查,约 3.5 个上下文(Context)检查。
- 98% 的问题包含至少一个超出孤立事实的结构化组件——灵活列表(86%)、严格列表(49%)、有序过程(17%)和显式关系(6%)。
- 灵活列表产生阈值检查;过程产生对顺序进行评分的序列检查。
- 元评分标准使基准测试能够表达扁平检查表无法表达的开放式覆盖需求和部分积分逻辑。
-
数据使用方式
- 该基准测试用于评估模型生成的答案。每个答案与二进制评分标准对比评分,产生一个以细粒度衡量完整性的 Gamut 得分。
- 未报告训练划分;该数据集仅作为基于真实世界图像的深度研究能力的评估基准。
方法
作者提出了一个两级评估框架,将良好答案的表达性描述与评分者可以应用的可靠、低方差检查分离。上层是结构化的元评分标准,捕获覆盖范围、顺序和重要性;下层是通过确定性规则从其中推导出的扁平二进制评分标准。这种设计在描述答案的地方保留了丰富的结构,而在评分处保留了机械且可审计的检查。
元评分标准结构。 元评分标准将答案质量建模为一组项目,每个项目属于三个重要性层级之一:答案关键(Answer-Critical)(必须出现)、有价值(Valuable)(显著改善答案)或上下文(Context)(有帮助的背景信息)。项目带有定义其内部结构的类型:
- 简单知识:单个离散事实。
- 严格列表:一个有限集合,其中每个元素都是必需的。
- 灵活列表:一个有效选项池,对其要求足够的覆盖,而非特定选择;基线阈值指定必须提及的最少项目数。
- 过程:一个有序步骤序列,其中顺序重要,包含必需和可选步骤。
- 关系:实体之间的连接或对比。
除了单个项目,列表或过程可能包含一个元洞察——跨项目的综合,比如总体趋势,单一事实无法捕捉。每个项目都可以基于引用的网络片段,使评分标准基于证据而非依赖于参数记忆。
转换为二进制评分标准。 为了避免复杂的评分标准重新引入整体性判断,元评分标准通过固定的机械规则编译为一份扁平的是非题检查表。简单知识和严格列表项成为直接检查。灵活列表产生两种检查:基线覆盖检查(例如,“至少提及 N 个以下内容:……”)和额外积分,对于小型池,作为按项目检查,对于大型池,作为更高层级的覆盖阈值。过程生成每个步骤的存在检查,加上对必需步骤的顺序进行评分的序列检查,以及可选的完整顺序。关系和元洞察各成为一个或几个检查。在所有类型中,构成真正要求的检查继承其父项目的重要性,而次要检查(可选项目、更高覆盖阈值、可选步骤和完整顺序)降一级。结果是一个二进制评分标准,其检查仍然可以单独评分,但也可以询问是否覆盖了足够多的开放集合,以及事实是否以正确的顺序出现。
评分。 给定一个回答及其二进制评分标准,评分分三步进行。首先,LLM 评分者独立评估每个检查,返回四种裁决之一:满足(meets)、部分满足(partially meets)、缺失(missing)或矛盾(contradicts)。区分缺失和矛盾对于事实可靠性至关重要;矛盾会受到更严厉的惩罚。每个层级的得分计算为
s=M+P+S+∣μ∣CM+λP+μC,其中 M、P、S 和 C 分别是满足、部分满足、缺失和矛盾裁决的数量,λ=0.5,μ=−2。因为 μ 同时出现在分子和分母中,矛盾既扣除了积分,又放大了惩罚,因此一个谨慎但不完整的答案比一个自信但错误的答案排名更高。最后,总体 Gamut 得分是三个层级得分的加权平均,使用全局权重 wAC=0.6、wV=0.3 和 wC=0.1。这些权重跨问题固定,防止一个包含许多次要上下文检查的问题淹没其少数答案关键检查。当某个层级没有检查时,其权重重新分配给其余层级。
数据集构建流程。 该框架应用于构建 Gamut 基准测试,通过一个结合 LLM 生成和人工验证的两阶段过程。首先,从以自我为中心的图像中创建问题:一个前沿多模态 LLM 提出开放式问题,这些问题需要多步骤研究,并仅通过代词或通用术语指代主题(例如,“这辆车”)。专家标注者经过多轮审查、修订或丢弃候选问题,并且自动过滤步骤进一步剔除诱导性问题并多样化集合。对于每个被接受的问题,通过提示 LLM 收集网络证据作为引用片段,将内容组织成五种项目类型,并通过确定性规则编译二进制评分标准,生成结构化的元评分标准。评分标准经过 LLM 自我精炼阶段,审计片段立足点并重新研究缺失证据,之后人工标注者直接修订二进制评分标准,使用元评分标准作为支架发现结构错误。该循环重复进行,直到每个问题都有一个人工验证的评分标准,从而产生一个评估逻辑完全可审计且基于结构化表示的数据集。
实验
评估使用 Gamut 基准测试,用 LLM 评分者(Gemini 3.1 Pro)对模型评分,并通过两个再现相同排名的额外评分者验证鲁棒性。主要结果表明,Gamut 具有挑战性和高度区分性,能够根据已知质量因素正确排序模型,遗漏而非矛盾是主要的失败模式,且答案的完整性在很大程度上将较强模型与较弱模型分开。纯文本变体表明,移除图像会使所有模型的得分均匀增加,表明视觉识别是一个近乎恒定的难度税,而非关键区分因素,多模态排名保持稳定。
最佳模型达到 58.7% 的 Gamut 得分,仅满足略多于一半的评分标准要素,显示该基准测试远未饱和。排名与已知模型特性一致——更大、更新、专有模型优于较小、较旧、开放权重的模型——主要的失败模式是遗漏,即使对于顶级模型,缺失要素也持续存在。最强模型仅满足 55% 的评分标准要素,留下巨大的改进空间。缺失裁决是最大的错误类别,在顶级模型中占要素的四分之一以上,在较弱模型中急剧上升,因此完整性驱动了得分差异。
三个不同的 LLM 评分者对所有 14 个模型在相同的问题集上进行了评分。Gemini 3.1 Pro 和 Claude Opus 4.8 产生了一致的排名,得分彼此相差不超过 1.8 分,且没有自我偏好,而较小的 Qwen3-VL 235B 评分者始终更宽松,但保持了相同的大致顺序,仅在一些相邻位置上有微小交换。这证实了 Gamut 得分排名对评分者选择的鲁棒性。Gemini 3.1 Pro 和 Claude Opus 4.8 产生相同的模型排名,得分最多相差 1.8 分。Qwen3-VL 235B,一个较弱的开放权重评分者,始终更宽松 4 到 11 分,但保持了相同的大致顺序,仅在紧密排列的模型间有相邻交换。
从问题中移除图像会使所有模型的得分均匀增加,大多数模型增加 10 到 20 分。模型的相对排名大致保持不变,表明视觉识别作为一个一致的难度税,而非模型质量的区分因素。纯文本差距反映了与感知无关的真实答案不完整性。每个模型在纯文本变体上得分更高,增加幅度大多在 10–20 分范围内。当图像被移除时,模型排名基本保持,表明多模态排序捕捉了潜在的答案质量。改进几乎与原始多模态得分无关,使视觉识别成为跨模型的一个大致恒定的挑战。即使是最强的模型,其增加幅度也与大多数其他模型一样多,因此其在纯文本设置中剩余的差距源于不完整的推理,而非视觉错误。
在一个基于评分标准评估的多模态化学基准测试中,最佳模型仅达到 58.7% 的 Gamut 得分,遗漏所需元素是主要的失败模式,且仍有巨大的改进空间。排名对 LLM 评分者的选择具有鲁棒性,移除图像表明视觉识别作为一个恒定的难度税,而剩余的差距源于不完整的推理,而非感知。