HyperAIHyperAI

Command Palette

Search for a command to run...

13 小时前
LLM
推理

空货架还是丢钥匙?回忆是参数化事实性的瓶颈

Nitay Calderon Eyal Ben-David Zorik Gekhman Eran Ofek Gal Yona

摘要

目前对 LLM 的事实性评估将所有错误一视同仁,掩盖了失败是源于知识缺失(空货架)还是源于对已编码事实的访问受限(丢钥匙)。我们提出一种行为框架,以事实而非问题为单位刻画事实知识,并按每个事实是否被编码以及其可访问程度进行表征:无法被回忆、可被直接回忆,或只能借助推理时计算(思考)才能被回忆。为支持这种刻画,我们引入了 WikiProfile,一个通过自动化流程构建的新基准;该流程使用一个经过提示并以网络搜索为依据的 LLM。在来自 13 个 LLM 的 400 万条回答中,我们发现在我们的基准上,前沿模型的编码已接近饱和,GPT-5 和 Gemini-3 编码了 95–98% 的事实。然而,回忆仍然是一个主要瓶颈:许多此前被归因于知识缺失的错误,实际上源于对已编码事实的访问失败。这些失败具有系统性,并且不成比例地影响长尾事实和反向问题。最后,我们表明思考可以改善回忆,并挽回相当一部分失败,这说明未来的提升可能更少依赖规模扩展,而更多依赖改进模型利用其已编码知识的方式。

一句话总结

来自 Google Research 和以色列理工学院的研究人员提出了一个行为框架和 WikiProfile 基准,表明尽管 GPT-5 和 Gemini-3 编码了 95–98% 的事实,但召回失败是参数化事实性的主要瓶颈,而推理时思考可以恢复许多错误,尤其是对于长尾事实和反向问题。

核心贡献

  • 提出了一个行为框架,在单个事实层面刻画事实知识,区分事实是否被编码,以及是否可以直接回忆还是仅能通过推理时计算回忆。
  • 引入了 WikiProfile 基准,通过一个自动化流水线构建,使用基于网络搜索的提示 LLM 生成事实级别的探测问题,以衡量编码和回忆。
  • 在来自 13 个 LLM 的 400 万条回答中,编码接近饱和(GPT-5 和 Gemini-3 编码了 95–98% 的事实),而召回失败是系统性的,集中在长尾事实和反向问题上;推理时计算(思考)作为一种回忆机制,恢复了这些失败中的很大一部分。

引言

大型语言模型(LLM)编码了大量事实知识,但仍会产生错误,而标准的准确率指标无法区分错误是源于知识缺失(编码失败)还是无法检索模型已知的内容(召回失败)。作者通过提出知识画像这一行为框架来解决此问题,该框架将编码与回忆分离,并引入了 WIKIPROFILE,一个包含 2,150 个自然来源事实的基准,每个事实都配有编码、直接回忆和识别探测问题。评估了 13 个模型后,他们发现前沿 LLM 编码了超过 95% 的事实,但在没有推理时计算(思考)的情况下,最多有三分之一无法回忆,揭示了回忆是事实性的主要瓶颈,并表明思考可以恢复大量原本无法访问的知识。

数据集

作者引入了 WIKIPROFILE,一个用于评估大型语言模型(LLM)事实知识的基准。它包含从维基百科提取的 2,150 个事实,每个事实配有十个问题,用于探测编码、知识和事实验证。以下是数据集构建、组成和使用的详细说明:

  • 组成与问题类型

    • 2,150 个事实,每个配有十个问题。
    • 2 个编码问题:一个命题补全项和一个上下文问题(通过将直接问题附加到其左上下文形成)。
    • 4 个知识问题:直接和反向表述,每种表述有两种不同的措辞(一种高逐字匹配,一种自然改写)。
    • 4 个多项选择变体:用于事实验证,每个问题有三个合理的干扰项,按实体类型和主题相似性匹配。
    • 所有问题都有一个唯一、明确的标准答案,支持自动评估。
  • 数据来源与规模

    • 来源:10,000 个维基百科页面,根据访问量采样,并分为九个主题(论文中的图表展示了主题和实体类型分布)。
    • 实体选择:命名实体识别(NER)识别候选对象实体(人物、地点、日期等)。每篇文档最多选择三个候选对象,排除首句中的实体。
    • 严格的标准确保每个事实是非平凡的、不可猜测的、时间无关的,并且从其左上下文中能得出唯一答案。
    • 经过降采样以平衡类别和实体类型后,保留了 5,000 个候选;左上下文长度的中位数为 100 个词,平均为 116 个词。
  • 处理与过滤

    • 一个全自动流水线(在保留子集上进行了手动优化)处理提取和问题生成。
    • 问题生成分为三个步骤:生成、精炼和过滤。反向问题通过交换主语和宾语的角色得出。
    • 所有问题都经过基于 Google 搜索的 LLM 过滤器:如果查询返回多个答案或需要澄清,则整个事实被丢弃。
    • 经过人工验证,不到 2% 的事实被移除,最终得到 2,150 个事实。
  • 数据在模型中的使用方式

    • WIKIPROFILE 仅用作评估基准,不用于训练。
    • 它衡量 LLM 的编码(通过补全和上下文启动)和事实知识(通过直接和反向探测),以及事实验证能力(多项选择)。
    • 该流水线设计为可应用于其他语料库,以进行特定领域的知识画像。

方法

作者引入了一个知识画像框架,以系统地表征 LLM 的事实行为。他们将事实定义为一个涉及有序实体对(主语和宾语)的命题。为了判断错误是源于编码还是回忆,他们引入了两个完全由可观察行为定义的操作性概念。

编码通过编码即记忆的视角进行评估,即如果 LLM 能在类似预训练的上下文中正确复现事实,则视为已编码。这通过命题补全和上下文提问等任务来操作化,这些任务用原始源文本强烈启动模型。相比之下,知识被定义为在一系列语义等价的上下文中正确回答关于事实的问题的能力,测试对表面形式和关系方向的不变性。对于每个问题 qqq,作者生成多个回答,并使用 LLM 评分器计算问题得分,即所有可评分回答的准确率:

g(q)=cqcq+iqg(q) = \frac{c_q}{c_q + i_q}g(q)=cq+iqcq

其中 cqc_qcqiqi_qiq 分别表示正确和错误回答的数量。

如下图所示:

基于这些定义,事实从三个维度进行刻画:是否被编码、是否无需思考即可知晓、是否仅通过思考才能知晓。这种交互产生了五种不同的知识画像。编码失败是指事实既未编码也不知晓,表明容量或数据覆盖的局限性。回忆失败描述的是已编码但即使通过思考也无法访问的事实,指向训练后的问题。直接回忆表示已编码且容易访问的事实。通过思考回忆表示需要额外推理时计算才能检索的事实。最后,无编码推理涵盖那些尽管未被直接编码但通过推理可知的事实。

这些画像在不同模型中的分布如下图所示:

为了支持这种画像,作者引入了 WIKIPROFILE 基准,通过全自动流水线构建。流程从维基百科文档中提取事实开始。流水线执行命名实体识别,并根据严格标准选择候选对象实体,确保它们代表左上下文的非平凡、时间无关的补全。

问题生成模块通过生成、精炼和过滤创建直接和反向问题。直接问题最初是高逐字匹配的,以测试编码,然后改写以测试鲁棒性。反向问题通过交换主语和宾语的角色得出。所有问题都经过基于 Google 搜索的严格过滤,以确保答案唯一;如果某个事实的任何问题被拒绝,则整个事实被丢弃。流水线还通过将直接问题附加到左上下文来生成上下文问题,以及带有合理干扰项的多项选择变体。

基准创建流水线的完整架构如下图所示:

实验

评估引入了 WIKIPROFILE 基准,通过一组提取的维基百科事实和多样化的问题格式,评估知识编码和回忆。在多个大型语言模型的评估中,核心发现是事实错误主要源于回忆瓶颈,而非知识缺失;模型已编码信息,但往往无法访问,尤其是对于罕见事实或当查询方向与训练顺序相反时。分析表明,思考机制可以部分恢复这些无法访问的知识,缩小性能差距,并表明挑战已从获取转向检索。这些模式类似于人类记忆中的舌尖现象,表明人工与人类回忆系统之间存在功能上的平行。

前沿语言模型编码了几乎所有事实,编码失败降至低水平,而较小的模型仍会遗漏相当一部分。即使最大的模型也无法直接回忆许多已编码的事实,留下相当一部分需要思考或仍然无法访问。思考作为一种有效的恢复机制,将大多数原本丢失的事实转化为正确答案,尽管仍有少量丢失事实残留。规模扩大减少了编码失败:前沿模型编码了超过 85% 的事实,而较小模型则低于 80%。即使在规模下,直接回忆仍然有限:在前沿模型中,只有约三分之二的事实是直接知晓的,其余需要思考或仍然丢失。思考恢复了前沿模型中大多数已编码但非直接知晓的事实,将丢失类别削减到几个百分点。较小的模型更依赖验证:GPT-5 mini 仅在多项选择设置中就知道超过四分之一的事实,这种模式在前沿模型中几乎不存在。

实验评估了语言模型如何编码和检索事实知识,比较了直接回忆与推理增强生成。前沿模型编码了几乎所有事实,但直接回忆仍然有限,许多事实只能通过思考访问,思考恢复了其中大部分,并将丢失比例降至几个百分点。较小的模型表现出更多的编码失败,并依赖验证,有相当一部分事实仅在多项选择设置中知晓,这种模式在规模下几乎消失。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供