空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。
当大语言模型把事实弄错时,究竟是因为它们从未学过这些事实,还是因为它们无法回忆起已经编码的内容?我们的知识画像框架揭示了后者:前沿大语言模型几乎编码了所有事实,却难以回忆起其中许多事实。
快速链接
-
- 复制链接 ×
事实性对于让大语言模型(LLM)变得可靠至关重要。当一个模型对事实性问题给出错误答案时,究竟是因为该事实从未被编码,还是因为该事实已被编码却无法访问?标准的准确率指标将这两种情况混为一谈,尽管它们所暗示的局限性和所需的干预措施截然不同。编码失败需要扩大模型规模或扩展数据覆盖范围,而回忆失败则可能还指向后训练和推理时方法,帮助大语言模型更好地利用它们已经编码的内容。
在《空货架还是丢失的钥匙?召回是参数化事实性的瓶颈》一文中,我们引入了知识画像,这是一个行为框架,可同时测量编码与召回,并用它来考察前沿大语言模型(如Gemini3和GPT-5)事实性的底层瓶颈。随后我们表明,前沿大语言模型中的许多事实性错误,更应被理解为丢失的钥匙(召回失败),而非空货架(编码失败)。
以此类推,我们用编码表示事实的参数化表征,用召回表示在没有外部线索的情况下检索已编码的事实,用识别表示在候选项中辨认出正确的事实。为支持这一分析,我们引入了WikiProfile,这是一个包含 2,150 条源自维基百科的事实的基准,每条事实都配有十个问题,分别探查编码、召回和识别。
核心思想:知识画像
知识画像将分析单元从单个问题转向事实。我们不再问模型是否答对了某个特定问题,而是提出一个更宏观的问题:该事实处于什么状态?我们将每条事实归入五种知识画像之一:(1)编码失败,(2)召回失败,(3)直接召回,(4)思考后召回,(5)未编码的推理。相比仅凭问题级别的准确率,这些画像能提供信息量更丰富的诊断。
该分类基于事实是否被编码以及其可访问程度:无法被回忆、可以被直接回忆,或只能借助思考才能回忆(即在给出最终答案之前引发中间计算,包括思维链提示和面向思考优化的 LLM)。

刻画事实的五种知识画像。
我们通过三种行为学概念将其操作化:
- 编码:如果模型能在类似预训练的上下文中正确复现某个事实,就说明它编码了该事实。在我们的设置中,我们通过命题补全和上下文提问来衡量这一点,这两种方法将模型置于与该事实在预训练期间自然出现的上下文相似的情境中(不揭示答案),从而引导模型暴露出该事实是否已被编码。
- 知识:一个模型知道一个事实,当它能够针对该事实,在不同措辞下正确回答语义等价的问题,包括直接问题和反向问题(例如,如果A 是 B,直接问题会问"B 是什么?",而反向问题会问"A 是什么?")。
- 召回:如果模型知道某个已编码的事实,就说明它召回了该事实。如果模型不假思索就能回忆起该事实,我们称之为直接召回。如果模型知道某个并未编码的事实,我们称之为无编码推理。这种情况仅在启用思考时才会出现,模型依赖其他已编码的事实,进行多跳推理或有根据的猜测。

顶部:我们从 Wikipedia 中提取事实,它是预训练数据的主要来源。左侧:我们通过提示 LLM 在原始上下文中复现事实来衡量编码程度。右侧:我们通过以不同的措辞和关系方向提问,并在启用和不启用思考的情况下,来衡量知识。
隆重推出 WikiProfile
为了将知识画像落地为可操作的方案,我们构建了WikiProfile,这是一个旨在衡量模型在自然出现的事实上事实准确性的基准。WikiProfile 使用一条全自动流水线构建,由经过提示词驱动的 LLM——Gemini-2.5-Pro with thinking——提供支持。提示词是在一个小的留出子集上通过人工优化开发出来的。我们通过识别事实来从 Wikipedia 页面中抽取候选事实:一个涉及有序实体对(主语和宾语)的命题,其中主语在文档中首先出现。每个事实都配有 10 项任务:两项用于编码,四项用于知识评估,以及四个用于识别的多项选择变体。
我们通过生成、精炼和过滤这三步流程生成正向和反向问题,确保每个问题都无歧义、具体、最小化,并且具有唯一答案。所有问题都要经过基于搜索引擎的过滤。我们会丢弃返回多个答案或需要澄清的案例。经过这一自动过滤以及最后的人工验证步骤后,该基准包含 2,150 个事实。

一个基于提示词驱动的 LLM 的全自动流水线。左侧(紫色):事实抽取与命题补全任务的构建。中间(红色和蓝色):通过生成、精炼和过滤来构建正向与反向问题。右侧(绿色):基于正向/反向问题对,创建其余问题(自然措辞版、上下文版和多项选择版)。
我们如何评估 LLM
我们评估了 13 个 LLM。每个模型都在开启和关闭思考两种模式下进行评估。对于每个模型、每个事实和每项任务,我们采样八个回答。回答由提示词驱动的 LLM 自动评分器自动评分(更多细节见论文),共产生约 450 万条回答。
主要结果:瓶颈在于召回,而非编码
在前沿 LLM(Gemini-2.5-Pro、Gemini-3-Pro 和 Flash、GPT-5)中,事实编码已接近饱和,但召回并未饱和。对于 Gemini-3-Pro 和 GPT-5,95–98% 的事实已被编码,但这些模型仍然无法直接召回 26–34% 的事实。即使开启思考,它们仍然在 11–12% 的事实上失败**_._** 这意味着,在前沿模型中,事实性错误越来越多地并非来自知识缺失,而是来自知识虽已存储却无法可靠访问。换句话说,瓶颈正在从知识获取转向知识利用。
规模扩展进一步印证了这一图景。在 Gemma 3 系列中,更大的模型表现出远更少的编码失败,但回忆失败仍然相当可观,并且在剩余错误中占据更大比例。规模扩展对模型所存储内容的改善,要大于对模型所能访问内容的改善。

五种画像在 13 个大语言模型上的分布(百分比)。黑线标记潜在知识。如图所示,编码失败随规模增大而急剧减少,而回忆失败即使在前沿模型中依然存在。
为什么回忆会失败?
我们的结果表明,回忆与事实被学习时的条件紧密耦合。当查询偏离了该事实在训练时所处的上下文、措辞或顺序时,回忆就变得更加困难。我们重点指出两种系统性出现这种情况的情形。
罕见事实被编码了,却难以回忆
先前的研究表明,大语言模型在长尾(罕见)事实上表现不佳,通常将其归结为模型容量的问题。我们的结果则呈现出一幅互补的图景。当我们比较低热度与高热度事实时,我们发现罕见事实的编码率与热门事实接近。编码上的差距相对温和;然而,回忆上的差距更大。这重新诠释了长尾问题:许多罕见事实并非不存在于模型的参数之中。它们存在,但难以访问。瓶颈已从知识获取转移到了知识利用。

我们从编码率和直接召回率两个维度比较了两个流行度层级(底部 20% 与顶部 20%)。Δ 表示层级之间的差距。如图所示,编码方面的差距很小,但召回方面的差距很大。所有 LLM 的结果请参见我们的论文。
反向问题可验证,但难以召回
我们还重新审视了逆转诅咒:当 LLM 知道“A 是 B”,却无法回答“B 是什么?”。乍看之下,这似乎表明 LLM 缺乏双向知识。但我们的结果表明,这一观点需要修正。在开放式生成(即召回)中,反向问题始终比直接问题更难。然而,在多项选择验证(即识别)中,反向问题并不比直接问题更难,而且往往更容易。这种分离很重要。如果一个模型在正确答案混在干扰项中时能够识别它,但在反向查询中却无法生成它,那么问题就不只是双向知识缺失。相反,事实似乎已被编码,甚至可被识别,但当查询方向偏离训练时遇到该事实的方式时,就难以召回。逆转诅咒是一个召回问题。

我们在两项任务中比较了直接问题和反向问题:验证(多项选择)和生成(闭卷)。Δ 表示直接设置与反向设置之间的差距。LLM 在验证中能有效处理反向问题,但在生成中却举步维艰。
思考作为一种恢复机制
现在我们转向这样一个问题:是什么使得那些原本无法获取的知识得以恢复。为此,我们考察思考能否在这一过程中发挥作用。思考恰恰在直接回忆最薄弱的地方,对回忆的提升最为显著。这种增益在罕见事实和反向问题上尤为明显,从而同时缩小了热门度差距和方向性差距。

我们考察思考对回忆(即知道已编码事实)的影响。左:我们比较两个事实热门度层级(底部 20% 对比顶部 20%)。右:我们比较直接问题和反向问题。热门度差距或方向性差距用 Δ(无思考)和ΔT(有思考)表示。
如图所示,思考缩小了这些差距(ΔT< Δ)。
更具体地说,在针对思考进行优化的模型中,思考能够恢复大约 40–65% 已编码但无法直接知道的事实。相比之下,对于未编码的事实,它的帮助要小得多。这一模式表明,思考主要充当一种促进回忆的机制:它帮助模型获取其已经编码的事实,而不是主要通过复杂的多步推理来推导答案。话虽如此,思考并非没有代价。它会带来计算成本,而且目前仍不清楚如何准确判断模型应在何时调用它。

我们报告了在思考模式下从"未知"变为"已知"的事实所占的百分比,并按该事实是否被编码(红色)或未被编码(黄色)进行条件划分。在针对思考优化的 LLM 中,思考能够恢复 40–65% 的被编码事实,但仅能恢复 5–15% 的未被编码事实。
要点
知识画像使我们能够精确诊断 LLM 中的事实行为。将这一方法应用于 Wikipedia 事实后,我们的结果表明,我们应当转变对前沿 LLM 中事实性错误的思考方式。如果编码已接近饱和,那么事实性的进一步提升可能较少来自规模扩展(模型规模或数据规模)。通过展示思考能够恢复相当一部分"已编码但未直接知晓"的事实,事实性的下一步提升可能不仅来自更好的知识获取,还来自对模型中已编码知识的更好利用。
柱状图展示了思考步骤如何在各种模型中对不同事实热度和问题方向提升召回率。

示意图展示了语言模型中的五种知识检索状态,从编码失败到直接召回。

柱状图展示了语言模型对高热度事实的编码和召回效果优于低热度事实。

示意图将 LLM 中的事实性知识操作化。它将编码定义为在预训练上下文中复现某一事实,将知晓定义为正确回答关于该事实的正向或反向问题。

折线图表明,如果事实已在模型中编码,那么在思考模式下被检索到的可能性显著更高。

流程图详细展示了 WikiProfile 流水线,用于将维基百科文档转换为经过验证的多项选择题。

柱状图比较了语言模型在验证和生成任务中,直接事实检索与反向事实检索的性能表现。
来源:Google Research:Blog(网页) · research.google