思考即回忆:推理如何解锁LLM中的参数化知识
Thinking to recall: How reasoning unlocks parametric knowledge in LLMs
Google Research研究发现,推理(chain-of-thought)能帮助大语言模型(LLM)回忆简单事实,即使这些事实无需复杂推导。在Gemini-2.5 Flash和Pro以及Qwen3-32B上,启用推理后模型能够回答原本无法直接回答的简单问题,pass@k显示正确事实存在于输出分布中。该现象由两个机制驱动:一是生成的推理token充当计算缓冲,允许模型进行隐藏计算以提取参数化知识;二是推理过程中产生的相关事实起到启动效应(factual priming),帮助模型激活正确答案。
发现一个反直觉现象,让模型推理能提升简单事实回忆,不是靠分步解题而是计算缓冲和事实预热,对理解模型知识召回机制很有启发,但中间步骤幻觉也带来风险。
我们研究了一种反直觉现象:即使不需要复杂的逐步解答,推理也能帮助语言模型回忆简单事实。我们表明,这一现象由两种机制驱动:(1)利用生成的推理 token 进行潜在计算;(2)生成相关事实以激活正确答案的回忆。
快速链接
-
- 复制链接 ×
众所周知,允许大语言模型(LLM)生成逐步推理轨迹——通常称为思维链(CoT)——能够提升其在复杂任务上的表现。当模型求解困难的数学方程、编写软件或回答多跳事实性问题时,将问题分解为可管理的逻辑步骤非常有效。
然而,对于简单的单跳事实性问题,这种方法的效用仍不明确。例如,考虑这样一个查询:“Mary Engle Pennington 是哪一年入选美国国家发明家名人堂的?”大语言模型要么在其参数记忆(直接编码到权重中的知识)中存储了这一事实,要么没有;不需要复杂的算术或逻辑推演。那么,推理轨迹为什么会有帮助呢?
在《思考以回忆:推理如何解锁大语言模型中的参数化知识》一文中,该文将在COLM 2026上展示,我们研究了这一现象。我们证明,允许模型生成一段推理轨迹,能够解锁那些原本实际上无法触及的正确答案。为了理解为什么在无需执行复杂推理步骤的情况下,推理仍有助于参数化知识的回忆,我们开展了一系列以假设驱动的受控实验。我们的发现揭示了驱动这一现象的两种互补机制:计算缓冲效应和事实启动。
探测知识边界
我们首先测量参数化回忆能力边界使用pass@k指标。pass@k 不只检查模型生成的一个答案,而是检查正确事实是否存在于多次生成尝试之中。通过评估模型输出分布中是否存在成功的推理路径,同时对其确切排名不那么敏感,pass@k 帮助我们估计推理在事实回忆方面的潜力,而不是只关注当前模型的 top-1 行为。为了在控制参数化知识的同时评估推理的影响,我们聚焦于可以启用或禁用(开启或关闭)推理的推理型 LLM(R-LLM),并比较这两种模式下的 pass@k。我们聚焦于Gemini-2.5(Flash 和 Pro)和Qwen3-32B模型,使用两个具有挑战性的闭卷问答数据集:SimpleQA Verified和EntityQuestions.
结果出奇地一致。当启用推理时,模型能够成功回忆起在关闭推理时几乎无法恢复的答案。重要的是,这一提升并不仅仅是因为模型在分解复杂问题。这源于我们刻意聚焦于那些以简单、单跳问题为主的数据集。

在两个闭卷问答数据集和三个 LLM 上的 Pass@𝑘 曲线,比较了同一模型在启用推理(ON)与禁用推理(OFF)时的表现。
这些结果引出了一个问题:如果这一效果并非来自逐步推理,那么究竟是哪些推理模式使模型能够检索到正确答案?
机制 1:计算缓冲区
我们的第一个假设聚焦于生成的机制。我们采纳了一个长期存在的假设,即生成额外的 token 通过提供额外的前向传播来充当扩展的计算时间,并在 R-LLM 参数化知识回忆这一新场景中对其进行了检验。具体而言,我们假设模型隐式地将这些推理 token 用作计算缓冲区,以执行潜在处理,而与所生成的实际语义内容无关。
为了验证这一点,我们设计了一个实验,从推理轨迹中移除所有有意义的内容。我们拦截模型的推理过程,将其生成的轨迹替换为一个无意义的字符串“让我想想”,反复重复直到其长度与原始推理轨迹匹配。然后,我们让模型基于这段占位文本预测最终答案。
值得注意的是,与完全关闭推理的基线相比,让模型基于这段无意义的轨迹进行条件生成,能大幅提升其回忆正确答案的能力。这提供了强有力的证据,表明仅仅给模型更多的计算空间,就能帮助它优化内部状态并提取难以触及的事实。

计算缓冲效应对 Gemini-2.5-Flash 的影响。ON Dummy 用一个不含事实内容的短序列替换思考轨迹,并重复该序列以匹配原始轨迹的 token 长度。
然而,这种计算缓冲效应有其局限。将占位文本推到更长的长度最终会带来递减的回报,而且它始终无法完全匹敌模型自然推理轨迹的表现。这意味着,尽管额外的计算有所帮助,但思考的实际内容仍然重要。

以虚拟推理轨迹为条件时,推理有效性随输入长度(以 token 计)变化的函数关系。ON Dummy X 会用一段简短的虚拟序列替换推理轨迹,并重复该序列,使输入长度达到 X 个 token。推理有效性指标(Ω)汇总了所有 k 值下的 pass@k 增益。我们将其定义为推理开启与关闭两种模式下 pass@k 的加权平均相对差异。
机制 2:事实启动
当我们分析针对简单事实性问题所生成的天然推理轨迹时,我们注意到一个常见模式。模型并没有写出逻辑证明;它们浮现的是相关事实。
在人类认知中,有一个概念被称为扩散激活,即处理某个特定概念会启动语义记忆中相关的概念,使其更容易被提取。我们假设语言模型也表现出类似的生成式自检索机制,我们将其称为事实启动。通过生成与问题主题相关的事实,模型构建起一座上下文桥梁,从而促进正确答案的提取。
为了检验假设,我们仅从模型的推理轨迹中提取具体事实,并应用严格过滤,剔除任何填充文本、搜索计划或对最终目标答案的明确提及。随后,我们分离出所回忆事实的效果,并表明以一份简短的回忆事实列表为条件,可以恢复推理的大部分增益,甚至在没有推理时也有帮助。

事实启动效应对 Gemini-2.5-Flash 的影响。我们首先提取推理过程中提到的事实。ON Facts用这份简短的事实列表覆盖模型原本的推理轨迹,并重新生成最终答案,而OFF Facts则在禁用模型推理的情况下运行,将事实列表作为提示词的一部分、以额外输入上下文的形式提供。
例如,如果被问及尼泊尔第 10 位国王的名字,推理模型可能会先列出前九位国王。回忆起前九位国王起到了一种语义热身的作用,为网络成功回忆起第 10 位国王做好了启动准备。这些事实本身就是垫脚石。

“事实启动”实际运作的示意图:中间步骤的事实检索(列出前九位国王)为模型成功回忆起尼泊尔第 10 位国王做好了启动准备。在启用推理(ON)时,模型能够正确作答,而在不启用推理时则失败。当预测仅以推理过程中回忆起的简短事实列表为条件(ON Facts)时,模型同样能够成功。
模型幻觉陷阱
尽管生成式自检索是一种强大的机制,但它也引入了一个根本性风险。由于这些中间事实是由模型自行生成的,它们可能是模型幻觉。因此,我们考察这些推理阶段的错误如何影响最终答案。为了弄清这一点,我们构建了一个大规模审计流水线,使用一个支持搜索的验证器,独立检查数十万条推理轨迹中生成的每一个中间事实的正确性。
审计揭示出一种明显的模式。如果一条推理轨迹中哪怕只包含一个幻觉的中间事实,模型得出正确最终答案的可能性也会显著降低。这表明,事实引导机制虽然有效,却可能相当脆弱。

推理轨迹包含幻觉(hallucinated)与不包含幻觉(clean)时正确答案的比例对比。
构建更可靠的模型
理解这些机制为提升模型可靠性提供了切实可行的途径。由于事实引导是有效的,而幻觉的中间事实会降低性能,我们可以利用这两方面的洞见来提高模型的准确率。
为了评估这些洞见的潜力,我们采用了一种测试时选择策略:针对单个问题生成多条推理轨迹,仅保留其中包含可验证、无幻觉事实的轨迹。优先选择这些轨迹能显著提升准确率。在实践中,这种优先级排序可以在训练期间通过过程奖励来实现,以鼓励有事实支撑的中间步骤。

基于事实召回和事实正确性的测试时选择标准下的预期准确率。
结论
我们的发现凸显出,语言模型中的推理所服务的目的远比任务分解或数学逻辑广泛得多。它作为一种基础机制,用于暴露模型的内部记忆并扩展其参数化知识边界。这些洞见为未来研究开辟了令人兴奋的方向。既然知道事实准确的推理轨迹能带来更好的答案,就意味着训练方案可以进一步优化。通过利用专门鼓励有事实支撑的中间步骤的过程奖励,我们或许能够训练出本质上更可靠、更不易产生幻觉的模型。我们期待看到研究社区如何继续探索推理、记忆与检索之间的交叉领域。
致谢
本研究由 Zorik Gekhman、Roee Aharoni、Eran Ofek、Mor Geva、Roi Reichart 和 Jonathan Herzig 完成。我们感谢 Eyal Ben-David 和 Avinatan Hassidim 审阅本项工作并提出宝贵建议。
来源:Google Research:Blog(网页) · research.google