跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-19精选AI 评分72

CopT:基于连续空间对比验证的在策略推理

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

AI 导读

CopT提出了一种反转传统链式思考(CoT)顺序的推理框架:先生成草稿答案,再进行策略内反思。其核心是将连续嵌入向量转化为推理时的对比验证器,通过比较模型在离散令牌与连续嵌入输入下对同一生成令牌的支持度,构建序列级反向KL估计器,以此评估答案的可靠性。当答案不可靠时,CopT会执行进一步思考,并利用第二个KL估计器动态控制草稿答案的可见性,在保留有用信息与规避误导间取得平衡。在无需额外训练的前提下,该方法在数学、编程等任务上显著提升了准确率(最高达23%)并大幅减少了令牌消耗(高达57%)。

推荐理由

CopT把推理流程反了过来,先草稿答案再自我反思,用连续嵌入对比验证可靠性,在数学/编码/Agent任务上提点23%省token57%,思路可能改写推理范式。

正文 · AI 翻译

石大川

、朱翰林

、袁祥驰

、赵婉嘉

、夏可婧

肖文

李文科

佐治亚理工学院

加州大学伯克利分校

微软

摘要

思维链(CoT)是激发大语言模型推理能力的标准方法。然而,常见的 CoT 范式将思考视为回答的前提,这可能会延迟获取合理答案的时间,并且即使模型在深入思考之前就能识别出答案(这种行为被称为表演性推理),也会产生不必要的 token 开销。在本文中,我们引入了 CopT,这是一种重新设计的推理流程,它颠倒了思考与回答的常规顺序。CopT 并非先思考后回答,而是先生成一个草稿答案,然后根据该草稿答案调用后续的在线策略思考,用于反思和修正。为了评估草稿答案是否可信,CopT 将连续嵌入向量重新用作推理时的对比验证器。具体来说,它对比模型在离散 token 输入和连续嵌入输入下对相同生成 token 的支持程度,从而得出一个用于衡量答案可靠性的序列级反向 KL 估计量。我们的分析表明,在特定假设下,该期望估计值等于未解析的潜在状态与已生成的答案 token 之间的互信息,这解释了为何它捕获的是与答案相关的不确定性,而非潜在状态中的任意不确定性。当答案被认为不够可靠时,CopT 会执行进一步的在线策略思考,此时第二个 KL 估计量会动态控制草稿答案的可见性,在保留有用部分信息的同时,降低被不可靠内容误导的风险。在数学、编程和智能体推理任务中,CopT 在达到相当或更高准确率的情况下,峰值准确率最高可提升,token 使用量最高可减少,且无需任何额外训练。代码已开源在 https://github.com/sdc17/CopT。

Refer to caption
图 1:(a) CoT 思维与 CopT 在策略思维的概念对比。(b) CopT 对比了离散输入与连续输入下的输出分布。(c) CopT 在数学、编程和智能体推理任务中提升了峰值准确率(以 ∗ 标记),并在准确率相同时将 token 使用量几乎减半。

1 引言

推理已成为大语言模型(LLM)的核心能力之一,使其能够解决数学(Google DeepMind, 2024; Jaech et al., 2024; OpenAI, 2025; Team et al., 2025)、编程(Cao et al., 2026; Hui et al., 2024; Zhu et al., 2024; Roziere et al., 2023)和智能体(Anthropic, 2025a, b; Qwen Team, 2026; Patil et al., 2024)场景中日益复杂的任务。激发推理行为的常见方法是思维链(CoT),即 LLM 在生成最终答案之前,先生成中间的自然语言步骤(Wei et al., 2022; Yao et al., 2023; Goyal et al., 2024; Pfau et al., 2024; Qwen Team, 2024, 2025)。通过将思考过程显式化,CoT 显著提升了需要高级推理能力的复杂任务的表现(Yang et al., 2025; Meta AI, 2025b, a; Guo et al., 2025; Agarwal et al., 2025; Abdin et al., 2025; Shi et al., 2025b; Abouelenin et al., 2025)。

主流 CoT 范式的一个关键局限在于,它将思考视为回答的前提。其工作方式是先产生完整的推理轨迹,然后才得出答案。然而,近期研究表明,对于许多查询,LLM 会表现出表演性推理(Boppana et al., 2026; Huang et al., 2026; Lindsey, 2026; Chen et al., 2025b),即即使模型内部已经识别出合理的答案,它仍坚持完成整个推理过程。

我们提出 CopT,一种反向推理范式。LLM 不再先思考再回答,而是先草拟一个答案,然后通过思考进行反思和修正。这种重新定义的范式能够更早地提供答案,并在模型能够在深入思考之前识别出合理答案时,避免不必要的 token 消耗。

逆转思考与回答的常规顺序会带来两个关键挑战:草稿答案何时应被信任,以及它在后续思考中应如何被使用。我们证明,先前用于潜在 CoT 方法(Hao 等人,2024;Xu 等人,2025)中生成的连续嵌入,可以重新定义为这种逆向推理场景下的推理时验证器。通过对比模型在离散 token 输入与连续嵌入输入下对相同生成 token 的支持程度,它们为草稿可靠性估计和受控利用提供了可量化的标准。

潜在 CoT 是指大语言模型在思考过程中生成连续嵌入,而非承诺使用离散 token(Hao 等人,2024;Shen 等人,2025;Zhu 等人,2025b;Xu 等人,2025;Tan 等人,2025),这是与显式 CoT 并行的一条近期独立研究方向。这些方法的动机源于观察到潜在 CoT 每步能提供更高的表示带宽(Zhu 等人,2025c;Yu 等人,2026)。连续嵌入通过保留不确定性来编码更丰富的信息,而离散 token 仅保留每一步采样 token 所携带的信息(Li 等人,2025;Chen 等人,2025a)。

与现有潜在推理方法在思考过程中使用连续嵌入进行生成不同,CopT 保持思考的显式性,同时将连续嵌入重新定义为推理时的对比验证器。这使得 CopT 既能保留显式 CoT 的可读性,又能像潜在 CoT 一样利用不确定性信息。同时,它避免了直接使用连续嵌入进行生成时可能出现的问题,例如未见表示(Zhang 等人,2025)、去多样化(Wu 等人,2025)以及漂移为噪声(Shi 等人,2025a)。

为了解决第一个挑战——即判断草稿答案何时值得信任——CopT 引入了一种基于连续空间的对比机制,用于评估草稿答案的可靠性。具体来说,它通过对比模型在两种输入表示下对自身生成答案的支持程度来实现:一种是离散空间中的显式输入,另一种是从下一个 token 分布构建、并在显式 token 生成过程中在线缓存的连续嵌入。这种对比产生了一个序列级别的反向 KL 估计量,用于指示草稿答案的可靠性。如果草稿答案看起来足够可靠,模型会直接接受它。否则,CopT 会触发后续的在线策略思考过程,以修正或支持该答案。

第二个挑战——即如何使用草稿答案——则出现在在线策略思考被触发之后。被认为不够可靠的草稿答案可能仍然包含有用的部分信息,但如果在整个后续思考过程中始终暴露它,则有可能误导模型。为了在在线策略思考的各个思考步骤中控制草稿答案的可见性,CopT 会在每个思考块内,利用类似的连续空间对比机制,周期性地计算第二个 KL 估计量。通过这种方式,CopT 允许模型在草稿答案看起来有帮助时使用它,而在当前思考过程变得不稳定时将其隐藏。

除了实证结果之外,我们还对所提出的对比估计量提供了一种潜在状态解释。在局部混合前缀视角下,连续前缀保留了关于未解决的潜在推理状态的不确定性,而生成的答案 token 则用 表示。我们证明,在混合线性假设下(见第 4 节),该期望估计值等于互信息 ,这表明该估计量衡量的是与答案相关的不确定性,而非潜在状态本身的熵。这解释了为什么只有当连续嵌入所保留的不确定性改变了模型对自身生成 token 的支持程度时,该分数才会增长,从而支持其用于草稿可靠性估计。

  • •

    我们提出 CopT,一种无需训练的推理流程,使大语言模型能够从草稿答案开始,并在必要时基于该答案触发策略内思考,从而允许更早获得答案并在之后进行选择性修正。

  • •

    我们引入一种对比机制,用于衡量模型在离散输入与连续输入下对相同生成 token 的支持程度差异,这有助于识别草稿答案中的潜在错误,并在思考过程中调节其暴露程度。

  • •

    我们在数学、编程和智能体推理任务上,跨多个基准测试、模型架构和规模,广泛验证了 CopT 的有效性,结果表明其在准确率和 token 效率上均持续优于 CoT 基线方法。

2 相关工作

推理型大语言模型与显式推理。

使用显式自然语言轨迹进行推理已成为提升大语言模型在复杂任务上性能的标准方法(OpenAI, 2025; Anthropic, 2025a; Comanici et al., 2025)。早期工作通过提示词来激发此类行为(Wei et al., 2022; Wang et al., 2022; Yao et al., 2023)。较新的大语言模型通常通过强化学习(Shao et al., 2024; Yu et al., 2025; Liu et al., 2025b)或多阶段后训练(结合监督微调与强化学习)来获得推理能力(Liu et al., 2024; Shi et al., 2024; Yang et al., 2025; Ma et al., 2025; Yuan et al., 2025a, b)。代表性的开源示例包括 DeepSeek-R1(Guo et al., 2025)和 Qwen3(Yang et al., 2025),它们表明大规模强化学习和长 CoT 后训练能够激发强大的推理行为。后续工作(Zeng et al., 2025a; Liu et al., 2025a; Yuan et al., 2026; Cao et al., 2026)进一步证明了显式推理在多种数学、编程和智能体任务中的有效性。尽管取得了这些进展,推理型大语言模型通常仍保留先思考后回答的标准顺序。相比之下,CopT 颠倒了这一顺序,首先生成草稿答案,并在答案看起来不够可靠时,基于该答案触发策略内思考。

基于连续嵌入的隐式推理。

另一条并行的工作路线探索了连续空间中的潜在推理,即大语言模型在连续嵌入向量上运行,而不是在每个推理步骤都提交到离散的模型 token(Hao 等人,2024;Su 等人,2025;Zhu 等人,2025b)。这些方法的动机源于一个观察:连续表示可以编码来自完整下一个 token 分布的信息,而离散解码仅保留被采样的 token。潜在推理主要通过修改后的预训练(Zeng 等人,2025b;Tack 等人,2025)或微调(Shen 等人,2025;Xu 等人,2025;Tan 等人,2025;Wei 等人,2025;Zhu 等人,2025a;Xia 等人,2026)目标,将大语言模型适配到连续空间来实现。近期的一些免训练方法(Wu 等人,2025;Xu 等人,2026)则直接在推理过程中构建连续嵌入向量,例如 Soft-Thinking(Zhang 等人,2025)和 SwiReasoning(Shi 等人,2025a)。这些先前的潜在推理方法主要将连续嵌入向量用作生成的媒介。相比之下,CopT 将其重新定义为推理时的验证器。这使得 CopT 能够利用连续嵌入向量所保留的不确定性信息(如同在潜在推理中那样),同时保留显式推理的可读性。

3 方法论

如图 2 所示,CopT 将大语言模型的推理重构为两个反向的阶段:一个领先的草稿答案阶段,以及在必要时,一个后续的在线策略思考阶段。其关键洞察在于,首先以低成本引出早期阶段的答案,利用归一化的序列级反向 KL 估计器评估其可靠性,并基于草稿答案动态触发在线策略思考。

Refer to caption
图 2:CopT 从一个草稿答案开始,并基于该答案执行在线策略思考。它对比模型在离散输入和连续输入下对相同选定 token 的支持程度,以评估草稿答案的可靠性;并在思考过程中,逐块地确定草稿答案在不同时间步上的可见性。

3.1 草稿答案的可靠性估计器

草稿答案的引出。

设 表示参数为 的模型。设 为模型的输入嵌入矩阵,其中 是词表大小, 是隐藏层维度。对于任意词元 , 表示其嵌入向量。给定一个提问词元序列 ,我们不让模型进行深入思考,而是强制它在开头输出 </think> 并直接进入回答模式。

可靠性估计。

为了估计后续是否需要深入的思考过程来纠正潜在错误,我们引入了一个归一化的序列级反向 KL 估计量 。设草稿阶段生成词元 。在草稿答案生成过程中,对于每个生成的词元 ,我们缓存两个根据下一个词元分布计算得到的项目:

其中 是所选词元的概率, 是一个连续嵌入向量,通过词表上的概率加权平均得到,它保留了每一步的不确定性信息。

草稿答案完成后,我们计算 来估计其可靠性。更具体地说,我们将原始输入产生的学生离散前缀分布,与输入被替换为缓存的连续嵌入向量的教师连续前缀分布进行比较。

对于 ,学生概率就是 ,而所有教师概率通过一次使用修改后输入嵌入向量的前向传播并行获得。原始答案词元的教师概率在对应的输出位置收集:

这定义了采样得到的草稿答案的连续前缀概率为 。

我们定义估计量

对于任意固定的草稿长度 , 是两种分布之间归一化的序列级反向 KL 散度的无偏估计量:

3.2 基于草稿答案的在策略思考

在策略思考激发。

较大的 表明,在教师强制连续嵌入的情况下,答案上下文变得明显缺乏支持,即考虑到额外的不确定性信息,答案可能不可靠。设 为可靠性阈值。当 时,我们强制模型在草稿答案后输出 <think> 并进入后续的思考过程。

草稿答案的可见性控制。

对于被认为不够可靠的草稿答案,在线策略思考的目标是在必要时利用任何有益信息,同时避免被不可靠的草稿内容误导。让在线策略思考阶段生成 token。

我们将思考轨迹划分为长度为 的块。令第 个块从位置 开始。

并跨越位置 。令

表示第 个块的可见性掩码,并定义基于可见性条件的草稿输入为

对于块 中生成的每个 token,我们缓存

类似地,每当当前块达到预定义长度时,我们计算第二个 KL 估计量,以决定前一个草稿答案是否应在下一个块中变为可见。111 和 是在已生成的序列上计算的,因此一旦在生成过程中在线缓存了相应的已选 token 概率和连续嵌入,它们只会产生很小的开销。对于 ,学生模型的已选 token 概率就是 ,并且块内的所有教师模型概率通过使用修改后的块内输入嵌入进行一次前向传播即可并行获得:

我们定义估计量

对于固定的块长度 , 是块级延续分布之间归一化序列级反向 KL 的无偏估计量:

估计当前思考块的可靠性。较大的 表明当前块不稳定,更容易受到草稿答案中误导性信息的影响。令 表示稳定性阈值。在每个完整块之后,我们通过以下方式更新下一个块中草稿答案的可见性:

4 理论分析

在本节中,我们提供理论解释,以证明我们的 CopT 方法在特定假设下的有效性。我们重点关注所提出的反向 KL 估计量的可靠性。我们的分析突出了反向 KL 估计量的一个关键特性:它衡量的是与答案相关的不确定性,而非潜在推理状态本身的不确定性。

为方便起见,我们分析单个答案位置。请注意,以下所有概率分布都以问题(或等价地,提示词)和之前的输出前缀为条件,在上下文清晰时我们省略这些条件。设为一个有限的潜在推理状态集合。离散输出前缀(连同提示词)将模型约束到某个潜在状态,而连续前缀可能代表多个可能状态的叠加。

设为所有可能答案(或等价地,下一个 token)的有限集合。当前缀为离散时,对于每个潜在状态,设

表示由约束到该状态所诱导出的下一个 token 分布,其中表示模型参数。当前缀为连续时,我们对输出分布做出如下假设。

假设 1(混合线性连续前缀)

设为一个关于的分布,使得离散草稿前缀约束到某个潜在状态,然后输出答案。设表示由分布所确定的对应连续前缀。我们假设以连续前缀为条件的下一个 token 分布由下式确定:

注意,对于输出的答案 token,局部反向 KL 散度贡献为

定理 1(反向 KL 散度衡量答案相关的不确定性)

在假设 1 下,

其中是在联合分布下潜在状态与输出答案 token 之间的互信息。

证明见附录 F。定理 1 表明,CopT 本身并不惩罚潜在状态的不确定性。相反,它衡量的是这种不确定性是否会改变下一个答案 token 的分布。例如,连续前缀可能代表多个可能状态的混合,例如,其熵可能很高。然而,如果所有三个状态都诱导出相同的下一个答案 token 或相同的下一个 token 分布,那么输出的 token 就不携带关于选择了哪个状态的信息。在这种情况下,,期望反向 KL 散度贡献为零。因此,当所有可能状态在下一个答案上达成一致时,潜在状态的高度不确定性是无害的。

将该论证逐 token 应用,如果在每个答案位置上都满足混合前缀假设,那么归一化的草稿分数满足

该分数以每个位置上的前文为条件。因此,它估计了草稿答案中与答案相关的不确定性的平均量。

5 实验

5.1 实验设置

模型。

我们在基于纯 Transformer 架构的 Qwen3 模型(Yang 等人,2025)和混合 Gated-DeltaNet 架构的 Qwen3.5 模型(Qwen Team,2026)上评估 CopT,模型规模涵盖 2B、8B 和 35B。这一选择使我们能够在不同模型家族、规模和架构(包括纯 Transformer、混合、密集和稀疏混合专家模型)上验证 CopT 的有效性。

领域与基准。

我们在涵盖四个领域的 10 个基准上评估 CopT:数学与 STEM 推理(GSM8K(Cobbe 等人,2021)、Math500(Hendrycks 等人,2021)、AIME 2024(HuggingFaceH4,2024)、AIME 2025(Yentinglin,2025)、GPQA Diamond(Rein 等人,2024));代码推理(HumanEval(Chen 等人,2021)、MBPP(Austin 等人,2021)、LeetCode-Contest(Guo 等人,2024));单轮与多轮智能体推理(BFCL v4(Patil 等人,2025)、ZebraArena(Zhao 等人,2026))。更多细节见附录 E.2。

媒体内容 · 前往原文查看
表 1:在 Qwen3-8B 模型上,数学、代码和 STEM 推理基准的对比。绿色块表示 CopT 增加推理努力以达到更高准确率。
数学 GSM8K Math500 AIME24 AIME25
准确率 (%) # Token 数 准确率 (%) # Token 数 准确率 (%) # Token 数 准确率 (%) # Token 数
CoT 95.75 2138 96.00 4985 75.83 12077 67.50 12924
CoT(贪心) 95.83 2240 96.40 5311 70.00 11680 60.00 13292
CopT(我们的方法) \cellcolorcoptMainBg96.36 (+0.61) \cellcolorcoptMainBg1813 (-15.2%) \cellcolorcoptMainBg97.60 (+1.60) \cellcolorcoptMainBg4851 (-2.7%) 79.17 (+3.34) 11525 (-4.6%) 70.42 (+2.92) 12801 (-1.0%)
95.98 (+0.23) 961 (-55.1%) 96.20 (+0.20) 3609 (-27.6%)
代码 [-1pt]& STEM HumanEval LeetCode-Contest MBPP GPQA Diamond
准确率 (%) # Token 数 准确率 (%) # Token 数 准确率 (%) # Token 数 准确率 (%) # Token 数
CoT 92.68 2368 59.44 7306 94.16 2033 59.60 8123
CoT(贪心) 93.90 2627 57.22 6975 91.44 2724 56.57 7909
CopT(我们的方法) \cellcolorcoptMainBg96.34 (+3.66) \cellcolorcoptMainBg1842 (-22.2%) \cellcolorcoptMainBg66.11 (+6.67) \cellcolorcoptMainBg7607 (+4.1%) 94.55 (+1.39) 1997 (-1.8%) 61.62 (+2.02) 6851 (-15.7%)
94.51 (+1.83) 1023 (-56.8%) 61.11 (+1.67) 6993 (-4.3%)

5.2 数学与代码推理的实验结果

表1报告了使用Qwen3-8B模型在数学、代码和STEM推理基准上的准确率和生成长度。与标准CoT和贪婪CoT相比,CopT在大多数设置下提高了准确率,同时有效减少了生成长度。在适用的情况下,我们报告了两组CopT结果:一组目标是达到与CoT相当或更高的准确率,另一组(以绿色显示)则通过增加推理努力来进一步提升峰值准确率。

在数学基准上,CopT的token节省设置将GSM8K的准确率提升了,同时将生成的token减少了;并将Math500的准确率提升了,同时将生成的token减少了。这些结果表明,在不需要扩展思考的问题上,效率得到了显著提升。随着推理努力的增加,CopT进一步将GSM8K和Math500的准确率分别提升了和。在更具挑战性的AIME基准上,CopT获得了更大的准确率提升:在AIME24上提升了,在AIME25上提升了。同样的趋势也出现在代码和STEM任务上。在匹配的准确率水平下,CopT将HumanEval的准确率提升了,同时将token减少了。随着推理努力的增加,CopT在HumanEval、LeetCode-Contest、MBPP和GPQA Diamond上分别实现了、 、、 的更大准确率提升。

这些结果表明,当草稿答案看起来不够可靠时,CopT通过选择性调用策略内思考来提升峰值准确率。这在AIME24、AIME25、LeetCode-Contest和GPQA Diamond等较难的基准上尤其有益,因为这些基准上的草稿答案更可能需要修正。此外,CopT通过允许足够可靠的草稿答案被更早接受,减少了在简单示例上的不必要思考。这导致在GSM8K和HumanEval等基准上节省了大量token。

媒体内容 · 前往原文查看
表2:与使用连续嵌入进行生成的无训练方法的比较。Token数量通过生成步数来衡量,无论这些步数是显式的还是隐式的。
方法 GSM8K AIME25 HumanEval GPQA Diamond 完全显式可读性
准确率(%) 模型 token 数 准确率(%) 模型 token 数 准确率(%) 模型 token 数 准确率(%) 模型 token 数
Soft-Thinking 95.38 2073 68.33 13665 92.07 2408 59.60 8153
SwiReasoning 96.06 2218 70.00 13911 95.73 2894 61.11 8359
CopT(我们的方法) 96.36 1813 70.42 12801 96.34 1842 61.62 6851

5.3 与免训练连续生成方法的比较

表 2 将 CopT 与两种免训练方法进行了比较,这两种方法直接使用连续嵌入向量进行生成,分别是 Soft-Thinking(Zhang 等人,2025)和 SwiReasoning(Shi 等人,2025a),使用的模型为 Qwen3-8B。CopT 与它们的区别在于,它保持生成过程完全显式,并将连续嵌入向量重新定位为推理时的验证器。总体而言,CopT 在生成最少模型 token 的情况下实现了最佳准确率。与 SwiReasoning 相比,CopT 在四个数学、编程和 STEM 基准测试上的准确率分别提升了 、、 和 ,同时使用的模型 token 数分别减少了 、、 和 。此外,这些潜在 CoT 方法的推理过程并未完全以自然语言呈现。相比之下,CopT 允许用户检查完整的推理过程,同时仍能受益于连续嵌入向量中保留的不确定性信息。这些结果表明,连续嵌入向量并不需要被用作一种生成策略来改进推理。通过将其重新定位为对比验证器,CopT 更好地平衡了准确率、效率和可读性。

5.4 可控推理开销与延迟降低

Refer to caption
图 3:左图和中间图:通过 和 实现的可控推理开销。右图:在可比或更高准确率下,CopT 降低了单张 H200 GPU 上测量的平均每样本延迟。

图3研究了CopT如何控制推理努力程度,以及token节省如何转化为实际的延迟降低。左侧和中间面板展示了通过扫描和调整参数获得的准确率-token权衡曲线。这些曲线表明,当需要较少思考时,CopT可以减少生成长度,而当阈值触发更强的验证和纠正时,则会分配更多的策略内思考以获得更高的准确率。右侧面板报告了在可比或更高准确率下每个样本的平均延迟。延迟的降低与token效率的提升一致:CopT在GSM8K上降低了延迟,在Math500上降低了延迟,在HumanEval上降低了延迟。这些结果表明,CopT在保持推理准确率的同时,减少了实际的生成延迟。

媒体内容 · 前往原文查看
表3:智能体推理基准测试BFCL v4(单轮)和ZebraArena(多轮)上的对比。绿色块表示CopT增加推理努力程度以达到更高准确率。
方法 Qwen3.5-2B Qwen3.5-35B-A3B
BFCL v4 BFCL v4 ZebraArena(多轮)
(非实时和实时) (非实时和实时) 小 中 大
准确率(%) # Token数 准确率(%) # Token数 准确率(%) # Token数 准确率(%) # Token数 准确率(%) # Token数
CoT 77.53 234 85.77 235 93.71 3357 75.00 7217 59.21 8070
CopT(我们的方法) \cellcolorcoptMainBg78.37(+0.84) \cellcolorcoptMainBg164(-29.9%) \cellcolorcoptMainBg86.45(+0.68) \cellcolorcoptMainBg168(-28.5%) 96.69 [-1pt](+2.98) 3486 [-1pt](+3.8%) 88.14 [-1pt](+13.14) 5457 [-1pt](-24.4%) 82.24 [-1pt](+23.03) 6486 [-1pt](-19.6%)
78.01(+0.48) 139(-40.6%) 86.17(+0.40) 130(-44.7%)

5.5 智能体推理的实验结果

表 3 在智能体推理基准上评估了 CopT,包括 BFCL v4 的非实时和实时子集,以及包含一个缺失线索的多轮 ZebraArena。我们使用 Qwen3.5 模型进行智能体评估,因为这些模型专为更强的智能体能力而设计,而非仅用于推理的模型(Qwen Team, 2026)。在 BFCL v4 上,CopT 在不同规模下均能持续提升准确率,同时缩短生成长度。具体而言,CopT 在 Qwen3.5-2B 上以更少的 token 保持了相当或更高的准确率,在 Qwen3.5-35B-A3B 上同样以更少的 token 实现了这一点。在多轮 ZebraArena 基准上,提升效果更为显著。CopT 在小、中、大三个子集上分别将准确率提升了 、 和 。在生成长度方面,CopT 在小子集上使用了更多 token,但在中子集上减少了 个 token,在大子集上减少了 个 token。这些结果表明,CopT 在更长的智能体交互中尤其有用,因为改进的准确率与 token 消耗之间的权衡可以在多轮交互中累积。为简单起见,我们对所有单轮 BFCL v4 子集使用相同的推理努力值 ,对所有多轮 ZebraArena 子集使用相同的推理努力值 。通过为不同任务难度设置不同的推理努力值,可以实现更好的权衡。

5.6 设计选择的消融研究

Refer to caption
图 4:左图:该估计器比均匀选择更精确地识别出错误草稿。右图:阈值通过控制草稿可见性来权衡修正率和 token 使用量。

草稿答案可靠性估计。

我们首先考察草稿答案可靠性估计器能否在 GSM8K 上有效识别不可靠的草稿答案。图 4(左)比较了 CopT 与不同阈值下的均匀选择。对于每个阈值,我们报告了捕获的错误数量、精度(定义为被认定为错误的样本中真正错误的占比)以及安全接受率(定义为直接接受的答案中正确的占比)。随着阈值 变得严格,CopT 将更少的草稿答案判定为不可靠,但所选子集越来越集中于真正错误的草稿。相比之下,均匀选择的精度要低得多且近乎平坦,这表明均匀分配额外思考无法区分不可靠答案与可靠答案。这些结果证实了 能提供有意义的可靠性估计。

草稿答案的可见性控制。

接下来,我们研究在策略思考过程中可见性估计器对 Math500 的影响。图 4(右)改变阈值 ,并报告实际草稿错误数量以及成功纠正的错误数量。较小的 对应更严格的可见性控制,即草稿答案被暴露的频率更低。随着 变得严格,CopT 增加推理努力,减少对可能错误的草稿答案的依赖,并纠正更大比例的草稿错误。这些结果表明,该估计器在反思与纠正中发挥着直接作用。如果草稿答案始终暴露,不可靠的内容可能会持续影响在策略思考过程,阻止模型纠正其初始错误。相比之下,动态可见性控制允许 CopT 在当前思考片段看似不稳定时隐藏草稿答案,同时在草稿提供有用部分信息时仍允许访问它。

6 结论

本文介绍了 CopT,一种无需训练的大语言模型推理流程,它颠覆了通常的思考与回答顺序。CopT 首先引出草稿答案,然后在该答案看似不可靠时,调用基于该草稿的策略内思考。CopT 将先前在潜在 CoT 方法中用于生成的连续嵌入向量,重新用作推理时的验证器,其方法是通过对比模型在离散 token 输入和连续嵌入输入下对相同生成 token 的支持程度。在数学、编程和智能体推理任务上的实验表明,CopT 能够持续提升准确率和 token 效率,这表明,利用来自连续嵌入的对比验证进行策略内思考,为在推理时实现更具成本效益的大语言模型推理提供了一条实用路径。

参考文献

  • M. Abdin, S. Agarwal, A. Awadallah, V. Balachandran, H. Behl, L. Chen, G. de Rosa, S. Gunasekar, M. Javaheripi, N. Joshi, 等人 (2025) Phi-4-reasoning 技术报告。arXiv 预印本 arXiv:2504.21318。被 §1 引用。
  • A. Abouelenin, A. Ashfaq, A. Atkinson, H. Awadalla, N. Bach, J. Bao, A. Benhaim, M. Cai, V. Chaudhary, C. Chen, 等人 (2025) Phi-4-mini 技术报告:通过混合 LoRA 实现紧凑而强大的多模态语言模型。arXiv 预印本 arXiv:2503.01743。被 §1 引用。
  • S. Agarwal, L. Ahmad, J. Ai, S. Altman, A. Applebaum, E. Arbus, R. K. Arora, Y. Bai, B. Baker, H. Bao, 等人 (2025) Gpt-oss-120b 和 gpt-oss-20b 模型卡。arXiv 预印本 arXiv:2508.10925。被 §1 引用。
  • Anthropic (2025a) Claude Opus 4.5 系统卡。注:https://assets.anthropic.com/m/64823ba7485345a7/Claude-Opus-4-5-System-Card.pdf 系统卡。被 §1, §2 引用。
  • Anthropic (2025b) 系统卡:Claude Opus 4 和 Claude Sonnet 4。外部链接:链接。被 §1 引用。
  • J. Austin, A. Odena, M. Nye, M. Bosma, H. Michalewski, D. Dohan, E. Jiang, C. Cai, M. Terry, Q. Le, 等人 (2021) 使用大语言模型进行程序合成。arXiv 预印本 arXiv:2108.07732。被 §E.2, §5.1 引用。
  • S. Boppana, A. Ma, M. Loeffler, R. Sarfati, E. Bigelow, A. Geiger, O. Lewis, 和 J. Merullo (2026) 推理剧场:将模型信念与思维链分离。arXiv 预印本 arXiv:2603.05488。被 §1 引用。
  • R. Cao, M. Chen, J. Chen, Z. Cui, Y. Feng, B. Hui, Y. Jing, K. Li, M. Li, J. Lin, 等. (2026) Qwen3-coder-next 技术报告. arXiv 预印本 arXiv:2603.00729. 引用于:§1, §2.
  • M. Chen, J. Tworek, H. Jun, Q. Yuan, H. P. de Oliveira Pinto, J. Kaplan, H. Edwards, Y. Burda, N. Joseph, G. Brockman, A. Ray, R. Puri, G. Krueger, M. Petrov, H. Khlaaf, G. Sastry, P. Mishkin, B. Chan, S. Gray, N. Ryder, M. Pavlov, A. Power, L. Kaiser, M. Bavarian, C. Winter, P. Tillet, F. P. Such, D. Cummings, M. Plappert, F. Chantzis, E. Barnes, A. Herbert-Voss, W. H. Guss, A. Nichol, A. Paino, N. Tezak, J. Tang, I. Babuschkin, S. Balaji, S. Jain, W. Saunders, C. Hesse, A. N. Carr, J. Leike, J. Achiam, V. Misra, E. Morikawa, A. Radford, M. Knight, M. Brundage, M. Murati, K. Mayer, P. Welinder, B. McGrew, D. Amodei, S. McCandlish, I. Sutskever, 和 W. Zaremba (2021) 评估基于代码训练的大语言模型. 外部链接: 2107.03374 引用于:§E.2, §5.1.
  • X. Chen, A. Zhao, H. Xia, X. Lu, H. Wang, Y. Chen, W. Zhang, J. Wang, W. Li, 和 X. Shen (2025a) 超越语言的推理:关于潜在思维链推理的综合综述. arXiv 预印本 arXiv:2505.16782. 引用于:§1.
  • Y. Chen, J. Benton, A. Radhakrishnan, J. Uesato, C. Denison, J. Schulman, A. Somani, P. Hase, M. Wagner, F. Roger, 等. (2025b) 推理模型并不总是说出它们的真实想法. arXiv 预印本 arXiv:2505.05410. 引用于:§1.
  • K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, 等. (2021) 训练验证器以解决数学应用题. arXiv 预印本 arXiv:2110.14168. 引用于:§E.2, §5.1.
  • G. Comanici, E. Bieber, M. Schaekermann, I. Pasupat, N. Sachdeva, I. Dhillon, M. Blistein, O. Ram, D. Zhang, E. Rosen, 等. (2025) Gemini 2.5:以高级推理、多模态、长上下文和下一代智能体能力推动前沿. arXiv 预印本 arXiv:2507.06261. 引用于:§2.
  • Google DeepMind (2024) AI 达到解决国际数学奥林匹克问题的银牌标准. 注释: https://deepmind.google/discover/blog/ai-solves-imo-problems-at-silver-medal-level/ 引用于:§1.
  • S. Goyal、Z. Ji、A. S. Rawat、A. K. Menon、S. Kumar 和 V. Nagarajan(2024)《三思而后言:利用暂停 token 训练语言模型》。载于第十二届国际学习表征会议,引用于:§1。
  • D. Guo、D. Yang、H. Zhang、J. Song、R. Zhang、R. Xu、Q. Zhu、S. Ma、P. Wang、X. Bi 等(2025)《DeepSeek-R1:通过强化学习激励大语言模型的推理能力》。arXiv 预印本 arXiv:2501.12948。引用于:§1、§2。
  • D. Guo、Q. Zhu、D. Yang、Z. Xie、K. Dong、W. Zhang、G. Chen、X. Bi、Y. Wu、Y. K. Li、F. Luo、Y. Xiong 和 W. Liang(2024)《DeepSeek-Coder:当大语言模型遇上编程——代码智能的崛起》。arXiv 预印本 arXiv:2401.14196。引用于:§E.2、§5.1。
  • S. Hao、S. Sukhbaatar、D. Su、X. Li、Z. Hu、J. Weston 和 Y. Tian(2024)《训练大语言模型在连续潜在空间中进行推理》。arXiv 预印本 arXiv:2412.06769。引用于:§1、§1、§2。
  • D. Hendrycks、C. Burns、S. Kadavath、A. Arora、S. Basart、E. Tang、D. Song 和 J. Steinhardt(2021)《利用 MATH 数据集衡量数学问题求解能力》。arXiv 预印本 arXiv:2103.03874。引用于:§E.2、§5.1。
  • Z. Huang、X. Xia、Y. Ren、J. Zheng、X. Wang、Z. Zhang、H. Xie、S. Liang、Z. Chen、X. Xiao 等(2026)《你的推理模型是否隐式知道何时停止思考?》。arXiv 预印本 arXiv:2602.08354。引用于:§1。
  • HuggingFaceH4(2024)《AIME 2024(2024 年美国数学邀请赛)》。说明:Hugging Face 数据集。外部链接:链接。引用于:§E.2、§5.1。
  • B. Hui、J. Yang、Z. Cui、J. Yang、D. Liu、L. Zhang、T. Liu、J. Zhang、B. Yu、K. Dang 等(2024)《Qwen2.5-Coder 技术报告》。arXiv 预印本 arXiv:2409.12186。引用于:§1。
  • A. Jaech、A. Kalai、A. Lerer、A. Richardson、A. El-Kishky、A. Low、A. Helyar、A. Madry、A. Beutel、A. Carney 等(2024)《OpenAI o1 系统卡》。arXiv 预印本 arXiv:2412.16720。引用于:§1。
  • J. Li、Y. Fu、L. Fan、J. Liu、Y. Shu、C. Qin、M. Yang、I. King 和 R. Ying(2025)《大语言模型中的隐式推理:综合综述》。arXiv 预印本 arXiv:2509.02350。引用于:§1。
  • J. Lindsey (2026) 大语言模型中的涌现内省意识。arXiv 预印本 arXiv:2601.01828。引用自:§1。
  • A. Liu, B. Feng, B. Xue, B. Wang, B. Wu, C. Lu, C. Zhao, C. Deng, C. Zhang, C. Ruan, 等 (2024) DeepSeek-V3 技术报告。arXiv 预印本 arXiv:2412.19437。引用自:§2。
  • A. Liu, A. Mei, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, 等 (2025a) DeepSeek-V3.2:推动开放大语言模型的前沿。arXiv 预印本 arXiv:2512.02556。引用自:§2。
  • Z. Liu, C. Chen, W. Li, P. Qi, T. Pang, C. Du, W. S. Lee, 和 M. Lin (2025b) 理解类 R1-Zero 训练:一个批判性视角。arXiv 预印本 arXiv:2503.20783。引用自:§2。
  • L. Ma, H. Liang, M. Qiang, L. Tang, X. Ma, Z. H. Wong, J. Niu, C. Shen, R. He, Y. Li, 等 (2025) 学习强化学习无法做到的事:针对最难问题的交错在线微调。arXiv 预印本 arXiv:2506.07527。引用自:§2。
  • Meta AI (2025a) LLaMA 3.3 模型卡。注:https://github.com/meta-llama/llama-models/blob/main/models/llama3_3/MODEL_CARD.md 引用自:§1。
  • Meta AI (2025b) Llama 4 系列:原生多模态 AI 创新新时代的开端。注:https://ai.meta.com/blog/llama-4-multimodal-intelligence/ 引用自:§1。
  • OpenAI (2025) OpenAI o3 和 o4-mini。外部链接:链接 引用自:§1, §2。
  • S. G. Patil, T. Zhang, X. Wang, 和 J. E. Gonzalez (2024) Gorilla:与海量 API 连接的大语言模型。神经信息处理系统进展 37, 页码 126544–126565。引用自:§1。
  • S. G. Patil, H. Mao, C. Cheng-Jie Ji, F. Yan, V. Suresh, I. Stoica, 和 J. E. Gonzalez (2025) 伯克利函数调用排行榜(BFCL):从工具使用到大语言模型的智能体评估。第四十二届国际机器学习大会。引用自:§E.2, §5.1。
  • J. Pfau, W. Merrill, 和 S. R. Bowman (2024) 让我们逐点思考:Transformer 语言模型中的隐藏计算。arXiv 预印本 arXiv:2404.15758。引用自:§1。
  • Qwen Team (2024) Qwen2.5 技术报告。arXiv 预印本 arXiv:2412.15115。引用自:§1。
  • Qwen Team (2025) QwQ-32B:拥抱强化学习的力量。外部链接:链接 引用自:§1。
  • Qwen 团队(2026)Qwen3.5:迈向原生多模态智能体。外部链接:链接 引用自:§E.1, §1, §5.1, §5.5。
  • D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael, 和 S. R. Bowman(2024)GPQA:一个研究生级别的谷歌无法直接解答的问答基准。收录于:第一届语言建模会议,引用自:§E.2, §5.1。
  • B. Roziere, J. Gehring, F. Gloeckle, S. Sootla, I. Gat, X. E. Tan, Y. Adi, J. Liu, R. Sauvestre, T. Remez, 等人(2023)Code Llama:面向代码的开放基础模型。arXiv 预印本 arXiv:2308.12950。引用自:§1。
  • Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, 等人(2024)DeepSeekMath:推动开放语言模型数学推理的极限。arXiv 预印本 arXiv:2402.03300。引用自:§2。
  • Z. Shen, H. Yan, L. Zhang, Z. Hu, Y. Du, 和 Y. He(2025)CoDI:通过自蒸馏将思维链压缩到连续空间。arXiv 预印本 arXiv:2502.21074。引用自:§1, §2。
  • D. Shi, A. Asi, K. Li, X. Yuan, L. Pan, W. Lee, 和 W. Xiao(2025a)SwiReasoning:在潜在空间与显式空间之间切换思考以实现帕累托更优的推理大语言模型。arXiv 预印本 arXiv:2510.05069。引用自:§1, §2, §5.3。
  • D. Shi, Y. Fu, X. Yuan, Z. Yu, H. You, S. Li, X. Dong, J. Kautz, P. Molchanov, 和 Y. C. Lin(2025b)LaCache:阶梯形 KV 缓存,用于大语言模型的高效长上下文建模。收录于:第 42 届国际机器学习大会论文集,第 267 卷,第 54892–54903 页。引用自:§1。
  • D. Shi, C. Tao, A. Rao, Z. Yang, C. Yuan, 和 J. Wang(2024)CrossGET:用于加速视觉语言 Transformer 的交叉引导式 token 集成。收录于:第 41 届国际机器学习大会论文集,第 235 卷,第 44960–44990 页。引用自:§2。
  • D. Su, H. Zhu, Y. Xu, J. Jiao, Y. Tian, 和 Q. Zheng(2025)Token Assorted:混合潜在 token 与文本 token 以改进语言模型推理。arXiv 预印本 arXiv:2502.03275。引用自:§2。
  • J. Tack, J. Lanchantin, J. Yu, A. Cohen, I. Kulikov, J. Lan, S. Hao, Y. Tian, J. Weston, 和 X. Li(2025)使用连续概念进行大语言模型预训练。arXiv 预印本 arXiv:2502.08524。引用自:§2。
  • W. Tan, J. Li, J. Ju, Z. Luo, J. Luan, 和 R. Song (2025) 静默思考,快速思考:大语言模型推理链的动态潜在压缩。arXiv 预印本 arXiv:2505.16552。引用自:§1, §2。
  • K. Team, Y. Bai, Y. Bao, Y. Charles, C. Chen, G. Chen, H. Chen, H. Chen, J. Chen, N. Chen, 等人 (2025) Kimi k2:开放智能体智能。arXiv 预印本 arXiv:2507.20534。引用自:§1。
  • X. Wang, J. Wei, D. Schuurmans, Q. Le, E. Chi, S. Narang, A. Chowdhery, 和 D. Zhou (2022) 自一致性提升语言模型中的思维链推理能力。arXiv 预印本 arXiv:2203.11171。引用自:§2。
  • J. Wei, X. Wang, D. Schuurmans, M. Bosma, 等人 (2022) 思维链提示激发大语言模型的推理能力。arXiv 预印本 arXiv:2201.11903。引用自:§1, §2。
  • X. Wei, X. Liu, Y. Zang, X. Dong, Y. Cao, J. Wang, X. Qiu, 和 D. Lin (2025) SIM-cot:监督式隐式思维链。arXiv 预印本 arXiv:2509.20317。引用自:§2。
  • J. Wu, J. Lu, Z. Ren, G. Hu, Z. Wu, D. Dai, 和 H. Wu (2025) 大语言模型是单线程推理者:揭秘软思考的工作机制。arXiv 预印本 arXiv:2508.03440。引用自:§1, §2。
  • K. Xia, M. Li, L. Wei, Z. Du, X. Yuan, D. Shi, Q. Jin, 和 W. Lee (2026) MetaState:持久工作记忆增强离散扩散语言模型的推理能力。arXiv 预印本 arXiv:2603.01331。引用自:§2。
  • Y. Xu, X. Guo, Z. Zeng, 和 C. Miao (2025) SoftCoT:面向大语言模型高效推理的软思维链。arXiv 预印本 arXiv:2502.12134。引用自:§1, §1, §2。
  • Z. Xu, Z. Wang, Z. Qian, D. Shi, F. Tang, M. Hu, S. Su, X. Zou, W. Feng, D. Mahapatra, 等人 (2026) 在不确定性中思考:利用潜在熵感知解码缓解多模态大语言模型的幻觉。arXiv 预印本 arXiv:2603.13366。引用自:§2。
  • A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, 等人 (2025) Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388。引用自:§E.1, §1, §2, §5.1。
  • S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, 和 K. Narasimhan (2023) 思维树:大语言模型的审慎问题求解。神经信息处理系统进展 36, 第 11809–11822 页。引用自:§1, §2。
  • Yentinglin (2025) AIME 2025(2025年美国邀请数学考试). 注:Hugging Face数据集 外部链接:链接 引用自:§E.2, §5.1.
  • Q. Yu, Z. Zhang, R. Zhu, Y. Yuan, X. Zuo, Y. Yue, W. Dai, T. Fan, G. Liu, L. Liu, 等 (2025) Dapo:一个大规模开源大语言模型强化学习系统. arXiv预印本 arXiv:2503.14476. 引用自:§2.
  • X. Yu, Z. Chen, Y. He, T. Fu, C. Yang, C. Xu, Y. Ma, X. Hu, Z. Cao, J. Xu, 等 (2026) 潜在空间:基础、演化、机制、能力与展望. arXiv预印本 arXiv:2604.02029. 引用自:§1.
  • X. Yuan, X. Chen, T. Yu, D. Shi, C. Jin, W. Lee, 和 S. Mitra (2025a) 缓解监督学习与强化学习之间的遗忘可产生更强的推理模型. arXiv预印本 arXiv:2510.04454. 引用自:§2.
  • X. Yuan, D. Shi, C. Zhang, Z. Liu, S. Yao, S. Vosoughi, 和 W. Lee (2026) 强化智能体模型中的行为知识融合. arXiv预印本 arXiv:2601.13572. 引用自:§2.
  • X. Yuan, C. Zhang, Z. Liu, D. Shi, S. Vosoughi, 和 W. Lee (2025b) 浅层自我改进的推理模型受益于模型融合. arXiv预印本 arXiv:2503.02103. 引用自:§2.
  • A. Zeng, X. Lv, Q. Zheng, Z. Hou, B. Chen, C. Xie, C. Wang, D. Yin, H. Zeng, J. Zhang, 等 (2025a) GLM-4.5:智能体、推理与编码(ARC)基础模型. arXiv预印本 arXiv:2508.06471. 引用自:§2.
  • B. Zeng, S. Song, S. Huang, Y. Wang, H. Li, Z. He, X. Wang, Z. Li, 和 Z. Lin (2025b) 预训练语言模型在连续空间中思考. 外部链接:2505.20674 引用自:§2.
  • Z. Zhang, X. He, W. Yan, A. Shen, C. Zhao, S. Wang, Y. Shen, 和 X. E. Wang (2025) 软思考:在连续概念空间中释放大语言模型的推理潜力. arXiv预印本 arXiv:2505.15778. 引用自:§1, §2, §5.3.
  • W. Zhao, L. Schmidt, J. Zou, V. Balachandran, 和 L. Chen (2026) ZEBRAARENA:一个用于研究工具增强型大语言模型中推理-动作耦合的诊断模拟环境. arXiv预印本 arXiv:2603.18614. 引用自:§E.2, §5.1.
  • H. Zhu, S. Hao, Z. Hu, J. Jiao, S. Russell, 和 Y. Tian (2025a) 叠加现象的出现:揭示连续思维链的训练动态. arXiv预印本 arXiv:2509.23365. 引用自:§2.
  • H. Zhu、S. Hao、Z. Hu、J. Jiao、S. Russell 和 Y. Tian(2025b)《通过叠加进行推理:连续思维链的理论视角》。arXiv 预印本 arXiv:2505.12514。引用自:第1节、第2节。
  • Q. Zhu、D. Guo、Z. Shao、D. Yang、P. Wang、R. Xu、Y. Wu、Y. Li、H. Gao、S. Ma 等人(2024)《DeepSeek-coder-v2:打破代码智能领域闭源模型的壁垒》。arXiv 预印本 arXiv:2406.11931。引用自:第1节。
  • R. Zhu、T. Peng、T. Cheng、X. Qu、J. Huang、D. Zhu、H. Wang、K. Xue、X. Zhang、Y. Shan 等人(2025c)《潜在推理综述》。arXiv 预印本 arXiv:2507.06203。引用自:第1节。

附录 A 影响声明

本文研究了一种用于推理型大语言模型的推理时方法。通过提高准确率和模型 token 效率,CopT 可能使推理型大语言模型在有益应用中(例如科学问题求解、编程辅助和工具使用型智能体)更易获取且更具成本效益。与此同时,更强且更廉价的推理能力,若在缺乏适当安全防护措施的情况下部署,也可能增加大语言模型在有害应用中的实用性。这些风险并非 CopT 所独有,而是源于推理型大语言模型能力的提升。CopT 并未引入超出基础模型相关范畴的新一类社会风险。

附录 B 大语言模型的使用

我们使用了大语言模型和编程智能体来辅助语言润色、提升可读性以及调试代码。在本工作的任何部分,均未故意滥用大语言模型。所有技术思路和实验结果均为人类努力的成果。

附录 C 局限性

尽管 CopT 以无需训练的方式重构了大语言模型的推理过程,但其当前设计仍存在若干局限。首先,所提出的 KL 估计器是在推理时可获取的实际轨迹上进行评估的,而非对从模型分布中采样的多个续写结果取平均。这符合我们逐实例推理控制的设定,但可能导致方差高于多样本估计。我们通过对 token 取平均来缓解这一问题,未来研究可探索更具适应性或更低方差的估计器。其次,CopT 需要访问下一个 token 的概率。这对于开放权重模型以及暴露 logits 的推理系统而言是自然的,但对于仅返回文本输出的封闭 API 可能不够便捷。未来工作可探索利用有限可观测信息来近似对比可靠性的 API 兼容变体。

附录 D 补充实验

D.1 答案内容粒度的消融实验

媒体内容 · 前往原文查看
表 4:估计粒度的消融实验。默认设置对整个草稿答案进行计算,而答案内容设置仅对提取出的答案片段进行计算。
粒度 GSM8K Math500
准确率 (%) # Token 数 准确率 (%) # Token 数
\rowcolordefaultBg 整个草稿答案(默认) 95.98 961 96.20 3609
仅答案内容 96.36 (+0.38) 885 (-7.9%) 96.40 (+0.20) 3214 (-10.9%)

表 4 研究了用于估计的粒度的影响。在默认设置中,我们对整个草稿答案计算基于 KL 的可靠性估计器。我们发现,当最终答案片段易于识别时,更细粒度的变体可以进一步提升性能。例如,在数学任务中,最终答案通常由 \boxed{} 括起,这使得我们能够提取答案 token 并仅在此紧凑区域上进行计算。该设置将 GSM8K 的准确率从 95.98% 提升至 96.36%,同时将平均生成长度从 961 个 token 减少至 885 个 token。在 Math500 上,它将准确率从 96.20% 提升至 96.40%,并将平均生成长度从 3609 个 token 减少至 3214 个 token。

结果表明,当任务提供清晰且紧凑的答案区域时,更精确的可靠性估计会更有用。然而,这种提取方式依赖于具体任务,并非总能适用于数学之外的推理任务。为了使该方法在跨领域场景中保持通用性,本文所有结果均采用默认设置,即对整个草稿计算可靠性估计。

D.2 最大草稿答案长度的消融实验

媒体内容 · 前往原文查看
表5:最大草稿答案长度的消融实验
最大草稿长度 GSM8K Math500
准确率 (%) # Token 数 准确率 (%) # Token 数
256 95.67 (-0.31) 1075 (+11.9%) 96.60 (+0.40) 3405 (-5.7%)
512 95.37 (-0.61) 1021 (+6.2%) 97.00 (+0.80) 3660 (+1.4%)
\rowcolordefaultBg 1,024 (默认) 95.98 961 96.20 3609
2,048 95.52 (-0.46) 965 (+0.4%) 94.40 (-1.80) 3265 (-9.5%)

表5研究了草稿答案的最大生成长度的影响。我们默认将最大草稿长度设置为1024。这个上限作为草稿优先设置下的一种实用保护措施。我们观察到,对于少数具有挑战性的任务,推理大语言模型可能无法很好地校准,无法在扩展思考之前直接生成简洁的答案。在这种情况下,草稿答案阶段有时会继续生成重复或无信息的文本。限制草稿长度可以防止这些情况在应用可靠性估计和后续的在线策略思考之前消耗过多的 token。

总体而言,最大草稿答案长度并非一个高度敏感的超参数。在GSM8K上,默认长度1024在所有设置中实现了最佳准确率,同时使用的 token 数最少。在Math500上,更短的限制(如256和512)可以提高准确率,这表明针对特定任务的草稿上限可能带来额外收益。然而,将上限增加到2048并未提高任一基准的准确率。这些结果表明,草稿长度上限主要起到防止异常长或重复草稿的作用,而非作为一个敏感的超参数。因此,我们在所有实验中采用1024作为简单的默认值,这无需针对特定任务进行调整即可提供稳定的性能。

唯一的例外是多轮交互的 ZebraArena 基准测试,在该测试中我们使用了更小的最大草稿长度。由于 ZebraArena 需要多轮交互,有效的草稿预算会在各轮之间累积。较短的每轮上限有助于控制整体上下文增长,同时仍允许模型在每一轮生成简洁的草稿答案。

D.3 LeetCode-Contest 基准测试的详细结果

媒体内容 · 前往原文查看
表 6:LeetCode-Contest 基准测试上按难度划分的准确率和生成长度对比
方法 简单 中等 困难 总体 Token 数量
CoT 57.78 68.13 43.18 59.44 7306
CoT(贪心) 64.44 58.24 47.73 57.22 6975
CopT(我们的方法) \cellcolorcoptMainBg64.44 (+6.66) \cellcolorcoptMainBg72.53 (+4.40) \cellcolorcoptMainBg54.55 (+11.37) \cellcolorcoptMainBg66.11 (+6.67) \cellcolorcoptMainBg7607 (+4.1%)
51.11 (-6.67) 69.23 (+1.10) 54.55 (+11.37) 61.11 (+1.67) 6993 (-4.3%)

表 6 报告了 LeetCode-Contest 基准测试上按难度划分的结果。CopT 在相似的 token 预算下将总体准确率从 提升至 。最大的提升出现在困难难度部分,CopT 将准确率从 提升至 ,获得了 的绝对提升。这表明在策略上的思考对于较难的问题尤其有用,因为在这些问题上,初始草稿答案更可能需要进一步的反思和修正。

两个 CopT 行展示了不同的准确率-效率权衡。推理努力增加的那一组取得了最佳的总体准确率,在三个难度部分上都优于标准 CoT,且生成长度仅有小幅增加。另一组在减少 token 使用量的同时,仍然提升了总体准确率。尽管另一组在简单难度部分上的准确率有所下降,但它保留了在困难难度部分上的提升,并且仍然改进了中等难度部分。这些结果表明,CopT 能够以可控的方式在生成长度和准确率之间进行权衡。

D.4 BFCL v4 基准测试的详细结果

媒体内容 · 前往原文查看
表 7:BFCL v4 基准测试上按难度划分的准确率对比
模型 方法 live_multiple live_parallel live_parallel_multiple live_simple multiple parallel
Qwen3.5-2B CoT 73.41 62.50 54.17 72.87 90.50 81.50
CopT(我们的方法) 74.93 81.25 54.17 69.77 91.50 82.00
(+1.52) (+18.75) (+0.00) (-3.10) (+1.00) (+0.50)
Qwen3.5-35B-A3B CoT 81.20 87.50 79.17 85.27 93.50 91.50
CopT(我们的方法) 81.58 87.50 79.17 85.66 95.00 91.50
(+0.38) (+0.00) (+0.00) (+0.39) (+1.50) (+0.00)
模型 方法 parallel_multiple simple_java simple_javascript simple_python 总体 # 模型 token
Qwen3.5-2B CoT 79.00 69.00 60.00 88.50 77.53 234
CopT(我们的方法) 79.50 72.00 60.00 89.25 78.37 164
(+0.50) (+3.00) (+0.00) (+0.75) (+0.84) (-29.9%)
Qwen3.5-35B-A3B CoT 88.00 78.00 78.00 93.50 85.77 235
CopT(我们的方法) 88.00 82.00 72.00 95.50 86.45 168
(+0.00) (+4.00) (-6.00) (+2.00) (+0.68) (-28.5%)

表 7 报告了 BFCL v4 的非实时和实时子集上的逐子集结果。结果表明,CopT 在大多数情况下能够保持或提高不同函数调用类别的准确率,同时减少不必要的推理 token,这表明 CopT 为结构化智能体推理提供了更好的准确率-效率权衡。

附录 E 补充细节

E.1 实现细节

所有实验均在单个 NVIDIA H200 GPU 上进行。我们对 Qwen3 [Yang 等人,2025] 和 Qwen3.5 [Qwen 团队,2026] 模型使用默认生成设置,包括所有实验的温度为 0.6、top-p 为 0.95、top-k 为 20、min-p 为 0。CopT 的块大小设置为 ,这平衡了及时估计与较低额外成本。默认情况下,草稿答案对策略思考的第一个块不可见,因为 的最早值仅在第一个块完成后才可用。我们将多轮 ZebraArena 基准测试的最大草稿答案长度设置为 512,所有其他基准测试设置为 1,024。

E.2 基准测试细节

我们在 10 个推理基准测试上评估 CopT,涵盖数学和 STEM 推理方面的 GSM8K [Cobbe 等人,2021]、Math500 [Hendrycks 等人,2021]、AIME 2024 [HuggingFaceH4,2024]、AIME 2025 [Yentinglin,2025]、GPQA Diamond [Rein 等人,2024];代码推理方面的 HumanEval [Chen 等人,2021]、LeetCode-Contest [Guo 等人,2024]、MBPP [Austin 等人,2021];以及智能体推理方面的 BFCL v4 [Patil 等人,2025]、ZebraArena [Zhao 等人,2026]。

  • •

    GSM8K:我们在包含 1,319 道小学数学题的测试集上进行评估。该基准测试检验模型是否能解决通常需要多个推理步骤的自然语言算术问题。数据集链接:https://huggingface.co/datasets/openai/gsm8k。

  • •

    Math500:我们使用来自 MATH 基准测试的 500 道精选问题。这些问题涵盖多个高中数学竞赛领域,包括代数、几何、数论、微积分预备知识和中级代数。:https://huggingface.co/datasets/HuggingFaceH4/MATH-500。

  • •

    AIME 2024:该基准测试包含来自 2024 年美国数学邀请赛的 30 道问题,涵盖 AIME I 和 AIME II 两部分。每道问题都需要一个简洁的数值答案,旨在测试竞赛级别的数学推理能力。:https://huggingface.co/datasets/HuggingFaceH4/aime_2024。

  • •

    AIME 2025:该基准测试包含来自 2025 年美国数学邀请赛的 30 道问题,涵盖 AIME I 和 AIME II 两部分。每道问题都需要一个简洁的数值答案,并继续聚焦于竞赛风格的数学推理,通过具有挑战性的问题来测试符号和逻辑技能。:https://huggingface.co/datasets/yentinglin/aime_2025。

  • •

    GPQA Diamond:我们使用 GPQA 的 Diamond 子集,包含 198 道经专家验证的 STEM 选择题。问题主要涵盖数学、物理、化学、生物学和计算机科学,旨在对非专业人士构成难度。这些问题用于评估专家级的事实知识和推理能力。:https://huggingface.co/datasets/hendrydong/gpqa_diamond_mc。

  • •

    HumanEval:我们使用 HumanEval 中的 164 个手写 Python 编程任务。每个任务提供一个函数签名和文档字符串,通过针对单元测试执行生成的函数来衡量正确性。:https://huggingface.co/datasets/openai/openai_humaneval。

  • •

    LeetCode-Contest:我们在从 LeetCode 竞赛中收集的 180 道编程竞赛问题上进行评估。该基准测试包含不同难度级别的问题,模型输出通过判断生成的解决方案是否通过所有相关测试来评定。:https://huggingface.co/datasets/TechxGenus/LeetCode-Contest。

  • •

    MBPP:我们使用经过清洗的测试集拆分,其中包含 257 个 Python 编程问题。每个示例包含一个自然语言任务描述、一个参考答案以及用于基于执行的评分的单元测试。来源:https://huggingface.co/datasets/google-research-datasets/mbpp。

  • •

    BFCL v4:伯克利函数调用排行榜 v4 评估了大语言模型在真实智能体场景中准确调用函数和工具的能力。我们使用了非实时和实时拆分中的所有子任务,共包含 2,501 个问题。来源:https://github.com/shishirpatil/gorilla。

  • •

    ZebraArena:一个用于评估工具增强型大语言模型在多轮智能体推理中表现的诊断性模拟环境。它基于 Zebra 逻辑谜题构建,采用缺失线索的设置,模型必须向环境查询隐藏的事实或关系,然后解决一个具有唯一可验证性的约束满足问题。来源:https://github.com/wanjiaZhao1203/ZebraArena。

遵循 Qwen3 和 Qwen3.5 的评估设置,我们分配了较大的最大输出预算,以允许充分的推理。具体来说,我们将 GSM8K、Math500、GPQA Diamond、HumanEval、LeetCode-Contest、MBPP 和 BFCL v4 的最大生成长度设置为 32,768 个模型 token,将 AIME 2024 和 AIME 2025 的最大生成长度设置为 38,912 个模型 token。对于 ZebraArena,我们将小规模拆分的最大生成长度设置为 32,768 个模型 token,中规模拆分为 65,536 个模型 token,大规模拆分为 98,304 个模型 token。我们对 AIME 2024 和 AIME 2025 基准测试重复评估八次,并报告 CopT 和基线的平均准确率。

E.3 KL 估计量的序列分布

我们定义了 KL 估计量在固定生成长度下所使用的序列分布。

针对草稿答案阶段。

对于固定的草稿长度 ,草稿答案上的离散前缀延续分布为

相应的连续前缀延续分布为

其中,每个草稿模型 token 之前的离散前缀被替换为缓存的连续嵌入向量。

针对在策略思考阶段。

我们将策略思考轨迹划分为长度为 的块。令第 个块从位置 开始

以及跨度位置。令 表示第 个块中草稿答案的可见性状态。

在受可见性控制的草稿答案输入以及当前块之前的前缀条件下,学生模型的块级延续分布为

对应的连续前缀块内延续分布为

其中当前块内已生成的内容被缓存的连续嵌入 替换,而当前块之前的前缀仍保持离散形式。

附录 F 答案相关不确定性的补充推导

在本节中,我们给出定理 1 的完整推导及其若干推论。核心结论是:反向 KL 散度估计量衡量的是影响下一个答案 token 的不确定性,而非潜在推理状态本身的不确定性。

定理 1 的证明。

回顾在假设 1 下的混合线性前缀模型。局部反向 KL 散度贡献为

取期望得到

此外,在联合分布

下, 的边缘分布为

因此,

于是,

证明完毕。

无害的潜在状态不确定性。

如果 支撑集内的所有潜在状态都产生相同的下一个 token 分布,

那么

因此,

几乎必然成立。因此,即使潜在状态的熵很大,反向 KL 散度得分也为零。

这形式化了如下直觉:连续前缀可能编码多种状态的叠加,但仍保持可靠。如果所有可能的状态在下一个 token 分布上达成一致,那么该不确定性就与答案无关。

近似等价状态下的稳定性。

更一般地,假设所有状态条件分布都接近某个公共分布 。那么

为说明这一点,注意到

由于 KL 散度非负,

根据定理 1,

证毕。

确定性 token 情形。

假设每个潜在状态确定性地对应一个答案 token

使得

将由软前缀状态诱导的答案 token 的边缘概率定义为

那么

由于 是确定性的,

取期望得到

因此,在确定性答案设定下,反向 KL 散度得分恰好是诱导答案 token 的熵,而非潜在状态 的熵。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org