大语言模型的显著性偏差:常识推理中的知识压制而非缺失
Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。
这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。
摘要
随着大语言模型(LLM)在复杂推理任务中不断进步,它们已学会高度优先处理输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露出了一个关键漏洞,我们将其称为**显著性偏差(Salience Bias)**:模型容易被无用的显式干扰项(例如数值)所劫持,从而忽略任务隐含的物理或常识前提。一个关键待解问题是:这种失败究竟反映了常识知识的真正缺失,还是仅仅在误导性任务框架下被抑制了。为探究此问题,我们构建了 **SaliTrap 基准**,这是一个涵盖四个陷阱维度的高质量数据集。通过对 12 个最先进的大语言模型进行评估,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而加剧,且检测到陷阱往往与实际避开陷阱并不相关。关键在于,通过剥离任务框架后重新引导同一批模型,我们证明这绝大多数是知识抑制而非知识缺失的失败:仅凭一个无上下文的常识知识探针,就能恢复超过 90% 的谄媚性顺从失败案例,这表明所需常识本质上存在,但被显著干扰项主动挤出,诱使模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步证明,仅靠轻量级的推理时提示(无需任何重新训练)就能大幅缩小这一差距。我们的研究将常识推理失败的瓶颈从模型能力重新定位到知识引导环节,并发布 SaliTrap 作为这一盲点的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。
引言
随着大语言模型(LLM)能力边界的持续拓展,它们在求解复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编程任务(Jimenez et al. 2024; Zhang et al. 2024)方面已变得极为娴熟。这一成功在很大程度上归功于LLM在预训练(Liu et al. 2023)和后训练(Chu et al. 2025)阶段所摄入的相关数据。然而,用于数学推理、智能体操作和编程的数据通常具有一个共同特征:所提供的条件对于解决任务而言总是有用且必要的。
尽管LLM已学会有效利用这些显式条件进行推理(Shao et al. 2024),但这种训练范式也导致它们过度关注每一个提供的细节,因为奖励信号很少会因关注无关信息而给予惩罚。然而,在常识推理中,用户查询里呈现的条件并不总是像数学问题中的条件那样具有普遍相关性。
例如,当用户询问LLM,对于距离家50米的洗车店,应该开车还是步行前往时,主流模型(如Gemini和DeepSeek)倾向于完全基于“50米”这一显著条件进行推理(具体示例见后文图2)。这样一来,它们忽略了隐含的常识性前提——必须开车去才能洗车,最终得出用户应该步行的结论。我们将这种现象称为LLM的显著性偏差(Salience Bias)。
如图 1 所示,这种偏差在各类模型中普遍存在,其成因在于干扰项密度,与单纯的陷阱识别相分离,并且根植于知识抑制而非知识缺失:(a)在所有 12 个被评估的大语言模型中,即使表现最好的模型也仅在 54.8% 的查询中成功避开陷阱,且 12 个模型中有 8 个低于 30%;(b)每增加一个数字干扰项,都会进一步降低陷阱规避率,同时推高 CoT 劫持率;(c)GLM-5.1 和 Kimi-K2 即使在明确识别出陷阱后,仍有 86.2% 和 81.8% 的时间选择遵从,这表明识别并不等于规避;(d)剥离任务框架后,原本看似缺失的知识得以恢复,代表性模型从条件 A 到条件 C 的平均解放率显著提升。
一个关键悬而未决的问题随之而来:这种失败究竟反映了检测这些陷阱所需常识性知识的真正缺失,还是仅仅是在误导性、充满计算的框架下被抑制?回答这个问题需要一个既能大规模可靠诱发该偏差、又能将识别与规避相分离的基准测试,然而现有基准均非为此目的而设计。因此,我们构建了 SaliTrap 基准,通过大语言模型辅助合成与严格的求解器-裁判实证验证流程生成,将物理上不可能的前提嵌入充满计算的自然语言查询中,涵盖四个陷阱维度:前提缺失、环境错配、时间/生理违背以及规则错配。
我们评估了 12 个最先进的大语言模型,发现所有当前主流模型都显著受到显著性偏差的影响,其抵抗力与通用推理能力紧密相关;即使能够识别陷阱的模型也经常仍然遵从之,这揭示了识别与规避是两条不同的失败轴,其严重程度随干扰项密度而扩大,并按模型来源聚类分布。
关键在于,我们进一步证明,这种普遍存在的失败并非表面看起来那样。通过从刚刚失败的同一批模型中重新引导出“陷阱知识”——这次剥离了误导性的任务框架——我们挽回了其中绝大多数失败,证明大语言模型本质上具备对抗显著性偏差所需的常识性知识。换言之,这种偏差是“引导失败”而非“能力缺失”:显性显著条件的过度影响主动压制了模型本已具备的知识,而非反映该知识的缺失。
总而言之,我们做出了四项关键贡献:
(一)我们识别并形式化了显著性偏差,证明大语言模型对显性干扰项的过度依赖会导致其忽视隐含的常识性前提条件。
(二)我们贡献了 SaliTrap 基准,合成了一个涵盖四个维度、共 1,145 个任务的高质量数据集,用以稳健地评估显著性偏差,并将“陷阱检测”与“陷阱规避”加以区分。
(三)我们对 12 个大语言模型进行了全面评估,揭示出显著性偏差具有普遍性,与模型能力相关,并沿干扰项密度和模型来源呈现出结构性分布。
(四)通过知识重新引导和轻量级提示词干预,我们证明显著性偏差本质上是一种“知识抑制”失败,并指出“引导”是未来工作中可操作的关键瓶颈。
相关工作
在本节中,我们首先回顾大语言模型推理背后的核心技术,随后对当代大语言模型推理基准进行全面综述。
大语言模型推理技术
大语言模型的推理能力推动了语言智能领域的发展,在解决复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编程任务(Jimenez et al. 2024; Zhang et al. 2024)方面做出了重大贡献。早期研究主要依赖链式推理(CoT)(Wei et al. 2022; Kojima et al. 2022)提示词,通过精心设计的结构化范式(如线性、树状(Yao et al. 2023)和图状(Besta et al. 2024)拓扑结构)来提升推理性能。近期,随着群体相对策略优化(Shao et al. 2024)和同策略知识蒸馏(Agarwal et al. 2024)技术的成熟,大语言模型推理通过设计稳健的奖励机制或直接从更优的教师模型中蒸馏知识而得到了进一步提升。然而,尽管这些算法突破增强了模型利用上下文条件的能力,它们也引入了一个关键且不可忽视的挑战:显著性偏差。
大语言模型推理基准
大语言模型推理能力的进步,在很大程度上得益于那些对模型能力不同侧面提出越来越严苛要求的基准测试——从数学问题求解(Cobbe 等,2021;Hendrycks 等,2021)、多步科学问答(Rein 等,2024),到仓库级代码生成(Jimenez 等,2024)、长时程工具使用规划(Qin 等,2024),以及覆盖面广泛的综合能力套件(Srivastava 等,2023)。随着模型在这些以准确率为导向的基准上逐渐趋于饱和,另一条互补的研究路线将注意力转向了鲁棒性和忠实性,揭示了强基准表现往往与模型在表层输入扰动下的脆弱性并存(Mirzadeh 等,2024;Wang 等,2023),或者与那些虽然得出正确答案但逻辑上不一致的推理链并存(Turpin 等,2023)。与我们的工作最密切相关的是,多项基准测试表明,大语言模型倾向于谄媚式地顺从查询中嵌入的有缺陷或无法回答的前提,而不是对其提出质疑(Sharma 等,2024;Li 等,2024;Perez 等,2023;Kadavath 等,2022),这与更广泛的证据相呼应——模型往往优先关注表面的显著线索,而非更深层次的任务有效性(Shi 等,2023;Liu 等,2024)。然而,现有的前提鲁棒性基准大多针对静态的事实或逻辑不一致,尚未回答模型能否抵御被大量计算性干扰项所掩盖的物理上不可能的前提。
SaliTrap 基准
在本节中,我们定义任务形式与良构性标准,提出一个四维陷阱分类体系,并详细阐述三阶段构建流水线。
任务定义
我们研究大语言模型能否识别嵌入在富含计算的自然语言查询中的物理上不可能的前提。如图 2 所示,每个基准测试项都是一个元组
| x=(𝒫,𝒯,𝒢,𝐧,d), | (1) |
其中 是自然语言提示词, 是陷阱核心(对物理不可能性的陈述句), 是标准答案解释, 是嵌入在 中用于诱发虚假计算的一组数值干扰项, 是陷阱维度。𝒫𝒯𝒢𝐧={n1,…,nk}⊂ℝ𝒫d∈𝒟
如果 满足三个条件,则称其为良构的:(i) 在常识下是物理上不可能的。(ii)任何对 的正确回答都必须承认 中的不可能性,且不存在可以独立回答的外围子任务。我们将违反(ii)的情况称为子任务逃逸。(iii) 使提示词与合法的规划或优化查询无法区分。对良构项的正确回答应识别出 ,且不包含任何基于 成立的可执行计划或数值计算。x𝒯𝒫𝒯𝐧𝒯𝒯
陷阱分类体系
各项按四个陷阱维度 进行组织,每个维度对应一类不同的物理或常识性违背。(缺失前提):工具缺乏所需的物理属性(例如,用漏勺盛液态水)。(环境不匹配):部署环境使工具失效(例如,在 50 米深处点燃打火机;在加油站为纯电动汽车加油)。(时间/生理违背):行为违反因果律或错误归因生物能力(例如,今天买伞来阻止昨天下雨;在人胃内烹饪生食)。(规则错配):将视觉上相似的替代物呈现为所需实体,而目标系统会拒绝该替代物(例如,将钞票照片当作法定货币)。𝒟={D1,D2,D3,D4}D1D2D3D4
基准构建
如图 3 所示,SaliTrap 的构建分为三个阶段:(i)种子生成与扩展,(ii)候选验证,以及(iii)迭代优化。
阶段 1:种子生成与扩展
我们通过专家标注设计了一组原型种子,从构造上满足条件(i)至(iii)。每个种子都带有一个维度标签和两个辅助提示,通过指定哪些表面特征必须保留、哪些应避免,来约束下游的自动化合成。少量原型种子不足以进行统计上可靠的评估。我们使用生成流水线对种子进行扩展,将目标均匀分布到各个维度。每个维度按小型微批次处理。维度 的批次生成提示词为𝒮0si=(𝒫i(0),𝒯i,𝒢i,𝐧i,di)di∈𝒟bd
| Φd,b=[def(d),fewshot(𝒮0,d),dir(d,b),excl(𝒮^<b)], | (2) |
其中, 用于检索维度标签等于 的原型种子子集,作为上下文示例; 是批次特定的生成指令,引导该批次走向维度 内代表性不足的工具/场景细分领域(例如, 尚未覆盖的某种独特仪器或环境),从而使连续的微批次在维度内扩展覆盖范围,而不是重复采样同一邻近区域; 则注入一份按时间倒序截断的已接受种子列表,从源头抑制近似重复项。fewshot(𝒮0,d)ddir(d,b)bd𝒮^<bexcl(𝒮^<b)
每个生成的候选种子在通过验收前,都要经过四层去重级联。 会拒绝任何场景名称与现有名称注册表 中条目完全匹配的候选。 和 会拒绝提示词或陷阱核心与任何已接受种子过于相似的候选,相似度通过归一化文本(去除空白、数字替换为占位符)上的字符级 Jaccard 相似度来衡量。 会拒绝(工具、对象、动作)实体三元组已出现在已接受集合 中的候选。已接受的种子会被追加到 中,并反馈到后续批次的排除列表中,形成闭环的多样性循环。s^f1𝒩f2f3J(a,b)=|a∩b|/|a∪b|ϕ(⋅)f4τ(s^)ℰ𝒮^
阶段 2:候选验证
对于每个种子 ,候选合成流水线会生成并实证验证题目,维护一个按种子划分的候选注册表,初始时包含一个候选,其提示词直接设为种子自身的初始提示词 ;该候选与之后生成的每个候选一样,都通过相同的三重检查器和求解器评判流水线进行评估。s∈𝒮^c0𝒫c0=𝒫i(0)c0
三重检查器评估。
三个 LLM 检查器对每个候选 进行评估:c
| Tr(c) | =TruthChecker(𝒫c,𝒯s)∈{0,1}, | (3) | ||
| Al(c) | =AlignChecker(𝒫c,𝒯s,𝒢s)∈{0,1}2, | (4) | ||
| ν(c) | =NatChecker(𝒫c)∈[1,5]. | (5) |
Al(c)=(valid,no-escape);两个组件都必须等于 1。未通过真实性或对齐检查的候选样本会被立即归档。通过检查的候选样本会连同其自然度评分一起被转发。ν(c)
求解器-评判模型评估。
具有足够自然度的可行候选样本会进入实证测试阶段。一个强推理模型(求解器)尝试解题;随后一个评判模型为其分配六种行为标签之一:(1)硬失败:未察觉陷阱,任务被完整执行;(2)思维链被劫持:仅在数值运算后才识别出陷阱;(3)迎合性服从:承认陷阱但仍完成任务;(4)严格通过:立即给出理由充分的拒绝;(5)补丁式合规:通过重新框定不可能性来绕过陷阱;(6)机械式拒绝:拒绝任务但未展示理解。我们将强失败(标签 1–2)和全部失败(标签 1–3)分别进行标注。ℳS𝒫cℳJℒℒ++ℒ+
路由。
评判模型的标签与自然度评分共同决定每个候选样本的路由决策。带有失败标签( )且同时达到高自然度阈值的候选样本将被认证进入最终数据集。带有失败标签但低于该阈值的候选样本将进入重写队列,该队列在保留陷阱核心的同时降低人为痕迹。被标记为严格通过且自然度达到或超过较低阈值的候选样本将接受加深伪装的改写,因为陷阱被识别得过于容易。ℒ+
第三阶段:迭代优化
未通过认证的候选样本会落入两种结构上截然不同的缺陷类型——要么隐藏得很好但属于人为构造,要么天然存在但过于容易被识破——因此重写模型会根据具体情况设定相应目标,分别施加保持自然度、加深伪装,或(针对从未到达求解器的候选样本)修复流畅度的重写操作。由于重写过程可能偏离种子样本原本的语义意图,每个子样本只有在合规性检查确认其相对于父样本保留了陷阱核心、所有干扰项以及不存在子任务逃逸时才会被接纳;违规者直接丢弃。被接纳的子样本重新进入第二阶段循环,每个分支在改进连续有限轮次停滞不前时终止,同时一个高温生成器会定期注入方差更大的变异,以避免坍缩到初始候选样本的狭窄邻域内。ℳWc′κ(c,c′,𝒯s)𝐧scℳG
由于自然度、失败严重性和对齐性各自都不足以作为独立的筛选标准,我们对每个通过认证的候选样本进行综合评分,该评分奖励失败严重性、自然度和已确认的对齐性,并扣除子任务逃逸、近似重复和过长篇幅的分数,最终为每个种子样本保留得分最高的前 k 个候选作为基准测试的最终条目。cscore(c)wℓ(c)ν(c)kk=5
| 模型 | 前置条件 | 环境 | 时间 | 规则 | 总体 | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| TAR↑ | HFR↓ | TAR↑ | HFR↓ | TAR↑ | HFR↓ | TAR↑ | HFR↓ | TAR↑ | HFR↓ | |
| Claude-Opus-4.7 | 30.3 | 45.1 | 45.7 | 36.6 | 62.5 | 28.6 | 63.1 | 25.2 | 54.8 | 31.1 |
| GPT-5.5 | 52.8 | 27.2 | 39.0 | 32.3 | 42.9 | 37.2 | 46.4 | 31.5 | 45.5 | 32.4 |
| Claude-Opus-4.6 | 27.2 | 51.3 | 37.8 | 43.9 | 48.8 | 40.2 | 51.1 | 36.7 | 44.5 | 41.1 |
| GPT-5.4 | 36.9 | 41.0 | 32.9 | 40.2 | 41.9 | 40.2 | 45.4 | 32.6 | 41.2 | 37.1 |
| DeepSeek-R1 | 19.5 | 61.5 | 19.5 | 59.8 | 27.6 | 56.1 | 24.7 | 61.2 | 23.8 | 59.7 |
| Gemini-2.5-Pro | 25.1 | 40.0 | 25.6 | 50.0 | 30.2 | 51.5 | 27.8 | 51.8 | 27.7 | 49.4 |
| GLM-5.1 | 24.1 | 30.3 | 21.3 | 31.7 | 32.2 | 25.9 | 27.0 | 28.7 | 27.1 | 28.6 |
| Kimi-K2 | 13.8 | 46.2 | 19.5 | 32.9 | 22.9 | 35.2 | 30.1 | 26.8 | 23.9 | 33.2 |
| Doubao-Seed-2.0 | 9.7 | 65.6 | 10.4 | 65.9 | 23.3 | 58.5 | 20.6 | 56.7 | 18.0 | 60.0 |
| DeepSeek-V4-Pro | 9.2 | 56.4 | 10.4 | 47.0 | 19.3 | 54.5 | 14.8 | 49.9 | 14.4 | 51.8 |
| DeepSeek-V4-Flash | 6.2 | 69.7 | 5.5 | 65.9 | 17.6 | 56.1 | 13.2 | 55.9 | 12.1 | 59.7 |
| MiniMax-M2.7 | 6.2 | 63.1 | 6.7 | 68.9 | 8.0 | 54.5 | 11.1 | 56.7 | 8.8 | 59.0 |
| 模型 | 前置条件 | 环境 | 时间 | 规则 | 总体 | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| SCR↓ | SI↓ | SCR↓ | SI↓ | SCR↓ | SI↓ | SCR↓ | SI↓ | SCR↓ | SI↓ | |
| Claude-Opus-4.7 | 22.6 | 51.2 | 17.7 | 69.0 | 8.6 | 41.9 | 11.5 | 54.9 | 13.5 | 53.1 |
| GPT-5.5 | 19.5 | 59.4 | 28.0 | 83.6 | 19.9 | 65.2 | 21.6 | 68.2 | 21.7 | 68.2 |
| Claude-Opus-4.6 | 20.5 | 46.0 | 17.7 | 64.4 | 10.3 | 50.8 | 10.5 | 50.0 | 13.2 | 51.2 |
| GPT-5.4 | 21.5 | 60.9 | 26.2 | 84.3 | 17.9 | 63.5 | 21.2 | 73.6 | 21.1 | 70.1 |
| DeepSeek-R1 | 17.9 | 41.7 | 20.1 | 60.0 | 16.3 | 45.0 | 13.8 | 49.6 | 16.1 | 48.0 |
| Gemini-2.5-Pro | 34.9 | 72.3 | 24.4 | 78.4 | 18.3 | 68.8 | 20.4 | 61.1 | 22.9 | 67.7 |
| GLM-5.1 | 45.6 | 80.9 | 47.0 | 95.1 | 41.5 | 89.3 | 43.9 | 83.9 | 44.0 | 86.2 |
| Kimi-K2 | 39.5 | 68.8 | 47.0 | 84.6 | 41.9 | 78.8 | 42.5 | 89.2 | 42.4 | 81.8 |
| Doubao-Seed-2.0 | 24.6 | 53.3 | 23.8 | 76.5 | 18.3 | 65.5 | 22.3 | 64.7 | 21.8 | 63.8 |
| DeepSeek-V4-Pro | 32.8 | 72.7 | 42.1 | 82.1 | 25.9 | 69.0 | 34.8 | 84.1 | 33.2 | 78.2 |
| DeepSeek-V4-Flash | 23.6 | 46.9 | 28.7 | 62.7 | 25.9 | 68.4 | 30.3 | 77.8 | 27.8 | 66.8 |
| MiniMax-M2.7 | 26.2 | 55.4 | 20.1 | 64.7 | 26.6 | 71.4 | 22.5 | 69.9 | 23.8 | 66.4 |
实验
实验设置
评估指标
最终的 SaliTrap 基准测试包含分布在四个陷阱维度上的条目。以 表示数据集中的总条目数,我们使用四个关键指标评估模型,这些指标基于两个不同的分母计算。在整个数据集上():TAR(陷阱规避率,%)衡量模型正确识别不可行前提并拒绝执行任务的查询比例;HFR(硬失败率,%)衡量模型在未对前提提出任何质疑的情况下进行完整计算的查询比例;SCR(谄媚遵从率,%)衡量模型识别出陷阱但仍遵从不可行请求的查询比例。在陷阱感知子集上(谄媚遵从思维链劫持,排除从未表现出陷阱意识的硬失败案例):SI(谄媚指数,%)是在具备陷阱意识条件下的遵从率,即 。这种条件化处理很重要:用 作为分母归一化会将知识缺失与谄媚抑制混为一谈,使很少检测到陷阱的弱模型获得虚假偏低的 SI。将分母限制为陷阱感知响应,则衡量的是模型在本可拒绝时却选择遵从的频率。N=1,145NN↑↓↓∪↓SI=SC/(SC+CoT)N
评估模型
我们评估了 12 个最先进的大语言模型:Claude-Opus-4.7(Anthropic 2026b)、Claude-Opus-4.6(Anthropic 2026a)、GPT-5.5(OpenAI 2026b)、GPT-5.4(OpenAI 2026a)、Gemini-2.5-Pro(Comanici 等人 2025)、DeepSeek-R1(Guo 等人 2025)、DeepSeek-V4-Pro、DeepSeek-V4-Flash(Xu 等人 2026)、GLM-5.1(Zeng 等人 2026)、Kimi-K2(Team 等人 2025)、豆包-Seed-2.0(ByteDance Seed 2026)以及 MiniMax-M2.7(Chen 等人 2026)。所有模型均在零样本设置下进行评估,不进行任何任务特定的微调或提示词工程,以确保跨模型的公平比较。对于基准测试构建流程本身,评判模型和改写/生成模型(,)均使用 Claude-Opus-4.7 实例化,而求解器则是由四个强推理模型组成的轮询池:Claude-Opus-4.7、GPT-5.5、DeepSeek-R1 和 Gemini-2.5-Pro。ℳJℳWℳGℳS
主要结果
表 1 显示,显著性偏差是所有 12 个被评估大语言模型中普遍存在且严重的失败模式:即使是最强的模型 Claude-Opus-4.7,也仅在 54.8% 的查询中避开了这一陷阱,而大多数模型的成功率远低于 30%。整体性能与推理能力密切相关。TAR 排名靠前的模型同时也是最强大的通用推理器,而通用推理能力明显较弱的模型则表现出最高的 HFR,超过 59%。这表明,抵抗显著性偏差并非一项孤立的技能,而是与模型整体进行审慎、基于前提检查的推理能力紧密交织在一起,而非立即投入表面层面的计算。
表 2 揭示了第二个正交的失败维度:即使模型成功检测到了陷阱,它们也常常仍然选择遵从用户请求。GLM-5.1 和 Kimi-K2 的 SI 最高,这意味着在它们罕见地察觉到异常的情况下,它们仍有超过 80% 的时间会继续满足用户的请求,尽管它们在原始 TAR 上仅排名中等。这使检测与行动脱钩:一个模型可能对陷阱有中等程度的感知,却几乎从不据此采取行动,这是仅凭原始 TAR/HFR 无法揭示的。
对逐维度细分的进一步观察显示出一致的难度排序:缺失前提条件一致性地是最难检测的维度,而规则不匹配则是最容易的。这一差距是直观的:缺失前提条件的陷阱要求对提示词中从未明确否定的物理属性进行推理,而规则不匹配的陷阱则依赖于一个在词汇上更显著、因此更容易浮现出来的范畴性区分。
进一步分析
基于项目反应理论的题目难度分析
为了将题目固有难度与模型能力分离开来,我们在全部 12 个模型在所有题目上的二元“严格通过”结果上拟合了一个单参数逻辑斯蒂项目反应理论模型,联合估计了每个模型的能力参数和每道题的难度参数。如图 4(a)-(b) 所示,缺失前置条件和环境不匹配这两类的分布明显右移,且平均难度高于时间/生理违背和规则不匹配,这证实了在控制测试模型之后,表 1 中的维度差异依然存在。图 4(c) 进一步表明,估计出的能力值所恢复的排序与原始 TAR 排序高度一致,从排名最高的 Claude-Opus-4.7 到排名最低的 MiniMax-M2.7,这证实了 TAR 是对陷阱抵抗能力的一种忠实、低噪声的概括。θββθ
共失败分析
为了理解模型的失败方式是共性的还是各自特有的,我们计算了每对模型失败集合之间的两两 Jaccard 相似度,并将所得结构以树状图形式可视化(图 5)。树状图将模型分为一个中文集群和一个西方集群:在前者中,较弱的开源权重模型之间的重叠度最高,这表明在低于某个能力阈值时,模型会收敛到大致相同的失败子集,而非各自特有地失败;在后者中,Claude-Opus-4.7 始终与所有其他模型的相似度最低,使其成为该集合中最具独特性的失败模式。这表明共失败同时受能力阈值和训练来源的影响,不同的训练配方会引发针对显著性偏差的、性质上不同而不仅仅是规模更小的盲区。ℒ+
数值干扰项密度
绘制TAR(陷阱规避率)和CoT劫持率(12个模型的平均值)与注入的数字干扰项数量之间的关系,可以揭示出清晰的单调趋势,且在每个陷阱维度内都保持一致:随着干扰项数量的增加,TAR下降,CoT劫持率上升(图6)。这支持了我们的假设——显著性偏差不仅由数字干扰项的存在触发,更由其密度决定,这使得对抗性密集提示词尤为危险。|𝐧||𝐧|
谄媚顺从是知识抑制还是知识缺失?
表2中被标记为SC的模型已识别出陷阱但仍选择顺从,但仅凭这一点无法判断底层物理知识是被谄媚真正抑制了,还是过于薄弱而无法在重新引导下存活。为厘清这一点,我们在三种去偏提示词下(条件A:软可行性提示;条件B:明确陷阱揭示;条件C:无上下文知识探测)重新查询了四个代表性模型(Claude-4.6、GLM-5.1、Kimi-K2、DeepSeek-R1)中的每一个SC实例,并重新判定响应,将解放率定义为每种条件下从原SC案例转为严格通过的占比。如图7所示,解放率在各模型间均高得惊人:四个模型中有三个在全部三种条件下解放率超过90%,即便是无上下文的条件C单独也能恢复超过90%的SC案例。这表明SC绝大多数是部署层面的失败而非知识层面的缺失:相关常识已经存在,一旦移除诱导性的任务框架就能浮现出来,这意味着轻量级的推理时干预可能足以恢复大部分丢失的陷阱规避行为,而无需重新训练。
提示词能否修复显著性偏差?
基于“解放性发现”——即与陷阱相关的知识在很大程度上仍然完好——我们测试了在推理时应用、无需微调的单条系统级提示前缀,是否能在规模化层面弥合显著性偏差差距。我们在完整基准上对横跨能力谱系的三个模型评估了三条干预提示:P1(物理感知启动,指示模型首先验证任务可行性)、P2(强制思维链前提检查,要求在进行下一步之前给出明确的可行性判定)以及 P3(反事实警告,提示词可能包含不可行的前提)。图 8 显示,对于每个模型,所有三种干预措施都显著提升了 TAR(陷阱识别率),超过了未加指令的对照组,且提升幅度最大的地方恰恰是基线最薄弱的环节。P1 始终是最有效的干预措施,P2 效果最弱——尽管 P2 在结构上最明确地强制要求给出可行性判定;我们将此归因于 P2 僵化的逐步格式有时会引出敷衍了事的可行性陈述,而模型实际上并未基于该陈述来约束其后续推理,相比之下,P1 开放式检查更能保留模型自身朝向前提审视的推理轨迹。这些结果表明,尽管显著性偏差在朴素提示下普遍存在,但仅靠轻量级提示工程就能在很大程度上加以纠正,这进一步印证了瓶颈在于引导(elicitation)环节。
结论
我们识别出显著性偏差——一种普遍存在的大语言模型缺陷,导致模型优先处理显著的显式条件,而忽视隐含的常识性前提——并引入 SaliTrap,这是一个包含物理上不可能前提的基准,这些前提被充满计算量的干扰项所伪装,涵盖四个陷阱维度。通过对 12 个最先进的大语言模型进行评估,我们发现所有模型都明显易受此影响,且失败率随着干扰项密度的增加而急剧上升。进一步分析表明,这种脆弱性源于常识性知识的抑制而非缺失,并且轻量级提示可以在很大程度上恢复该能力。我们希望 SaliTrap 能推动未来研究,使大语言模型能够可靠地关注隐含的任务关键条件。
参考文献
- R. Agarwal、N. Vieillard、Y. Zhou、P. Stanczyk、S. Ramos Garea、M. Geist 和 O. Bachem(2024)《语言模型的同策略蒸馏:从自我生成的错误中学习》。载于《国际学习表征会议》,2024 年第 2024 卷,第 21246–21263 页。引用来源:LLM 推理技术。
- Anthropic(2026a)《推出 Claude Opus 4.6》。注:https://www.anthropic.com/news/claude-opus-4-6 引用来源:受评模型。
- Anthropic(2026b)《推出 Claude Opus 4.7》。注:https://www.anthropic.com/news/claude-opus-4-7 引用来源:受评模型。
- M. Besta、N. Blach、A. Kubicek、R. Gerstenberger、M. Podstawski、L. Gianinazzi、J. Gajda、T. Lehmann、H. Niewiadomski、P. Nyczyk 等人(2024)《思维图:用大语言模型解决复杂问题》。载于《AAAI 人工智能会议论文集》,第 38 卷,第 17682–17690 页。引用来源:LLM 推理技术。
- 字节跳动 Seed(2026)《Seed2.0》。注:https://seed.bytedance.com/en/seed2 引用来源:受评模型。
- A. Chen、A. Li、B. Zhou、B. Gong、B. Jiang、B. Dan、C. Yu、C. Wang、C. Ma、C. Zhong 等人(2026)《MiniMax-M2 系列:极小激活释放极致真实世界智能》。arXiv 预印本 arXiv:2605.26494。引用来源:受评模型。
- T. Chu、Y. Zhai、J. Yang、S. Tong、S. Xie、D. Schuurmans、Q. V. Le、S. Levine 和 Y. Ma(2025)《SFT 靠记忆,RL 靠泛化:基础模型后训练的对比研究》。载于《国际机器学习会议》,第 10818–10838 页。引用来源:引言。
- K. Cobbe、V. Kosaraju、M. Bavarian、M. Chen、H. Jun、L. Kaiser、M. Plappert、J. Tworek、J. Hilton、R. Nakano 等人(2021)《训练验证器解决数学应用题》。arXiv 预印本 arXiv:2110.14168。引用来源:LLM 推理基准。
- G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人(2025)《Gemini 2.5:以先进推理、多模态、长上下文和下一代智能体能力推动前沿》。arXiv 预印本 arXiv:2507.06261。引用来源:受评模型。
- D. Guo、D. Yang、H. Zhang、J. Song、P. Wang、Q. Zhu、R. Xu、R. Zhang、S. Ma、X. Bi 等人(2025)《DeepSeek-R1:通过强化学习激励大语言模型的推理能力》。arXiv 预印本 arXiv:2501.12948。被引用:评估模型。
- D. Hendrycks、C. Burns、S. Kadavath、A. Arora、S. Basart、E. Tang、D. Song 和 J. Steinhardt(2021)《使用 MATH 数据集衡量数学问题求解能力》。arXiv 预印本 arXiv:2103.03874。被引用:大语言模型推理基准。
- C. E. Jimenez、J. Yang、A. Wettig、S. Yao、K. Pei、O. Press 和 K. Narasimhan(2024)《SWE-bench:语言模型能否解决真实的 GitHub 问题?》。发表于国际学习表征会议(ICLR),第 2024 卷,第 54107–54157 页。被引用:引言、大语言模型推理技术、大语言模型推理基准。
- S. Kadavath、T. Conerly、A. Askell、T. Henighan、D. Drain、E. Perez、N. Schiefer、Z. Hatfield-Dodds、N. DasSarma、E. Tran-Johnson 等人(2022)《语言模型(大多)知道它们知道什么》。arXiv 预印本 arXiv:2207.05221。被引用:大语言模型推理基准。
- T. Kojima、S. S. Gu、M. Reid、Y. Matsuo 和 Y. Iwasawa(2022)《大语言模型是零样本推理者》。神经信息处理系统进展(NeurIPS)第 35 卷,第 22199–22213 页。被引用:大语言模型推理技术。
- M. Li、W. Wang、F. Feng、F. Zhu、Q. Wang 和 T. Chua(2024)《信任前先三思:通过全面答案反思实现大语言模型的自我检测》。计算语言学协会年会发现卷:EMNLP。被引用:大语言模型推理基准。
- N. F. Liu、K. Lin、J. Hewitt、A. Paranjape、M. Bevilacqua、F. Petroni 和 P. Liang(2024)《迷失在中间:语言模型如何使用长上下文》。计算语言学协会汇刊第 12 卷,第 157–173 页。被引用:大语言模型推理基准。
- P. Liu、W. Yuan、J. Fu、Z. Jiang、H. Hayashi 和 G. Neubig(2023)《预训练、提示与预测:自然语言处理中提示方法的系统综述》。ACM 计算调查 55(9),第 1–35 页。被引用:引言。
- I. Mirzadeh、K. Alizadeh、H. Shahrokhi、O. Tuzel、S. Bengio 和 M. Farajtabar(2024)《GSM-Symbolic:理解大语言模型在数学推理中的局限性》。arXiv 预印本 arXiv:2410.05229。引用自:LLM 推理基准。
- OpenAI(2026a)《推出 GPT-5.4》。注:https://openai.com/index/introducing-gpt-5-4/ 引用自:受评估模型。
- OpenAI(2026b)《推出 GPT-5.5》。注:https://openai.com/index/introducing-gpt-5-5/ 引用自:受评估模型。
- E. Perez、S. Ringer、K. Lukošiūtė、K. Nguyen、E. Chen、S. Heiner、C. Pettit、C. Olsson、S. Kundu、S. Kadavath 等人(2023)《通过模型撰写的评估发现语言模型行为》。计算语言学协会年会论文集:ACL。引用自:LLM 推理基准。
- Y. Qin、S. Liang、Y. Ye、K. Zhu、L. Yan、Y. Lu、Y. Lin、X. Cong、X. Tang、B. Qian 等人(2024)《ToolLLM:帮助大语言模型掌握 16000+ 个真实世界 API》。发表于国际学习表征会议,2024 年卷,第 9695–9717 页。引用自:引言、LLM 推理技术、LLM 推理基准。
- D. Rein、B. L. Hou、A. C. Stickland、J. Petty、R. Y. Pang、J. Dirani、J. Michael 和 S. R. Bowman(2024)《GPQA:一个研究生级别的“谷歌也搜不到答案”的问答基准》。引用自:LLM 推理基准。
- Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《DeepSeekMath:推动开源语言模型数学推理的极限》。arXiv 预印本 arXiv:2402.03300。引用自:引言、LLM 推理技术。
- M. Sharma、M. Tong、T. Korbak、D. Duvenaud、A. Askell、S. R. Bowman、N. Cheng、E. Durmus、Z. Hatfield-Dodds、S. R. Johnston 等人(2024)《理解语言模型中的谄媚行为》。国际学习表征会议。引用自:LLM 推理基准。
- F. Shi、X. Chen、K. Misra、N. Scales、D. Dohan、E. H. Chi、N. Schärli 和 D. Zhou(2023)《大语言模型容易被无关上下文干扰》。国际机器学习会议,第 31210–31227 页。引用自:LLM 推理基准。
- A. Srivastava, A. Rastogi, A. Rao, A. A. M. Shoeb, A. Abid, A. Fisch, A. R. Brown, A. Santoro, A. Gupta, A. Garriga-Alonso 等人(2023)《超越模仿游戏:量化并外推语言模型的能力》。Transactions on Machine Learning Research。被引用:LLM 推理基准。
- F. Tang, H. Xu, H. Zhang, S. Chen, X. Wu, Y. Shen, W. Zhang, G. Hou, Z. Tan, Y. Yan 等人(2025)《关于(多模态)大语言模型 GUI 智能体的综述》。arXiv 预印本 arXiv:2504.13865。被引用:引言、LLM 推理技术。
- K. Team, Y. Bai, Y. Bao, Y. Charles, C. Chen, G. Chen, H. Chen, H. Chen, J. Chen, N. Chen 等人(2025)《Kimi K2:开放智能体智能》。arXiv 预印本 arXiv:2507.20534。被引用:评估模型。
- M. Turpin, J. Michael, E. Perez 和 S. R. Bowman(2023)《语言模型并不总是说出它们的真实想法:思维链提示中的不忠实解释》。Advances in Neural Information Processing Systems 36。被引用:LLM 推理基准。
- J. Wang, X. Hu, W. Hou, H. Chen, R. Zheng, Y. Wang, L. Yang, H. Huang, W. Ye, X. Geng 等人(2023)《论 ChatGPT 的鲁棒性:对抗性与分布外视角》。arXiv 预印本 arXiv:2302.12095。被引用:LLM 推理基准。
- J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou 等人(2022)《思维链提示激发大语言模型的推理能力》。Advances in Neural Information Processing Systems 35,第 24824–24837 页。被引用:引言、LLM 推理技术。
- A. Xu, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, C. Ling 等人(2026)《DeepSeek-V4:迈向高效百万级 token 上下文智能》。arXiv 预印本 arXiv:2606.19348。被引用:评估模型。
- S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao 和 K. Narasimhan(2023)《思维树:用大语言模型进行深思熟虑的问题求解》。Advances in Neural Information Processing Systems 36,第 11809–11822 页。被引用:LLM 推理技术。
- A. Zeng、X. Lv、Z. Hou、Z. Du、Q. Zheng、B. Chen、D. Yin、C. Ge、C. Huang、C. Xie 等人(2026)《Glm-5:从氛围编程到智能体工程》。arXiv 预印本 arXiv:2602.15763。被引用:评估模型。
- K. Zhang、J. Li、G. Li、X. Shi 和 Z. Jin(2024)《Codeagent:利用工具集成智能体系统增强代码生成,应对真实世界仓库级编码挑战》。载于《第 62 届计算语言学协会年会论文集》(第 1 卷:长文),第 13643–13658 页。被引用:引言、LLM 推理技术。
- Z. Zhang、Y. Yao、A. Zhang、X. Tang、X. Ma、Z. He、Y. Wang、M. Gerstein、R. Wang、G. Liu 等人(2025)《点燃语言智能:从链式推理到语言智能体的漫游指南》。ACM Computing Surveys 57(8),第 1–39 页。被引用:引言、LLM 推理技术。
附录 A SaliTrap 数据集
条目结构
SaliTrap 中的每个条目都以 JSON 记录形式存储,包含以下字段,直接对应主论文中定义的元组:x=(𝒫,𝒯,𝒢,𝐧,d)
-
item_id —— 唯一的候选标识符。
-
seed_id —— 合成该条目所依据的原型种子(多个已认证条目可共享同一个种子)。
-
prompt()—— 呈现给被评估模型的完整自然语言查询。𝒫
-
trap_core()—— 对物理不可能性的单句陈述性表述,既用于条目编写,也用作 Cond-C 知识引出实验中的独立探针。𝒯
-
ground_truth()—— 评判模型用于对回答进行评分的参考解释。𝒢
-
injected_numbers()—— 嵌入在 中的数值干扰项列表。𝐧𝒫
-
dimension_tag()—— 四个陷阱维度之一(缺失前提、环境不匹配、时间/生理违反、规则不匹配)。d
-
naturalness_score —— 自然度检查器评分的平均值(1–5 分制)。
-
attack_tier —— 强或弱,表示该已认证候选在第二阶段验证中引发的是强失败(即硬失败或思维链劫持)还是较温和的失败(迎合性顺从)。ℒ++
数据集统计
表 3 报告了最终经认证的 1,145 条目基准中每个维度的条目数量以及注入的数值干扰项的分布情况。
| 维度 | 条目数 | 平均值|𝐧| | 自然度 |
|---|---|---|---|
| 缺失前置条件 | 195 | 6.9 | 3.9 |
| 环境不匹配 | 164 | 6.6 | 3.9 |
| 时间/生理因素 | 301 | 5.4 | 4.0 |
| 规则不匹配 | 485 | 5.9 | 4.0 |
| 总体 | 1,145 | 6.0 | 4.0 |
许可、获取与预期用途
SaliTrap 将在论文发表后立即公开发布,同时附带全部评估与分析代码,以便复现实验并推动关于大语言模型提示阶段(elicitation-time)失败机制的后续研究。该数据集仅包含关于日常物理任务的合成式自然语言查询;不包含任何个人、隐私或其他敏感信息,也不针对任何个人、组织或受保护群体。未收集任何人类受试者数据。
附录 B 基准测试构建流程
本节详细记录主论文(图 2)中概述的三阶段完整流程,并给出每个基于大语言模型的组件所使用的精确提示词模板。以下所有提示词均为了可读性做了轻微改写,但保留了发布代码中使用的确切指令、约束条件和输出格式。
阶段 1:种子生成与规模化扩展
四个陷阱维度中的每一个都先用少量专家撰写的原型种子进行初始化,然后通过微批次生成进行规模化扩展。规模化生成器接收维度定义、来自 的少样本示例、一条将覆盖范围导向代表性不足的工具/场景细分领域的批次特定指令,以及一份按时间倒序截断的已接受种子排除列表。𝒮0
阶段 2:候选验证
每个种子的候选注册表首先初始化一个与种子自身提示词完全相同的零号候选;后续候选由高温度参数的对抗性生成器产生,并在接受求解器-评判器循环测试之前通过三重检查器级联。
阶段 3:迭代优化
未通过认证的候选样本会根据其失败模式被分流至三种改写目标之一:保持自然度的改写(陷阱隐藏得很好,但读起来显得生硬)、加深伪装的改写(陷阱自然,但过于容易被识破,即高自然度下的严格通过),或流畅性修复改写(候选样本因格式错误而从未到达求解器)。
稳定性认证
在进入最终基准测试之前,每个通过认证的候选样本还需接受额外的稳定性复测:在相同的解码设置下,求解器-评判器循环重复运行 5 次,只有当候选样本在 5 次重复中的多数评判标签与其原始认证标签一致时,该候选样本才会被保留(其中 {硬失败、思维链劫持} 被视为“强攻击”标签组,而谄媚顺从 / 补丁顺从则被视为较温和的次级攻击标签)。此举旨在防止单次生成噪声导致报告失败率虚高。
附录 C 实验细节
模型访问与计算基础设施
所有 12 个被评估的大语言模型(Claude-Opus-4.7、Claude-Opus-4.6、GPT-5.5、GPT-5.4、Gemini-2.5-Pro、DeepSeek-R1、DeepSeek-V4-Pro、DeepSeek-V4-Flash、GLM-5.1、Kimi-K2、豆包-Seed-2.0 和 MiniMax-M2.7)均仅通过其官方托管的聊天补全 API 访问,并使用各提供商推荐的默认采样设置,下文另有说明的除外。没有任何模型是本地托管、微调或以其他方式修改的;所有评估运行均为纯推理,除一个轻量级 CPU/编排主机用于发出 API 请求、解析响应和运行附录 D 中描述的分析脚本外,我们这边不需要任何 GPU 算力。每次 API 调用都使用有界重试策略(在遇到限流响应时最多重试 40 次,并采用近似指数退避)和固定的每模型超时时间(大多数模型为 90 秒,对于 DeepSeek-R1 等长推理模型延长至 240 秒)。基准构建过程中的评判和改写调用会汇集到多个备用评判端点,以便单一提供商的限流不会阻塞整个流程;所有汇集的备用评判模型均与 12 个被评估的目标模型无重叠,以避免自我评估偏差。对于所有评估实验,模型均以 do_sample=False(贪心解码)运行,这消除了生成过程中的采样随机性,并在给定相同输入时产生确定性输出;因此,每个模型只需运行一次评估即可复现所报告的结果,推理时无需对多次运行或随机种子取平均值。
流水线超参数
表 4 列出了基准构建和评估过程中使用的所有固定超参数。
| 参数 | 数值 |
|---|---|
| 自然度通过阈值(5 个子评分的平均值) | ≥3.5 |
| 对抗生成器温度 | 0.6 |
| 对抗生成器最大 token 数 | 1,000 |
| 求解器 / 评判温度(评估) | 0.1–0.3 |
| 求解器最大 token 数(评估) | 8,192 |
| 每个认证条目的稳定性重测重复次数 | 5 |
| 每个种子保留的条目数(前 名)k | 5 |
| API 重试次数(每次调用) | 最多40 |
| 求解器调用超时(默认 / 长推理模型) | 90秒 / 秒240 |
评估协议
全部 1,145 个基准条目均以单轮、零样本用户消息的形式呈现给每个被评估模型,不附带系统提示词(对照组条件)、无少样本示例、也无任务专属微调。模型的完整回复(包括任何暴露出来的思维链)会连同该条目的标准答案解释一起传递给求解器-裁判(Solver-Judge),以获得五种行为标签之一:严格通过、谄媚式顺从、思维链劫持、硬性失败或拒绝。TAR、HFR、SCR 和 SI 均为该标签分布的确定性函数。我们对每个模型在完整 1,145 条基准上报告单次评估运行,这与裁判所使用的固定、确定性评分规则保持一致;所有对方差更敏感的分析均通过按维度拆分的方式明确量化变异性。
附录 D 扩展结果
条目难度:自然度与难度
图 9 绘制了基于 IRT 估计的条目难度与该条目自然度得分之间的关系。皮尔逊相关系数为 ,表明二者之间不存在有意义的关联:措辞更自然的条目在抵御能力上既不会可靠地更容易也不会更困难,这表明自然度检查器与难度校准所衡量的是相互正交的条目属性(表面流畅度与内在抗检测性)。βr=−0.059
共失败分析:完整相似度矩阵
主论文的图4(树状图)总结了基于模型失败集合的层次聚类结果。图10和图11分别完整展示了两个底层相似度矩阵:原始共失败率和能力归一化的Jaccard相似度。表5按Jaccard相似度列出了最相似和最不相似的五对模型。最相似的五对模型全部来自较弱的开源权重模型簇(DeepSeek-V4-Pro/Flash、MiniMax-M2.7、豆包-Seed-2.0),而Claude-Opus-4.7出现在全部五对最不相似的模型中,证实了正文中的观察结论——它是12个被评估模型中失败模式最独特的。P(failA∩failB)
| 模型A | 模型B | 共失败率 | Jaccard |
|---|---|---|---|
| 最相似的前5对 | |||
| DS-V4-Pro | DS-V4-Flash | 0.798 | 0.852 |
| DS-V4-Flash | MiniMax-M2.7 | 0.822 | 0.848 |
| 豆包-2.0 | DS-V4-Flash | 0.761 | 0.810 |
| DS-V4-Pro | MiniMax-M2.7 | 0.790 | 0.807 |
| 豆包-2.0 | MiniMax-M2.7 | 0.767 | 0.795 |
| 最不相似的后5对 | |||
| Claude-4.7 | 豆包-2.0 | 0.417 | 0.489 |
| Claude-4.7 | DS-V4-Flash | 0.434 | 0.484 |
| Claude-4.7 | MiniMax-M2.7 | 0.437 | 0.471 |
| Claude-4.7 | DS-V4-Pro | 0.417 | 0.469 |
| Claude-4.7 | DeepSeek-R1 | 0.383 | 0.462 |
数值干扰项密度:各维度细分
主论文中的图7报告了数值干扰项密度效应在所有四个陷阱维度上的平均值。图12按维度分解了这一趋势。负向的TAR-密度斜率和正向的CoT-Hijacked-密度斜率在全部四个维度上方向一致,其中“缺失先决条件”维度下降最为陡峭(与该维度整体上最难一致),而“规则不匹配”维度下降最平缓,这与主论文第4.2节通过IRT确立的难度排序相呼应。
解放实验:各维度完整结果
表6将主论文的图8扩展为精确的样本量以及四种模型在三种去偏条件下(条件A:软可行性提示;条件B:明确陷阱揭示;条件C:仅使用trap_core的无上下文知识探测)测试的各个维度的解放率。
| 模型(# SC) | 维度 | 条件A | 条件B | 条件C |
|---|---|---|---|---|
| GLM-5.1 (504) | 先决条件 | 95.5 | 79.8 | 94.4 |
| 环境 | 94.7 | 90.7 | 97.3 | |
| 时间 | 92.4 | 92.4 | 89.8 | |
| 规则 | 90.9 | 81.7 | 89.9 | |
| 总体(n=490) | 92.7 | 85.3 | 91.8 | |
| Kimi-K2 (486) | 先决条件 | 93.2 | 61.6 | 93.2 |
| 环境 | 93.2 | 75.7 | 90.5 | |
| 时间 | 92.0 | 88.8 | 87.2 | |
| 规则 | 82.4 | 64.8 | 82.9 | |
| 总体(n=465) | 88.4 | 72.5 | 86.9 | |
| Claude-4.6 (155) | 先决条件 | 61.4 | 97.7 | 86.4 |
| 环境 | 62.1 | 89.7 | 89.7 | |
| 时间 | 52.0 | 80.0 | 80.0 | |
| 规则 | 44.6 | 96.4 | 100.0 | |
| 总体(n=154) | 53.9 | 92.9 | 90.9 | |
| DeepSeek-R1 (184) | 先决条件 | 100.0 | 91.3 | 95.7 |
| 环境 | 94.4 | 88.9 | 88.9 | |
| 时间 | 86.2 | 93.1 | 100.0 | |
| 规则 | 82.2 | 86.7 | 80.0 | |
| 总体(n=115) | 88.7 | 89.6 | 89.6 |
除正文外,还有两点额外观察值得注意。首先,Claude-4.6 和 Kimi-K2 显示的条件排序与 GLM-5.1 和 DeepSeek-R1 明显不同:对于前两者,软性的条件A提示不如更明确的条件B/条件C有效,这表明这些模型需要明确的陷阱揭示(或完全移除框架)才能让潜在知识重新浮现,而 GLM-5.1 和 DeepSeek-R1 已经对软性提示有强烈响应。其次,即使在最差的情况下(Claude-4.6,条件A),每个维度的解放率都超过44%,并且无上下文的条件C单独就能为每个模型在每个维度上恢复至少80%的SC案例,唯一的例外是 Kimi-K2 在规则不匹配维度上的表现(82.9%,仍远高于随机水平),这进一步证实了知识抑制而非知识缺失是各维度谄媚遵从的主要解释,而不仅仅是在平均水平上如此。
提示词干预实验:完整结果
表7将主论文的图9扩展为精确的TAR、HFR以及TAR(相对于Control),涵盖三个目标模型在Control和三种系统级干预下的表现(在完整的1,145项基准上评估)。Δ
| 模型 | 条件 | TAR | HFR | ΔTAR |
|---|---|---|---|---|
| GLM-5.1(高SC) | Control | 25.9 | 27.1 | – |
| P1 | 57.4 | 0.4 | +31.4 | |
| P2 | 47.8 | 5.1 | +21.8 | |
| P3 | 43.8 | 0.2 | +17.8 | |
| DS-V4-Pro(高HF) | Control | 13.4 | 43.0 | – |
| P1 | 42.5 | 5.0 | +29.2 | |
| P2 | 34.7 | 12.2 | +21.3 | |
| P3 | 32.1 | 1.2 | +18.7 | |
| Claude-4.6(基线) | Control | 54.8 | 31.0 | – |
| P1 | 48.6 | 4.1 | −6.3 | |
| P2 | 40.8 | 9.1 | −14.1 | |
| P3 | 45.0 | 2.6 | −9.9 |
这些干预在三个模型上表现出惊人一致的副作用:HFR从Control下的27–43%骤降至任何干预下的0.2–12.2%。这表明这些提示词发挥作用的主要机制并非本身提升前提检测精度,而是可靠地唤起模型本就具备潜在能力的可行性检查,这与主论文第5.4节的“解放”发现一致。唯一的例外是Claude-4.6,三种干预均使其TAR相对于本已强劲的Control基线(54.8%)有所下降:强制显式前提检查步骤似乎打断了该特定模型更有效的默认推理策略,将一些在自由形式推理下本应为“严格通过”的案例转化为“谄媚遵从”或“CoT劫持”。这表明轻量级提示词最好被理解为在激发能力上抬高下限,而非统一提升每个模型,且对于已经很强的模型,干预设计可能需要具备能力感知性。
干预提示词模板
三种系统级干预前缀的精确文本如下;每个前缀均逐字添加到原始题目提示词之前,不做任何其他修改。
解放提示词模板
解放实验中所使用的三种去偏条件如下所示。条件A和条件B被前置到条目的原始提示词之前;条件C则将整个条目替换为一个仅由trap_core构建的裸查询,即移除了所有带有计算负担的框架表述。𝒫𝒯
附录E 更广泛的影响
SaliTrap 纯粹旨在作为一种诊断工具,帮助社区识别并最终弥合大语言模型常识推理中在提示(elicitation)阶段存在的盲点。由于该数据集由合成的、基于物理常识的日常场景构成,而非具有安全或规避安全措施价值的对抗性攻击,我们预计其发布不会带来双重用途风险。相反,我们期望揭示显著性偏差将有助于大语言模型助手的下游部署者避免一类具体的面向用户的错误(例如,助手自信地生成一个详细但在物理上毫无意义的计划),这类错误若被不加批判地采纳,可能会削弱用户信任或导致现实世界中的徒劳努力。所有种子条目均由论文作者根据日常、非敏感场景(烹饪、交通、购物、家庭维修等)撰写,经过合成扩展并由大语言模型验证,最终在发布前经过审查,确保不包含冒犯性、偏见性或有害内容。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org