ResearchMath-14K:通过智能体扩展研究级数学
ResearchMath-14K: Scaling Research-Level Mathematics via Agents
本文介绍了ResearchMath-14K,这是一个包含14,056个研究级数学问题的数据集,通过多智能体流程从学术资料中策划而成,是目前此类规模最大的集合。研究还生成了ResearchMath-Reasoning(包含220K条教师轨迹),发现语言模型存在回避行为,且新一代模型产生的引用和虚假引用分别是旧模型的5.6倍和5.0倍。经过智能体过滤后,对参数规模为4B到30B的Qwen3模型进行微调,其平均得分比基础模型提高了9.2分,表明过滤后的开放问题尝试能为研究级数学推理提供有效监督。该数据集已公开发布。
这可能是目前数学推理方向最有价值的数据集之一,它暴露了模型编造引用的问题,过滤后微调还能涨点,做数学推理的团队应该立刻拉下来试试。
孙贵镇
李承烨
郭敏珠
高贤宇
张元基
俞永宰
首尔大学
OneLineAI
延世大学
guijin.son@snu.ac.kr youngjaeyu@snu.ac.kr
摘要
数学的前沿是由那些尚未有已知解决方案的问题所定义的,然而,目前尚不清楚语言模型能否在没有人类干预的情况下有意义地处理这类问题。一个主要障碍是缺乏大规模的研究级数学数据集。为此,我们推出了 ResearchMath-14k,这是一个通过多智能体流程从学术来源整理的问题集,使其成为迄今为止最大的研究级数学问题集合。我们进一步生成了 ResearchMath-Reasoning,即来自两个开源模型的 K 条教师轨迹,在其中我们观察到了反复出现的回避行为,例如未尝试和捏造参考文献。有趣的是,在八个开源权重模型中,较新版本的模型在每条轨迹中产生了更多的参考文献和更多的虚假参考文献。在对 ResearchMath-Reasoning 进行智能体过滤后,对 Qwen3 模型(参数量从 4B 到 30B)进行微调,平均比基础模型提升了若干百分点。这表明,即使没有完全正确的推理轨迹,经过过滤的开放问题尝试也能提供有用的监督信号。我们将 ResearchMath-14k 公开,以供未来在研究级数学推理方面的工作使用。111https://huggingface.co/datasets/amphora/ResearchMath-14k
ResearchMath-14k:通过智能体扩展研究级数学
孙贵镇1,2 李承烨1 郭敏珠3 高贤宇2 张元基1 俞永宰1††通讯作者 首尔大学1 OneLineAI2 延世大学3 guijin.son@snu.ac.kr youngjaeyu@snu.ac.kr
1 引言
数学家需要经过多年的训练,从本科教材和习题起步,逐步进阶到研讨班问题、资格考试类题目以及短期研究。在这个过程中,他们逐渐掌握成为数学家的核心实践:将问题分解为引理、检验实例、分离出可处理子问题、区分可行路径与严格证明,并在真正的不确定性下进行推理。前沿闭源模型似乎越来越多地内化了这一课程体系的部分内容(Alexeev 等人,2026a, b;Zheng 等人,2026)。然而,开源领域并未跟上这一步伐。几乎所有公开可用的数学训练数据都针对奥赛级别或以下的竞赛类问题(Li 等人,2024;Fan 等人,2025b),而少数真正触及研究前沿的数据集则被定位为保留评估基准,通常设置访问限制以防止数据污染(Glazer 等人,2024;Phan 等人,2025)。
那么,从哪里可以大规模获取研究级别的数学问题呢?近期的工作主要依赖两种昂贵的来源:多LLM流水线合成的难题(Zhang 等人,2026;Dekoninck 等人,2026),或者由数学专家手动编写和整理的问题(Son 等人,2026b;Garre 等人,2026)。这两种方法都很有价值,但都无法轻松获得一个广泛、开放的训练语料库。我们另辟蹊径。数学文献中已经包含了成千上万的开放问题、猜想、研讨班问题和研究方向。瓶颈在于如何将它们从局部语境中提取出来,并重写为自包含的形式。我们从 zbMATH、arXiv 和学术资料库中收集了 1,233 份开放问题列表和研究论文,然后利用智能体识别候选问题、恢复缺失的定义和假设,并将它们标准化为独立的研究级别问题。这一过程产出了 ResearchMath-14k,一个包含 14,056 个研究级别数学问题的语料库,以及 ResearchMath-Reasoning,即由两个开放模型生成的 K 条推理轨迹。
在对 100 条采样轨迹进行的人工审查中,大约 30% 存在明显问题,包括未作答、将问题替换为更狭窄的问题,以及伪造 arXiv 或 PDF 链接(第 2 节)。这些失败在八个开放权重模型的更大规模轨迹级分析中反复出现,包括 DeepSeek V4-Pro (DeepSeek-AI, 2026) 和 Kimi K2.6 (Team et al., 2026)(第 3.2 节)。有趣的是,较新的模型引用变得更多,但事实性却更差,在 720 条 ResearchMath-14k 轨迹中,每条至少包含一个虚假参考文献(第 4 节)。我们使用相同的行为和事实性过滤器,将 ResearchMath-Reasoning 清洗为 ResearchMath-Reasoning-Filtered,这是一个可用于训练轨迹的子集(第 5 节)。在 ResearchMath-Reasoning-Filtered 上微调三个 Qwen3 基础模型(4B、8B 和 30B-A3B),使它们平均提升了数个百分比,这表明即使没有真实答案,ResearchMath 系列也是研究级推理的宝贵训练资源。我们以 MIT 许可证公开发布 ResearchMath 系列,包括 ResearchMath-14k(研究级问题)和 ResearchMath-Reasoning(K 条教师轨迹),以支持未来在研究级数学推理方面的工作。
2 ResearchMath-14k
2.1 收集现有开放问题
我们使用一个两阶段的智能体流水线构建了 ResearchMath-14k:一个提取器智能体从每个源文档中提取候选问题陈述,一个精炼器智能体将每个陈述重写为一个自包含的问题,并参考在线资料。该流水线从源文档中生成问题,见图 2。
来源。
数学家们长期以来通过研讨会、综述和精心整理的列表(Guy, 2004)来发布未解决的问题,既是为了吸引合作者,也是为了记录一个领域认为哪些问题足够重要,值得向更广泛的学界重点推介。我们的流程既收录经典条目,例如希尔伯特风格或埃尔德什风格的问题列表,也收录关于现代数学对象和局部技术背景的当代问题陈述。后者更接近一位在职数学家在研讨会上或近期综述中可能提出的日常研究问题,因此正是我们瞄准的那类监督信号。示例见附录A。
具体而言,源文档来自三个渠道。arXiv上的开放问题论文(例如 Diethelm 等人(2022))(文档数,问题数)是通过在arXiv上搜索标题和摘要中提及“open problems”或“unsolved”来筛选的。开放问题网页(文档数,问题数)通过谷歌搜索发现,涵盖 academia.edu、MathOverflow 和维基百科等网站。问题研讨会记录和精心整理的列表(文档数,问题数)是第三个渠道,包含两种子类型:AIM风格的研讨会问题环节,即参与者在会议结束时提出问题,222https://aimath.org/pastworkshops/nonselfadjointproblems.pdf 以及由编辑在专题会议结束时汇编的会议/论文集开放问题环节。
提取智能体。
提取器由 Codex 驱动,并采用 GPT-5.5 以极高推理强度运行,每次处理一个来源。它首先顺着来源 URL 向下定位到包含全文的 PDF 或 HTML 页面,丢弃任何隐藏在付费墙后的文档。在提取之前,它还会对文档进行筛选,确认其确实包含问题列表,跳过那些实际上并未提出开放问题的论文(例如,仅提及“开放问题”的常规研究论文)。随后,它从头到尾通读论文,并将每个开放问题以逐字引用的形式提取出来,同时附上一级改写。在改写过程中,模型被指示在论文中来回跳转,以获取理解该问题所需的所有定义和陈述。在处理的文档中,提取器平均每个来源产出一定数量的问题(中位数 ,最大值 )。
精炼智能体。
在通读提取出的问题时,作者注意到部分片段仍然缺少原始论文中视为已知前提的定义、符号和假设。精炼器由 Claude Code 驱动,并采用 Opus 4.7 以中等推理强度运行,负责填补这一空白。它执行两项任务。首先,它重新阅读原始论文,将孤立陈述问题所需的所有定义和假设内联进来。其次,它搜索最多十篇引用或扩展该来源的后续论文,既是为了引入该来源中视为隐含的背景信息,也是为了确定该问题此后是否已被解决。每个问题被标记为开放、部分解决、已解决或未知。我们使用 GPT-5.5 作为大语言模型评判员,对随机记录标签进行审核。经其标记,精炼后的陈述中有一定比例被认定为自包含,而原始提取的这一比例为,提升了 个百分点(附录 B)。精炼后的陈述平均字符数也增加至 ,高于提取器阶段的 ,扩展幅度为 。
| 数据集 | 问题数量 | 来源 | 差异 |
| GSM8K (Cobbe et al., 2021) | 千 | 教科书 | |
| MATH (Hendrycks et al., 2021) | 千 | 竞赛 | |
| LeanDojo (Yang et al., 2023) | 千 | 研究文献 | |
| MathInstruct (Yue et al., 2024) | 千 | 合成 | |
| MetaMathQA (Yu et al., 2024) | 千 | 合成 | |
| PRM800K (Lightman et al., 2024) | 千 | 竞赛 | |
| NuminaMath (Li et al., 2024) | 千 | 合成 | |
| AceMath-Instruct (Liu et al., 2025b) | 百万 | 合成 | |
| OpenMathInstruct(Toshniwal 等人,2024) | M | 合成 | |
| Riemann-Bench(Garre 等人,2026) | 专家级 | ||
| FrontierMath(Glazer 等人,2024) | 专家级 | ||
| Soohak(Son 等人,2026a) | 专家级 | ||
| GHOSTS(Frieder 等人,2023) | 教科书级 | ||
| HARDMath(Fan 等人,2025a) | 教科书级 | ||
| HLE(Phan 等人,2025) | 专家级 | ||
| ResearchMath-14k | 研究文献 |
2.2 过滤近似重复项
数据收集流程会产生一个种子问题集,但多个来源常常以略有不同的形式表述同一个未解决问题,因此需要进行重复项过滤。我们使用 Qwen3-Embedding-8B(Zhang 等人,2025)对所有问题进行嵌入,并计算原始表述和独立重写版本之间的两两相似度。从同一篇论文中提取的问题通常共享大量背景文本,即使问题不同也可能看起来相似,因此较低的相似度阈值会引入大量误报。在手动检查多个截断值下的边界对后,我们将阈值设定为 。如果任一相似度得分超过此值,则将该对标记为重复项。该阈值能将大多数真正的重复项与同一论文中的误报区分开。对于每个重复对,我们保留来自 arXiv 或其他论文来源的版本,并丢弃通过谷歌搜索发现的版本;当两个来源优先级相同时,我们随机选择一个。尽管这种过滤方式较为保守,但一些不同但密切相关的题目仍可能被移除,因此我们也发布了原始种子集。最终得到包含 个问题的集合。有关相似度分布以及阈值附近非重复问题对的示例,详见附录 D。
2.3 数据集统计
构成。
每个问题都被分配了一个三级分类体系。一级领域分组为:
每个问题还被分配了一个宏观学科标签和一个研究级别分类标签(共 个唯一标签)。层级结构从广泛领域到研究方向再到具体主题。例如,其中一个分支是:
图 1 展示了第一级分布情况。该语料库覆盖广泛,但偏向四个主要领域:分析/偏微分方程/动力学、数学物理、离散数学/组合学以及几何/拓扑学,这四个领域合计占问题总数的 。一小部分问题( )属于其他/跨学科类别,涵盖与科学相关的开放性问题(例如,关于超新星前身、语言起源、计算心智理论的问题)。开放性问题占大多数( ),其次是未知状态问题( )、部分已解决问题( )和已解决问题( )。该数据集来源多样,涵盖 份独立文档,其中贡献最多的问题来源贡献了 个问题,贡献第二多的问题来源贡献了 个。
难度。
难度是多维度的,一个问题之所以困难,可能是因为它需要晦涩的背景知识(知识维度),要求跳出既有思路进行新颖思考(新颖性维度),或者涉及计算密集的多步推理(程序性维度)。我们将 ResearchMath-14k 与 AceMath(Liu 等人,2025b)、AIME(2024-2026)(Dekoninck 等人,2026)、HLE-Verified(Phan 等人,2025)和 NuminaMath(Li 等人,2024)进行了比较。从这五个数据集中各抽取 个问题,并考虑所有数据集对。对于每一对,我们随机抽取跨数据集的问题对并随机排序,总共产生 次比较。每次比较由 GPT-5-mini 沿三个维度进行评判,生成胜/负/平标签,并据此计算 Elo 评分。在所有三个维度上,ResearchMath-14k 的 Elo 评分均比现有数学数据集高出约 分(图 3),这表明它是一个在质量上更困难的问题类别,而非对现有数学数据集的渐进式提升。这凸显了我们的贡献——迄今为止最难的开源数学问题集。
2.4 生成回答
我们使用两个教师模型——GPT-OSS-120B(Agarwal 等人,2025)和 Qwen3-30B-A3B(Yang 等人,2025)——来为 ResearchMath-14k 生成推理轨迹。请注意,目标并非生成正确的解答。大多数解答尚不为人知,我们也不期望参数量低于万亿的模型能够解决开放性的研究问题。我们首先在没有经过任何过滤的情况下,在这些轨迹上对 Qwen3-4B 进行微调。这导致学生模型出现严重的退化,包括重复输出和频繁的放弃尝试。333 我们未报告此未过滤微调的具体分数,因为得到的模型在几乎所有评估中都表现退化,得分接近于零。此处提及此例是为了说明这种失败模式,它促使我们进行更大规模的分析。为了理解原因,我们对随机抽取的轨迹进行了人工审查。我们发现,在某些情况下,教师模型根本没有尝试解决该问题。相反,模型似乎识别出该问题是一个开放性问题,并以以下形式之一输出放弃尝试:
- •
:列出已知的相关参考文献,并将“开放”作为答案输出。
- •
:在断定该问题是开放性问题后,缩小条件范围,要么解决缩小后的版本,要么仅列出相关参考文献。
这些观察结果促使我们在第 3.2 节中进行更大规模的行为和事实性分析。尽管如此,最终得到的数据集将 K 个提示词与来自两个教师模型的 K 个回答(大约每个提示词对应一个回答)配对,我们将其发布为 ResearchMath-Reasoning。据我们所知,这是公开可用的、关于模型尝试解决研究级数学问题的最大的集合。
3 实验设置
这种捏造的推理轨迹(第 2.4 节)的原因可能有几种解释。这种行为可能反映了问题难度、论文衍生提示词与基准测试风格问题之间的风格不匹配,或者 GPT-OSS-120B 的能力有限。因此,我们跨模型和基准测试(第 3.1 节)设置了实验,并使用互补的行为指标(第 3.2 节)对其进行评估。
3.1 基线
模型。
我们评估了一系列广泛的模型,其中包括多个规模显著更大的系统,以及来自每个模型家族的新旧两代产品:DeepSeek R1 (Guo et al., 2025)、DeepSeek V4-Pro (DeepSeek-AI, 2026)、Kimi K2 (Team et al., 2025)、Kimi K2.6 (Team et al., 2026)、Qwen3(30B-A3B、235B-A22B)(Yang et al., 2025) 以及 Qwen3.5(35B-A3B、397B-A17B)(Qwen Team, 2026)。在整个分析过程中,我们将这些模型分为四组新旧配对(R1 与 V4-Pro、K2 与 K2.6、Qwen3 30B 与 Qwen3.5 35B、以及 Qwen3 235B 与 Qwen3.5 397B)。
基准测试。
ResearchMath-14k 有两个决定性特征:题目达到研究级别,且其表面形式是由 AI 从源论文中精炼而来。我们选择了四个对照基准来分别隔离每个特征。为了控制 AI 精炼步骤可能带来的任何人为因素,我们使用了 SOOHAK (Son et al., 2026a) 和 Leipzig Tier-4 (ScienceBench, 2026),这两个基准均为研究级别但由人工撰写。为了研究难度的影响,我们使用了 HLE-Verified(由 Zhai et al. (2026) 验证过的人类最后考试 (Phan et al., 2025) 版本)的数学子集以及 AIME (Zhang and Math-AI, 2024, 2025, 2026)。这两个基准都比研究级别的数据集更容易,其中 AIME 是最简单的。AIME 综合了 2024、2025 和 2026 年的题目,共计若干道题。我们从其他四个基准中各抽取了若干条目,其中 SOOHAK 仅限于挑战子集中标注为研究生或更高级别的条目,并且所有基准都进一步筛选为简答题形式;这使得 SOOHAK 保留了若干条目,用于整体提示词。
3.2 行为与事实性指标
分析轨迹级别的行为并非易事。我们使用了两种互补的方法,共同覆盖了推理轨迹的两个方面:模型的行为(它如何推理)以及它所引用内容的事实性。每种方法都涵盖了这两个维度。
基于规则的计数。
我们使用了三个精心整理的短语列表,每个列表针对一种不同的措辞模式。这些列表由作者在审阅了数十个模型推理轨迹后汇编而成,收集了符合每种模式的常见短语,并与小写化的推理轨迹进行匹配(完整列表见附录C)。`cite` 匹配类似引用的名词(例如“论文”)。`abandon` 捕捉放弃行为(例如“无法解决”、“有根据的猜测”)。`assume` 捕捉未经证实的断言(例如“已知结果”、“我记得”)。其中两个(`abandon`、`assume`)衡量行为,而 `cite` 衡量事实性,并衔接至下方的智能体裁判。每个计数器在每次匹配时加一,针对每个基准测试,我们报告行命中率,即计数器至少匹配一次的轨迹所占比例(其中 是轨迹中的匹配次数, 是轨迹集合)。这些规则透明、成本低廉,且旨在广泛覆盖重复出现的失败模式。然而,仅凭计数无法判断某个匹配在上下文中是否属于真正的失败。
智能体裁判。
作为额外的行为检查,我们使用 GPT-5.5 作为评判模型(Zheng 等人,2023)来检测引理分解。该评判模型被提示生成一个二元标签,用于判断求解模型是否将问题分解为可证明的子目标,检查范围限定在轨迹的开头部分,因为子目标设定通常发生在此处。我们强调引理分解,因为它是大语言模型在长推理时间内处理开放性问题时最关键的行为之一。事实性检查则用于验证轨迹中类似引用的片段是否对应真实来源。由于在完整的推理轨迹上运行智能体成本高昂,我们采用了两阶段流水线。首先,我们将每条轨迹按换行符分割成多个块,并使用 GPT-5.4-nano 审计每个块,提取其中类似引用的片段(如书籍、论文、网站 URL)。然后,一个支持搜索功能的 Codex 智能体会逐一检查每个片段,以确认该片段是否为真实的引用文本(排除例如已命名的数学定理等情况),并确认所引用的来源是否存在于网络上。我们会提供该片段周围的上下文块作为参考,并要求在每次判断前进行多次网络搜索。两项检查的提示词详见附录 H.4。两个评判模型的输出衡量的都是推理轨迹的属性,而非答案的正确性。
4 分析 ResearchMath-14k 上的推理行为
第 2 节中的手动审查标记出大约多少比例的教师轨迹存在明显问题。现在,我们使用第 3 节中的八个模型和五个基准测试,在语料库规模上衡量相同的失败模式,并报告两项发现。
类似引用的推理行为在新一代模型中显著增加(图 4,左侧,引用行),在 DeepSeek、Kimi 和 Qwen3 的匹配对中,ResearchMath-14k、Leipzig Tier-4 和 SOOHAK 上的行命中率提升了 30 到 80 个百分点。随着基准测试难度降低,该效应减弱(在 HLE 上表现温和,在 AIME 上近乎为零),这表明新一代模型倾向于引用是问题学术水平带来的一种人为现象。
作为关键词计数器的补充,我们使用智能体-裁判(第3.2节)对ResearchMath-14k数据集中8个模型的各90条轨迹进行了评估。在所有720条轨迹中,629条(87.4%)至少引用了一个类似参考文献的对象,389条(54.0%)至少包含一个虚假引用。在引用层面,我们检查了19,864个提取的提及项,并在查阅互联网搜索后(图4,右侧)标记出3,492个虚假引用(17.6%)。在配对对比中,每条轨迹的提及次数显著增长。DeepSeek R1 V4-Pro从每条轨迹提及次数上升至(虚假引用),Kimi K2 K2.6从上升至(虚假引用),Qwen3 30B Qwen3.5 35B从上升至(虚假引用),Qwen3 235B Qwen3.5 397B从上升至(虚假引用)。总体而言,较新模型每条轨迹产生的类似参考文献提及次数更多,虚假引用也更多。这些虚假提及大多是虚构的论文标题和作者归属。模型试图通过捏造存在支持性参考文献来将其论点建立在错误陈述之上,从而使结果听起来正确。典型的虚假引用包括:
- •
“尼曼的论文:关于唯一分解定理的一个注记”
- •
“J.温克尔曼,关于科拉斯-拉塞尔三次曲面的全纯等价性”
- •
“一篇特定论文:J.M.安德森著《关于随机多项式稳定的概率》”
为什么较新模型更频繁地捏造内容?
有趣的是,我们观察到,2025 年发布的模型(DeepSeek R1、Kimi K2、Qwen3)引用较少,而 2026 年发布的模型(DeepSeek V4-Pro、Kimi K2.6、Qwen3.5)引用数量大幅增加,且虚假引用也更多。换句话说,在研究级提示词上的事实准确性正在倒退。由于这一现象在 DeepSeek、Kimi 和 Qwen 这三个不同的模型家族中均存在,因此不太可能是某个单一训练集的特性所致。一个合理的解释是互联网搜索强化学习,或者更广义的智能体强化学习(Dong 等人,2025;Liu 等人,2025a;Li 等人,2026)。近期的后训练流程通常会在训练时将模型置于一个智能体框架中,配备显式的搜索和引用工具,并奖励模型将主张建立在检索到的来源之上。随着训练的进行,模型学会了将引用论文、书籍和 URL 作为生成权威答案的常规步骤。然而,在我们的评估设置中,模型是在没有互联网访问权限的情况下进行测试的。一个合理的解释是,当搜索工具不可用时,模型并没有放弃引用行为,而是继续沿用已习得的模式,直接捏造出它们通常会检索到的参考文献。
但需要指出的是,引用和压缩本身并非失败。数学家也会引用、简化并跳过常规细节,如果模型能够正确地为其引用提供依据,那么这就不那么令人担忧。但引用并非模型试图“装样子”的唯一方面。在 ResearchMath-14k 上,放弃计数器(第 3.2 节)仅匹配到痕迹(),而假设匹配到(;图 4,左侧)。模型很少直接放弃,并且其尝试几乎总是依赖于压缩后的论断,而非从头推导。这些表面迹象与数学家的实践相似,但我们无法判断模型是运用了底层推理,还是仅仅在模仿其形式。
| 模型 | ResearchMath-14k | 莱比锡 T4 | SOOHAK |
|---|---|---|---|
| DeepSeek R1 | |||
| DeepSeek V4-Pro | |||
| Kimi K2 | |||
| Kimi K2.6 | |||
| Qwen3 30B | |||
| Qwen3.5 35B | |||
| Qwen3 235B | |||
| Qwen3.5 397B |
使用第 3.2 节中的智能体-裁判引理分解指标,我们发现该行为几乎不存在(表 2)。在 ResearchMath-14k、Leipzig Tier-4 和 SOOHAK 上,只有经裁判判断的轨迹被标记为正向,并且仅在 ResearchMath-14k 上如此。这不仅对 ResearchMath-14k 很重要,对模型将面临的任何研究级数学问题都很重要。这类问题难度很大,无法一次性解决,必须分解为可检验的子问题。
5 从 ResearchMath-14k 中学习
已有研究表明,在数学推理任务上进行监督微调可以容忍一定比例的错误解答(Toshniwal 等人,2025;Muennighoff 等人,2025;Son 等人,2025)。我们将这一思路推向了正确性基本无法保证的场景。对于 ResearchMath-14k 数据集,大多数问题都是开放性的,或者超出了当前参数规模低于万亿的大语言模型的能力范围,因此 ResearchMath-Reasoning 中的推理轨迹不太可能是完整或正确的。然而,我们假设,在通过基于规则的计数器或智能体评判器(第 3.2 节)对 ResearchMath-Reasoning 进行过滤,排除被标记的轨迹之后,剩余的那些轨迹在性质上与单纯的错误工作存在本质区别。观察一位训练有素的研究人员尝试解决一个开放问题但最终失败,其启发性远非观看一名幼儿园学生犯算术错误所能比拟。前者可能会引入相关对象、探索合理的归约方法、测试示例或发展出部分论证,而后者通常几乎不包含可迁移的结构。因此,这些虽错误但合理的轨迹是否真正有用,是一个具有实际意义的实证问题。要求在科研层面获得经过验证的正确推理,意味着需要对每条轨迹进行专家标注,这种成本无法规模化。如果这类轨迹足以教会有用的行为,它们就为未来前沿级别的数据整理提供了一条成本更低的路径。在下一节中,我们将研究在这些尝试上进行训练是否能提供有用的信号。
5.1 训练设置
我们使用第3.2节中的智能体-裁判流水线对ResearchMath-Reasoning进行过滤。该流程会针对网络搜索验证每一个类似引用的片段,并移除包含被判定为虚假引用的追踪记录。由于智能体步骤需要调用多个智能体和付费的网络搜索API,我们的预算只允许生成经过过滤的追踪记录,这些记录构成了ResearchMath-Reasoning-Filtered。作为对比,我们从DASD-Thinking(Yan等人,2026)中随机采样追踪记录,以检验另一种解释:即任何性能提升都来自于学习输出格式,而非研究级内容。我们在每个训练集上使用LoRA对Qwen3-4B/8B/30B-A3B-base进行微调。训练配置详见附录G。我们在AIME 2024–2026()、HLE()以及SOOHAK Challenge和Mini组合()上进行评估。我们对HLE和SOOHAK进行过滤,仅保留答案为整数的题目,并使用math-verify⁴⁴⁴https://github.com/huggingface/Math-Verify进行评分。
5.2 训练结果
在ResearchMath-Reasoning-Filtered上训练后,所有模型-基准测试组合的表现均优于基础模型,平均提升个百分点,而DASD在个组合中有所提升。ResearchMath-Reasoning-Filtered在个组合中的表现也优于DASD,在研究级评估上提升最为明显。在HLE和SOOHAK上平均,它比DASD高出个百分点,其中最大差距出现在30B模型的HLE和4B模型的SOOHAK上。唯一的例外是30B模型的AIME,DASD以个百分点的优势胜出。
由此得出两点启示。首先,性能提升不能仅用通用数学推理训练来解释。DASD确实改进了基础模型,但ResearchMath-Reasoning-Filtered在几乎所有设置下都表现更好。其次,有用的研究级监督信号并不需要经过验证为正确。一旦移除了未尝试作答、无依据的主张和虚假引用,那些错误但合理的尝试仍然能够改进学生模型。我们将对这种信号进行更大规模的进一步测试留待未来工作。
6 相关工作
大语言模型在研究级数学中的应用。
在大语言模型中诱导数学推理能力,主要依赖于已知答案的资源(Toshniwal 等人,2024;Li 等人,2024;Yuan 等人,2026)。然而,大多数资源仍低于研究前沿水平。这些问题通常是已解决的、可验证的(Albalak 等人,2025)、合成的(Toshniwal 等人,2025)、源自教科书的(Fan 等人,2025b)、源自奥赛的(Mahdavi 等人,2025;Ko 等人,2025),或与形式化证明环境相关(Yang 等人,2023)。研究级数学数据仍然昂贵且难以规模化:现有资源通常由专家撰写(Son 等人,2026a)、属于私有或受限访问(Garre 等人,2026)、规模较小、为评估而持续维护(Dekoninck 等人,2026),或者难以转化为训练材料,因为可用的提示词需要局部定义、符号、假设、状态检查和去重(Zhang 等人,2026)。我们通过收集数学文献中已有的研究级问题并对其进行改写,来填补这一空白。由此产生了 ResearchMath-14k,据我们所知,这是一个包含 14,000 个问题的语料库,是可用于训练的最大规模研究级数学问题集合。
7 结论与未来工作
本研究利用 ResearchMath-14k 来探究开放推理模型在研究级数学问题(其完整解答通常不可得)上的表现。我们的轨迹级分析显示了一个令人担忧的转变。新一代模型产生了更多引用密集的回复,但也出现了更多虚假引用。同时,这些不完美的尝试仍然包含了有用的监督信号。在过滤后的轨迹上进行微调,使模型相比其基础版本平均提升了 5 个百分点。这些结果表明,研究级训练不必仅依赖经过验证的完整解答:当最有害的失败模式被移除后,错误但合理的尝试也能发挥作用。我们鼓励未来的工作在大规模上测试这一信号,同时明确何时正确的轨迹对于可靠的证明行为仍然是必要的。我们公开发布 ResearchMath-14k 和 ResearchMath-Reasoning,以支持未来在研究级数学方面的工作。
参考文献
- S. Agarwal, L. Ahmad, J. Ai, S. Altman, A. Applebaum, E. Arbus, R. K. Arora, Y. Bai, B. Baker, H. Bao 等人 (2025) Gpt-oss-120b 与 gpt-oss-20b 模型卡片。arXiv 预印本 arXiv:2508.10925。引用自:§2.4。
- A. Albalak, D. Phung, N. Lile, R. Rafailov, K. Gandhi, L. Castricato, A. Singh, C. Blagden, V. Xiang, D. Mahan 等人 (2025) Big-math:面向语言模型强化学习的大规模高质量数学数据集。arXiv 预印本 arXiv:2502.17387。引用自:§6。
- B. Alexeev, M. Putterman, M. Sawhney, M. Sellke 和 G. Valiant (2026a) 组合数学与数论中的简短证明。arXiv 预印本 arXiv:2603.29961。引用自:§1。
- B. Alexeev, M. Putterman, M. Sawhney, M. Sellke 和 G. Valiant (2026b) 组合数学、概率论与数论中的简短证明(二)。arXiv 预印本 arXiv:2604.06609。引用自:§1。
- K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano 等人 (2021) 训练验证器以解决数学文字题。arXiv 预印本 arXiv:2110.14168。引用自:表 1。
- DeepSeek-AI (2026) DeepSeek-V4:迈向高效百万 token 上下文智能。引用自:§1, §3.1。
- J. Dekoninck, N. Jovanović, T. Gehrunger, K. Rögnvaldsson, I. Petrov, C. Sun 和 M. Vechev (2026) 超越基准测试:MathArena 作为大语言模型数学评估平台。外部链接:2605.00674, 链接。引用自:§1, §2.3, §6。
- K. Diethelm, V. Kiryakova, Y. Luchko, J. T. Machado 和 V. E. Tarasov (2022) 分数阶微积分的发展趋势、未来研究方向及若干开放问题。非线性动力学 107 (4), 第 3245–3270 页。引用自:§2.1。
- G. Dong, H. Mao, K. Ma, L. Bao, Y. Chen, Z. Wang, Z. Chen, J. Du, H. Wang, F. Zhang 等人 (2025) 智能体强化策略优化。arXiv 预印本 arXiv:2507.19849。引用自:§4。
- F. Fan, S. Martinson, E. Wang, K. Hausknecht, J. Brenner, D. Liu, N. Peng, C. Wang 和 M. Brenner (2025a) HardMath:面向应用数学中挑战性问题的基准数据集。收录于:国际学习表征会议,第 2025 卷,第 13523–13556 页。引用自:表 1。
- R. Fan、Z. Wang 和 P. Liu(2025b)《巨科学:推动科学推理后训练数据集的前沿》。arXiv 预印本 arXiv:2507.16812。引用自:§1、§6。
- S. Frieder、L. Pinchetti、C. Chevalier、R. Griffiths、T. Salvatori、T. Lukasiewicz、P. Petersen 和 J. Berner(2023)《ChatGPT 的数学能力》。Advances in Neural Information Processing Systems 36,第 27699–27744 页。引用自:表 1。
- S. Garre、E. Knutsen、S. Mehta 和 E. Chen(2026)《Riemann-bench:登月级数学的基准测试》。arXiv 预印本 arXiv:2604.06802。引用自:§1、表 1、§6。
- E. Glazer、E. Erdil、T. Besiroglu、D. Chicharro、E. Chen、A. Gunning、C. F. Olsson、J. Denain、A. Ho、E. d. O. Santos 等人(2024)《FrontierMath:评估 AI 高级数学推理的基准测试》。arXiv 预印本 arXiv:2411.04872。引用自:§1、表 1。
- D. Guo, D. Yang, H. Zhang, J. Song, P. Wang, Q. Zhu, R. Xu, R. Zhang, S. Ma, X. Bi, X. Zhang, X. Yu, Y. Wu, Z. F. Wu, Z. Gou, Z. Shao, Z. Li, Z. Gao, A. Liu, B. Xue, B. Wang, B. Wu, B. Feng, C. Lu, C. Zhao, C. Deng, C. Ruan, D. Dai, D. Chen, D. Ji, E. Li, F. Lin, F. Dai, F. Luo, G. Hao, G. Chen, G. Li, H. Zhang, H. Xu, H. Ding, H. Gao, H. Qu, H. Li, J. Guo, J. Li, J. Chen, J. Yuan, J. Tu, J. Qiu, J. Li, J. L. Cai, J. Ni, J. Liang, J. Chen, K. Dong, K. Hu, K. You, K. Gao, K. Guan, K. Huang, K. Yu, L. Wang, L. Zhang, L. Zhao, L. Wang, L. Zhang, L. Xu, L. Xia, M. Zhang, M. Zhang, M. Tang, M. Zhou, M. Li, M. Wang, M. Li, N. Tian, P. Huang, P. Zhang, Q. Wang, Q. Chen, Q. Du, R. Ge, R. Zhang, R. Pan, R. Wang, R. J. Chen, R. L. Jin, R. Chen, S. Lu, S. Zhou, S. Chen, S. Ye, S. Wang, S. Yu, S. Zhou, S. Pan, S. S. Li, S. Zhou, S. Wu, T. Yun, T. Pei, T. Sun, T. Wang, W. Zeng, W. Liu, W. Liang, W. Gao, W. Yu, W. Zhang, W. L. Xiao, W. An, X. Liu, X. Wang, X. Chen, X. Nie, X. Cheng, X. Liu, X. Xie, X. Liu, X. Yang, X. Li, X. Su, X. Lin, X. Q. Li, X. Jin, X. Shen, X. Chen, X. Sun, X. Wang, X. Song, X. Zhou, X. Wang, X. Shan, Y. K. Li, Y. Q. Wang, Y. X. Wei, Y. Zhang, Y. Xu, Y. Li, Y. Zhao, Y. Sun, Y. Wang, Y. Yu, Y. Zhang, Y. Shi, Y. Xiong, Y. He, Y. Piao, Y. Wang, Y. Tan, Y. Ma, Y. Liu, Y. Guo, Y. Ou, Y. Wang, Y. Gong, Y. Zou, Y. He, Y. Xiong, Y. Luo, Y. You, Y. Liu, Y. Zhou, Y. X. Zhu, Y. Huang, Y. Li, Y. Zheng, Y. Zhu, Y. Ma, Y. Tang, Y. Zha, Y. Yan, Z. Z. Ren, Z. Ren, Z. Sha, Z. Fu, Z. Xu, Z. Xie, Z. Zhang, Z. Hao, Z. Ma, Z. Yan, Z. Wu, Z. Gu, Z. Zhu, Z. Liu, Z. Li, Z. Xie, Z. Song, Z. Pan, Z. Huang, Z. Xu, Z. Zhang, and Z. Zhang (2025) DeepSeek-r1通过强化学习激励大语言模型中的推理能力. Nature 645 (8081), pp. 633–638. 外部链接: Document, ISBN 1476-4687, 链接 被引用自: §3.1.
- R. K. Guy (2004) 数论中未解决的问题. 第21卷, Springer. 被引用自: §2.1.
- D. Hendrycks, C. Burns, S. Kadavath, A. Arora, S. Basart, E. Tang, D. Song, and J. Steinhardt (2021) 使用MATH数据集衡量数学问题求解能力. arXiv预印本 arXiv:2103.03874. 被引用自: 表1.
- H. Ko、G. Son 和 D. Choi(2025)《理解、求解与翻译:弥合多语言数学推理的鸿沟》。载于《第五届多语言表示学习研讨会论文集》(MRL 2025),第 78–95 页。引用于:§6。
- J. Li、E. Beeching、L. Tunstall、B. Lipkin、R. Soletskyi、S. Huang、K. Rasul、L. Yu、A. Q. Jiang、Z. Shen 等(2024)《Numinamath:AI4Maths 领域最大的公开数据集,包含 86 万对竞赛数学问题与解答》。Hugging Face 仓库 13(9),第 9 页。引用于:§1、§2.3、表 1、§6。
- W. Li、B. Qu、B. Pan、J. Zhang、Z. Liu、P. Zhang、W. Chen 和 B. Zhang(2026)《LiteResearcher:面向深度研究智能体的可扩展智能体强化学习训练框架》。arXiv 预印本 arXiv:2604.17931。引用于:§4。
- H. Lightman、V. Kosaraju、Y. Burda、H. Edwards、B. Baker、T. Lee、J. Leike、J. Schulman、I. Sutskever 和 K. Cobbe(2024)《让我们逐步验证》。载于《国际学习表征会议》,第 2024 卷,第 39578–39601 页。引用于:表 1。
- J. Liu、Y. Li、C. Zhang、J. Li、A. Chen、K. Ji、W. Cheng、Z. Wu、C. Du、Q. Xu 等(2025a)《WebExplorer:探索与进化以训练长周期网络智能体》。arXiv 预印本 arXiv:2509.06501。引用于:§4。
- Z. Liu、Y. Chen、M. Shoeybi、B. Catanzaro 和 W. Ping(2025b)《AceMath:通过后训练与奖励建模推进前沿数学推理》。载于《计算语言学协会发现:ACL 2025》,第 3993–4015 页。引用于:§2.3、表 1。
- S. Mahdavi、M. Li、K. Liu、C. Thrampoulidis、L. Sigal 和 R. Liao(2025)《利用在线奥林匹克级数学问题训练大语言模型并进行抗污染评估》。arXiv 预印本 arXiv:2501.14275。引用于:§6。
- N. Muennighoff、Z. Yang、W. Shi、X. L. Li、L. Fei-Fei、H. Hajishirzi、L. Zettlemoyer、P. Liang、E. Candès 和 T. B. Hashimoto(2025)《S1:简单的测试时扩展》。载于《2025 年自然语言处理经验方法会议论文集》,第 20286–20332 页。引用于:§5。
- L. Phan、A. Gatti、Z. Han、N. Li、J. Hu、H. Zhang、C. B. C. Zhang、M. Shaaban、J. Ling、S. Shi 等(2025)《人类的最后一场考试》。arXiv 预印本 arXiv:2501.14249。引用于:§1、§2.3、表 1、§3.1。
- Qwen 团队(2026)Qwen3.5:迈向原生多模态智能体。外部链接:链接 引用自:§3.1。
- ScienceBench(2026)莱比锡基准测试。注:访问日期:2026-05-22 外部链接:链接 引用自:§3.1。
- G. Son, S. Kim, C. Arnett, H. Ko, H. Lee, H. Kang, J. Longxi, J. Yun, J. Lee, K. Lee, 等人(2026a)Soohak:一个由数学家策划的基准测试,用于评估大语言模型的研究级数学能力。arXiv 预印本 arXiv:2605.09063。引用自:表 1,§3.1,§6。
- G. Son, D. Yang, H. L. Patel, A. Agarwal, H. Ko, C. Lim, S. Panda, M. Kim, N. Drolia, D. Choi, 等人(2025)利用语言混合的思维链推动多语言推理模型的发展。arXiv 预印本 arXiv:2510.04230。引用自:§5。
- G. Son, D. Yang, H. L. Patel, H. Ko, A. Agarwal, S. Ahn, K. Lee, 和 Y. Yu(2026b)评判我们无法解决的问题:一种基于后果的方法,用于对研究级数学进行无 oracle 评估。arXiv 预印本 arXiv:2602.06291。引用自:§1。
- K. Team, T. Bai, Y. Bai, Y. Bao, S. Cai, Y. Cao, Y. Charles, H. Che, C. Chen, G. Chen, 等人(2026)Kimi K2.5:视觉智能体智能。arXiv 预印本 arXiv:2602.02276。引用自:§1, §3.1。
- K. Team, Y. Bai, Y. Bao, Y. Charles, C. Chen, G. Chen, H. Chen, H. Chen, J. Chen, N. Chen, 等人(2025)Kimi K2:开放智能体智能。arXiv 预印本 arXiv:2507.20534。引用自:§3.1。
- S. Toshniwal, W. Du, I. Moshkov, B. Kisacanin, A. Ayrapetyan, 和 I. Gitman(2025)OpenMathInstruct-2:利用大规模开源指令数据加速人工智能数学能力。收录于:国际学习表征会议,第 2025 卷,页码 19243–19275。引用自:§5, §6。
- S. Toshniwal, I. Moshkov, S. Narenthiran, D. Gitman, F. Jia, 和 I. Gitman(2024)OpenMathInstruct-1:一个包含 180 万条数学指令微调的数据集。神经信息处理系统进展 37,页码 34737–34774。引用自:表 1, §6。
- S. Yan, K. Liu, C. Shen, B. Wang, S. Fan, J. Zhang, Y. Wu, Z. Wang, 和 J. Ye(2026)分布对齐的序列蒸馏用于卓越的长链式推理。arXiv 预印本 arXiv:2601.09088。引用自:§5.1。
- A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv 等人 (2025) 《Qwen3 技术报告》。arXiv 预印本 arXiv:2505.09388。引用于:§2.4, §3.1。
- K. Yang, A. Swope, A. Gu, R. Chalamala, P. Song, S. Yu, S. Godil, R. J. Prenger 和 A. Anandkumar (2023) 《LeanDojo:利用检索增强语言模型进行定理证明》。Advances in Neural Information Processing Systems 36, 第 21573–21612 页。引用于:表 1, §6。
- L. Yu, W. Jiang, H. Shi, J. Yu, Z. Liu, Y. Zhang, J. Kwok, Z. Li, A. Weller 和 W. Liu (2024) 《MetaMath:为大语言模型自举数学问题》。收录于 International Conference on Learning Representations, 第 2024 卷, 第 45040–45061 页。引用于:表 1。
- W. Yuan, J. Yu, S. Jiang, K. Padthe, Y. Li, D. Wang, I. Kulikov, K. Cho, Y. Tian, J. Weston 等人 (2026) 《NaturalReasoning:包含 280 万道挑战性问题的真实世界推理》。Advances in Neural Information Processing Systems 38。引用于:§6。
- X. Yue, X. Qu, G. Zhang, Y. Fu, W. Huang, H. Sun, Y. Su 和 W. Chen (2024) 《Mammoth:通过混合指令微调构建数学通用模型》。收录于 International Conference on Learning Representations, 第 2024 卷, 第 40320–40341 页。引用于:表 1。
- W. Zhai, Z. Wang, J. Wang, B. Yang, X. Li, X. Xu, B. Wang, P. Wang, X. Wu, A. Li 等人 (2026) 《HLE-Verified:对人类最后的考试的系统性验证与结构化修订》。arXiv 预印本 arXiv:2602.13964。引用于:§3.1。
- J. Zhang, C. Petrui, K. Nikolić 和 F. Tramèr (2026) 《RealMath:用于评估语言模型在研究级数学上能力的持续基准》。Advances in Neural Information Processing Systems 38。引用于:§1, §6。
- Y. Zhang, M. Li, D. Long, X. Zhang, H. Lin, B. Yang, P. Xie, A. Yang, D. Liu, J. Lin 等人 (2025) 《Qwen3 Embedding:通过基础模型推进文本嵌入与重排序》。arXiv 预印本 arXiv:2506.05176。引用于:§2.2。
- Y. Zhang 和 T. Math-AI (2024) 《美国邀请赛数学考试 (AIME) 2024》。引用于:§3.1。
- Y. Zhang 和 T. Math-AI (2025) 《美国邀请赛数学考试 (AIME) 2025》。引用于:§3.1。
- Y. Zhang 和 T. Math-AI (2026) 美国数学邀请赛(AIME)2026。引用自:§3.1。
- D. Zheng、I. von Glehn、Y. Zwols、I. Beloshapka、L. Buesing、D. M. Roy、M. Wattenberg、B. Georgiev、T. Schmidt、A. Cowie 等人 (2026) AI 合作数学家:用智能体 AI 加速数学家。arXiv 预印本 arXiv:2605.06651。引用自:§1。
- L. Zheng、W. Chiang、Y. Sheng、S. Zhuang、Z. Wu、Y. Zhuang、Z. Lin、Z. Li、D. Li、E. Xing 等人 (2023) 用 MT-Bench 和 Chatbot Arena 评判 LLM 作为评判者。神经信息处理系统进展 36,第 46595–46623 页。引用自:§3.2。
附录内容
附录 A 示例来源对比
表 3 和表 4 展示了第 2.1 节讨论的源层面对比。第一对停留在数论/算术几何领域;第二对将一个广泛的代数几何重大挑战与一个关于超凯勒 Chow 环的较窄现代问题配对。
| 重大挑战条目 | 当代研讨会式条目 | |
|---|---|---|
| 数据集记录 | google__mppc/q_001 | 07-workshop-problems/q_007 |
| 来源 | 千禧年大奖难题 | 丢番图方程的一些开放问题 |
| 领域 | 数论;椭圆曲线和 -函数 | 数论;超椭圆曲线上的有理点 |
| 问题形式 | 证明 Birch–Swinnerton-Dyer 猜想:对于椭圆曲线 , 在 处的消失阶等于 的 Mordell–Weil 秩。 | 无条件证明亏格为 的曲线 y^2=-3x^6-x^5+2x^4+2x^2-3x-3 在 上没有有理点,已知这在其雅可比矩阵的 BSD 假设下成立。 |
| 状态 | 开放 | 未知 |
| 评论 | 这是一种经典的、高知名度的挑战性问题,出现在许多公开的未解数学问题列表中。 | 这个问题更窄、更局部:它靠近 BSD 和有理点方法,但要求对一条曲线给出具体的无条件证明。它更好地代表了构成 ResearchMath-14k 主要部分的研讨会和综述类问题。 |
| 来源 | Clay 专著 PDF | Leiden 研讨会 PDF |
| 重大挑战条目 | 当代综述式条目 | |
|---|---|---|
| 数据集记录 | google__mppc/q_004 | 1002.4321/q_010 |
| 来源 | 千禧年大奖难题 | arXiv 上关于紧超凯勒流形的问题列表 |
| 领域 | 代数几何;霍奇理论与代数环 | 代数几何;超凯勒流形与周环 |
| 问题形式 | 证明霍奇猜想:在光滑射影复簇上,每一个有理霍奇类都是代数子簇上同调类的 -线性组合。 | 对于每一个射影超凯勒流形 ,证明由 以及 的陈类生成的 的子环在环类映射下单射入上同调。 |
| 状态 | 未解决 | 部分解决 |
| 评论 | 这是一个关于所有光滑射影复簇上霍奇理论与代数环之间关系的普适性猜想。 | 这个问题更具局部性:它要求在超凯勒几何的现代背景下证明一个特定的周环单射性陈述。它使用了当前的对象和工具,同时仍然接近霍奇/环理论这一宏大挑战。 |
| 来源 | Clay 专著 PDF | arXiv:1002.4321 |
附录 B 自包含性审计
为了量化精炼是否使问题无需源文档即可使用,我们对随机抽样的已发布记录进行了初步自动审计。对于每条记录,Codex 将原始提取的问题和精炼后的独立问题都标记为自包含或非自包含。只有当具有数学背景的读者能够仅凭文本理解任务,而不依赖源文档中的符号、缺失的定义或对外部章节、图表或问题编号的引用时,该陈述才被视为自包含。表 5 显示,在抽样案例中,原始提取的问题有 是自包含的,而精炼后的独立问题有 是自包含的。精炼器将最初非自包含的片段转化为自包含的问题,留下被标记为存在剩余上下文空白的精炼后问题。
| 审计项目 | 计数 | 比率 |
|---|---|---|
| 原始提取的问题 | ||
| 精炼后的独立问题 | ||
| 原始否,精炼是 | ||
| 原始是,精炼否 |
| 案例 | 原始提取被判定为非自包含 | 精炼后的独立问题 |
|---|---|---|
| 测地线 | 假设当 时 。 | 设 为一个完备、单连通的黎曼流形,且无共轭点。设 为两条不同的单位速度测地线,并用 表示黎曼距离。假设当 时 。这是否能推出当 时 ? |
| 单词 | 设 为一个字母表,且 为一个 无模式词。那么 是 上一个最大 无模式词的一个因子。 | 设 为一个有限字母表,并令 表示 上的有限词集合。一个模式 是变量字母表上的一个非空词。模式 在词 中的一个出现是 的一个形如 的因子,其中 是一个非擦除同态。如果 没有任何因子是 的一个出现,则称词 是 无模式的。如果一个 无模式词无法在保持 无模式的情况下向左或向右扩展,则称其为最大的。证明或证否:对于每一个字母表 、每一个模式 以及每一个 无模式词 ,都存在一个 上的最大 无模式词,使得 是其一个因子。 |
| 剩余缺口 | 固定 且 。是否对于 以高概率成立,独立复形的宽度 满足 ? | 设 为一个有限简单图,其独立复形为 , 的面是 的独立集。遵循 Meshulam 的递归框架,我们为 关联一个非负整数参数 以及一个由用于界定 拓扑连通性的标准递归过程产生的有限序列。对于固定的 且 ,是否以高概率有 ?精炼后的版本仍然依赖于源文来获取 和 的精确递归定义。 |
附录 C 关键词与评判指标细节
本附录详细说明了第3.2节中使用的表层形式计数器。所有关键词匹配均在将分析文本转换为小写后进行。关键词组的计数是该组中所有短语的精确子字符串出现次数之和。这些计数器是描述性的追踪特征;它们不单独用作模型幻觉分类器。
C.1 关键词组
放弃。
该计数器标记声称陷入困境、受时间限制或无法完成解决方案的表述。关键词列表为:缺乏进展、鉴于时间、时间限制、过于复杂、手动不切实际、我卡住了、我卡住了、死胡同、无法解决、无法解决、没有进展、猜测、有根据的猜测。
引用。
该计数器标记对源对象、外部数据库或类似引用的提及。关键词列表为:论文、书籍、文章、教科书、专著、综述、期刊、会议论文集、出版物、arXiv、DOI、维基百科、MathWorld、OEIS、StackExchange、AoPS、数学解题艺术、网站、网页、在线来源。
假设。
该计数器结合了断言性捷径和记忆结果类语言,两者都在追踪过程中用自信的断言替代了推导过程。关键词列表为:可以证明、可以证明、容易看出、显然地、明显地、直观地、由对称性、必定是、应该是、已知结果、标准结果、我记得、网上有类似问题、凭记忆查找、问题暗示、强烈表明、众所周知、众所周知、我记得。
C.2 大语言模型评判与智能体评判标注
智能体评判引用验证。
此标注应用于提及类似引用参考文献的追踪记录,包括论文、书籍、文章、arXiv标识符、类似DOI的字符串、具名来源或数据库引用。一个基于Codex的搜索智能体会在互联网上搜索所提及的参考文献,并记录该引用来源是否存在。其目的是将真实的出处信号与虚构的文献支持区分开来。此标注不判断该来源是否能证明模型的论断;它仅检查被引用的对象本身是否可以被找到。
大语言模型评判引理分解。
GPT-5.5 检查推理轨迹,并标记模型是否将问题分解为显式的中间引理、断言、子目标或用于构建解决方案的各类情形。正面标注要求不仅仅是泛泛的规划语言:推理轨迹应陈述一个可复用的中间事实或子问题,并在后续推理中加以运用。其目的是衡量建设性的证明组织能力,而非表面的冗长程度。
大语言模型裁判反例搜索。
GPT-5.5 检查推理轨迹,并标记模型是否主动针对反例、边界情况、小规模实例或对抗性构造来检验某个猜想、提出的公式、候选解决方案或简化假设。正面标注要求明确尝试证伪或压力测试某个想法,而不仅仅是检查算术运算。其目的是衡量模型在做出断言之前是否运用了审慎推理。
C.3 聚合
对于每个关键词组、大语言模型裁判标注和智能体裁判验证结果,我们按模型、模型系列和基准进行聚合。行命中率将每条推理轨迹视为一个二元命中计数;对于裁判标注,这是被标记为正面的轨迹所占的比例。基准趋势视图报告了 DeepSeek、Kimi 和 Qwen 对比对中平均的新版减旧版差值。
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2605.28003v1%2Fx6.png&mode=full&exp=1790899200&sig=4928a05a678cf3cd)
附录 D 近似重复过滤细节
D.1 成对相似度分布
图 6 报告了 ResearchMath-14k 数据集中原始陈述和自包含改写的成对嵌入相似度分布。
D.2 决策边界附近的 GPT-5.5 判断
表 7、表 8 和表 9 展示了相似度分数接近阈值、但 GPT-5.5 仍判定为不同的问题对。这些案例支持了我们保守的阈值选择。
表 7:
GPT-5.5
判断示例 1
表 8:
判断示例 2
表 9:
GPT-5.5
判断示例 3
引理分解行
ResearchMath-14k
Leipzig Tier-4
SOOHAK
HLE-Verified
AIME
研究级总计
表 10:
八篇论文模型在绝对行为计数器上的行命中率。
assume
cite
abandon
这些计数器对应附录 C.1 中定义的三个基于规则的关键词组。
C.1
引理分解行由智能体判断器单独评判,并可用于三个研究级基准测试。
附录 E 推理行为细节
E.1 行为计数器比率
表 10 报告了在八个评估模型中,每个基准测试中触发各行为计数器的轨迹比例。
附录 F 许可证与发布
我们以 MIT 许可证发布 ResearchMath 系列。该发布包含两个成果:ResearchMath-14k(第 2 节所述的研究级数学问题语料库)和 ResearchMath-Reasoning(第 2.4 节所述的 K 条推理轨迹)。这两个成果均源自公开可用的学术来源(arXiv 预印本、开放问题网页以及研讨会或会议问题集)。提取器智能体会在提取前丢弃任何付费墙后的文档(第 2.1 节);付费或受限来源不会出现在已发布的数据中。
附录 G 训练细节
所有微调运行均使用 LoRA,基于三个 Qwen3 基座模型(Qwen3-4B-base、Qwen3-8B-base、Qwen3-30B-A3B-base),在来自过滤后的 ResearchMath-14k 或 DASD-Thinking 控制组的随机采样轨迹上进行。每个设置使用三个随机种子运行,报告的数字为各次运行的平均值。
LoRA 配置。
秩、alpha、dropout、无偏置,应用于每个 Transformer 块的注意力投影和 MLP 投影(q_proj、k_proj、v_proj、o_proj、gate_proj、up_proj、down_proj)。
批处理。
每设备批大小为;全局批大小对于 B 运行为,对于较小模型为。
序列长度。
示例在 B/B 运行中被截断至 tokens,在 B 运行中被截断至 tokens。
附录 H 提示词
H.1 数据集生成智能体
表 11 和表 12 分别展示了第 2.1 节中用于提取器和精炼器智能体的提示词。
H.2 难度比较
表 13 展示了第 2.3 节中用于难度比较的提示词。
H.3 响应生成
表14展示了第2.4节中用于生成模型响应的提示词。
H.4 事实性指标
表15、16和17展示了第3.2节中用于事实性指标的提示词。表17给出了表16的短块变体,用于检测到长度小于200字符且附有额外周围推理上下文的文本块。
表11:
提取器智能体的提示词
表12:
精炼器智能体的提示词
表13:
难度比较的提示词
表14:
响应生成的提示词
表15:
事实性参考跨度提取的提示词
表16:
事实性智能体验证的提示词
表17:
事实性智能体验证的短块提示词
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org