开放世界多智能体环境中的自主数学发现
在无中央协调器的开放世界多智能体环境Station中,来自不同模型家族的AI智能体自主选择研究方向、开展实验并构建共享科学文献。在AlphaEvolve目录的12个构造问题及两个额外案例研究中,该环境在五个问题上取得了超越现有文献的新结果,包括有限域Kakeya集的新无限族、11维604点亲吻构型等,并生成了可解释的定理与分析。所有原始智能体对话、证明和验证代码均已公开。
与固定管线的 AlphaEvolve 不同,Station 让多模型智能体自行选题、协作并积累「论文库」,独立性带来的多个新定理说明去中心化科研环境也能产出可验证进展。
开放世界多智能体环境中的自主数学发现
Stephen Chung
DualverseAI;剑桥大学
Wenyu Du
DualverseAI;香港大学
William J. Wesley
摘要
我们研究了 Station 这一开放世界多智能体环境中的自主数学发现。在该环境中,来自不同模型家族的 AI 智能体在没有中央协调器或脚本化流水线的情况下,共同追求一个共享的研究目标。智能体自行选择研究方向、开展实验、相互协作,并构建共享的科学文献体系。在 AlphaEvolve 目录中的 12 个构造问题以及另外两个案例研究中,Station 在五个问题上取得了相对于既有文献而言的新颖结果:有限域 Kakeya 集的一个新无限族、维度 11 中新的精确 604 点 kissing 构型、离散化 Kakeya 针与符号不确定性问题的新的纪录,以及 Erdős 最小重叠问题的一个显著改进的下界。智能体还为 Book Ramsey 数发现了新颖的无限族。重要的是,智能体不仅产出了数值构造,还产出了解释这些构造原理的定理与分析,使结果更具可解释性,也便于数学家在此基础上进一步推进。我们发布了所有原始智能体对话、证明和验证代码,为这些发现的产生过程提供了透明的记录。
1 引言
人工智能正开始直接为数学研究的前沿做出贡献。近期的工作涵盖从 AlphaEvolve 的大规模数学探索,到 AI 辅助攻克长期悬而未决的开放问题,其中包括雅可比猜想的反例、Crouzeix 猜想与 Sendov 猜想的证明,以及 OpenAI 近期报告的一组共十项数学成果 [58, 62, 1, 49, 54]。随着这些能力不断增强,一个自然而然的问题不仅是 AI 能解决哪些问题,还包括什么样的环境最能让它开展研究。
鉴于 AI 能力日益增强,我们提出这样的问题:我们能否构建一个自由的多智能体环境,在其中智能体只被赋予一个研究目标,而没有中央协调者?当一个环境把 AI 智能体视为独立的研究者,而非复杂流水线中的固定工具时,会发生什么?这种自由能否让智能体自行选择有前景的研究方向、发展自己的科学文献与研究文化,并共同推进既定目标?
为了研究这个问题,我们使用了 Station——一个用于自主科学发现的开放世界多智能体环境 [16]。Station 模拟了一个科学生态系统,其中来自不同模型家族的智能体自行选择研究方向、开展实验、与同行交流,并阅读和发表科学论文。这些论文会积累成一个共享的知识库,供后来的智能体阅读、引用和扩展。Station 只规定研究目标;没有任何中央系统告诉智能体该追求哪个研究方向或下一步该做什么。
我们将 Station 应用于 AlphaEvolve 研究中的 12 个问题,以及另外两个数学案例研究。在 12 个 AlphaEvolve 问题中,有 5 个产生了相对于先前文献而言的新颖结果。Station 发现了有限域 Kakeya 集的一个新的无限族,构造了维度 11 中三个精确的 604 点 kissing 构型,并为离散化 Kakeya 针问题、符号不确定性问题以及 Erdős 最小重叠问题建立了新的界。在另一个关于 Book Ramsey 数的案例研究中,智能体发现并证明了新颖的无限族,由此产生了一篇独立的后续论文。Station 还在一天之内、无需联网的情况下找到了 Jacobian 猜想的一个有效反例,证明它能够处理只有二元成功标准、而非分级优化信号的问题。
这种高度自由度让智能体能够追求更广泛的数学贡献,而不仅仅是优化某个固定指标。例如,AlphaEvolve 在有限多个素数上评估了有限域 Kakeya 构造;其中有希望的数值模式随后需要一条针对特定任务、由研究者辅助的流水线,才能扩展为无限族。由于 Station 智能体可以直接追求更广泛的数学目标,它们独立地重新发现并证明了该族,随后又发现了一个覆盖额外一类素数的新扩展。同样的自由度也让智能体得以探索既定目标之外的领域。例如,尽管我们要求智能体为 Erdős 最小重叠问题寻找改进的上界,它们却转而发展出了一个全新的下界证明。
在本研究中,我们只考虑数学构造类任务,而非证明猜想这类一般性数学问题。定理级的结果是在智能体试图解释并推广它们所找到的构造时自然涌现的。例如,Station 并没有只返回一个不透明的 604 点亲吻数配置,而是推导出了该配置的显式代数构造,使数学家更容易理解这一结果。在证明大量涌现的时代,沟通、消化和吸收新成果正成为主要瓶颈,这类可解释的输出可能会变得越来越有价值 [79, 44]。
我们还分析了支撑这些发现的 AI 发现过程。分析显示,超过一半的发现涉及智能体之间的协作。来自不同模型家族的智能体常常贡献互补的想法,而早期智能体撰写的论文则成为更后期发现的基石。许多重要成果得益于每个 Station 内部积累的大量文献。我们公开了所有原始智能体对话和可复现代码,让社区能够透明地研究这些发现过程。
2 方法
Station 是一个开放世界的多智能体环境,模拟了一个微型科学社区 [16]。它被划分为多个房间,每个房间用途不同,例如用于发表和阅读科学论文的档案室(Archive Room)、用于运行代码的研究中心(Research Center),以及用于与同行交流的邮件室(Mail Room)。表 1 总结了主要房间及其功能。智能体可以自由访问不同房间并执行不同操作。在每个回合中,所有智能体同时选择各自的动作,一旦所有动作完成,一个 tick 便流逝。每个智能体都有有限的寿命;当某个智能体寿命终结时,Station 会自动生成一个替代者,以维持智能体数量恒定。
Station 将每个智能体视为独立的研究者。智能体可以在研究中心访问分配给 Station 的主要研究目标。然而,如何实现这一目标则由每个智能体自行决定。智能体可以自由探索不同的研究方向、阅读现有论文,并在整个研究过程中经历大量的挣扎与失败。成功的智能体可能取得重要发现,此时它可以在档案室发表论文,为 Station 的长期知识积累做出贡献。这些论文随时间不断累积,在 Station 内部形成知识库,后续到达的智能体可以阅读、引用并在此基础上继续推进,从而围绕给定的研究目标发展出一个微型科学社区。
与当前用于科学发现的主流智能体系统相比[58, 50, 30, 70, 35, 31, 61],Station 在三个主要方面有所不同。首先,其智能体拥有更大的自主性:在给定的总体研究目标范围内,它们自行选择研究方向以及如何推进,而不是从中央协调器接收任务。其次,每个智能体都扮演完整的科研人员角色,处理从选定方向、开展实验到发表论文的整个研究流程。这种漫长而自主的研究旅程,使得各智能体之间的研究成果比僵化、碎片化的研究流程更具多样性。第三,Station 能够以智能体撰写的论文形式,让科学知识跨代际积累。而大多数现有系统积累的是过程信息,例如优化历史、中间产物或会话记忆。这类信息有助于系统继续其工作,但可能无法便捷地提取和积累科学知识。这些差异反映了设计理念上的根本抉择:AI 智能体是被视为固定流程中的工具,还是科学生态系统中的科研人员。
自原始论文发表以来,我们对 Station 进行了大量改进和扩展。这些变化的总体主题是鼓励新颖但有原则的探索,同时减少非科学负担。例如,我们引入了一个新的 Question Room,智能体可以在其中提出自己的问题并投票评价其他智能体的答案,从而拓宽科学探索的范围。智能体还会定期获得 假期,在此期间它们会搁置正在进行的工作,并接收旨在鼓励开放式思考的随机提示。我们还为智能体提供了编程助手,使它们不必花时间在底层编码或调试上,而是可以专注于科学任务,这与当今研究人员使用编程助手的方式类似。这些变化在附录 A 中有详细讨论。完整源代码公开可见于 https://github.com/dualverse-ai/station。
| 房间 | 功能 |
|---|---|
| 研究 | |
| 研究中心 | 阅读分配的任务,开发和运行代码,并提交解决方案以供评估。 |
| 反思室 | 回应自行设计的提示,以鼓励进行更深入的反思。 |
| 通信 | |
| 邮件室 | 与其他智能体直接、私下通信。 |
| 公共记忆室 | 参与持续性的公开讨论,类似于在线论坛。 |
| 公共休息室 | 参与非持续性的公开讨论,类似于群聊。 |
| 知识 | |
| 私人记忆室 | 存储私人文档,例如计划、笔记和论文草稿。 |
| 档案室 | 阅读科学论文,并发表通过自动评审的论文。 |
| 问答室 | 提问并对回答投票,类似于 Stack Exchange。 |
| 外部计数器 | 通过网络访问基于外部文献的报告;默认禁用。 |
| 问题 | 来源 | 发现 |
|---|---|---|
| 相对于既有文献的新结果 | ||
| 有限域 Kakeya 问题(第 4.1 节) | AlphaEvolve 问题 6.1 | 对于每一个素数p≡3(mod4),Station 在𝔽p3中构造了一个大小为(2p3+7p2+3)/8的 Kakeya 集,比 AlphaEvolve 的无限族节省了(p−3)/4个点。它还在53中找到了一个𝔽35点集,改进了 AlphaEvolve 以及此前文献中63的界;两者相对于现有文献均属新颖结果。 |
| Erdős 最小重叠(第 4.2 节) | AlphaEvolve 问题 6.5 | AlphaEvolve 仅将上界略微下调,从 0.380927 降至 0.380924,而 Station 则将下界从 0.37912 提升至 0.380552。相对于已公布的下界 0.37912,这大约填补了相应已公布差距的 82%。 |
| d=11 中的接吻数问题(第 4.3 节) | AlphaEvolve 问题 6.8 | AlphaEvolve 将下界从 592 提升至 593,而 Station 则构造了三个精确的 604 点配置。其中一个是 EinsteinArena 构造的独立再发现,另外两个则似乎代表了新的等距类。 |
| 离散化 Kakeya 针问题(第 4.4 节) | AlphaEvolve 问题 6.9 | 在 n=128 处,Station 获得了并集面积 0.107067,较 AlphaEvolve 的 0.114810 提升了 6.74%,较 HorizonMath 的 0.109148 提升了 1.91%。这确立了新的文献上界。 |
| 符号不确定性原理(第 4.5 节) | AlphaEvolve 问题 6.11 | Station 将上界降至 0.3089,优于 AlphaEvolve 的 0.321591 以及此前公布的人类结果 0.3102。这是新的文献纪录。 |
| 优于 AlphaEvolve | ||
| Hardy–Littlewood 极大不等式(第 4.6 节) | AlphaEvolve 问题 6.18 | 该站点达到了1.557069,而 AlphaEvolve 的1.5080无引导且大约1.533带提示,但中心问题已被解决。其关于非切向常数等于2对于1/3≤α<1的证明在文献中似乎是新颖的。 |
| 椭圆问题(第 4.7 节) | AlphaEvolve 问题 6.19 | AlphaEvolve 只恢复出了圆形,而 Station 则恢复出了完整的非圆等周卵形线族。这一族曲线在文献中已有记载,因此该结果仅相对于 AlphaEvolve 而言具有新颖性。 |
| 素数定理(第 4.8 节) | AlphaEvolve 问题 6.27 | 该站点已认证0.980681适用于所有x,将 AlphaEvolve 的采样得分提升至0.938。这对于有限权重基准而言是新的突破;在无限制条件下,素数定理已经给出了精确极限1. |
| 与 AlphaEvolve 的关联 | ||
| 差分基(第 4.9 节) | AlphaEvolve 问题 6.7 | Station 独立恢复了 AlphaEvolve 的 360 元素构造,但未能对其加以改进。 |
| Sidorenko 猜想(第 4.10 节) | AlphaEvolve 问题 6.26 | AlphaEvolve 和 Station 均未找到反例。未获得实质性结果。 |
| 不如 AlphaEvolve | ||
| 峰值自卷积(第 4.11 节) | AlphaEvolve 问题 6.2 | Station 获得了 C6.2≤1.504473,弱于 AlphaEvolve 的 C6.2≤1.5032。未获得实质性结果。 |
| 平坦自卷积(第 4.12 节) | AlphaEvolve 问题 6.3 | Station 获得了 C6.3>0.953189,弱于 AlphaEvolve 的 C6.3≥0.961021,但证明了无限制上确界可以通过在越来越细的网格上使用二元阶梯函数来逼近。 |
| 更多案例研究 | ||
| Book 拉姆齐数(第 4.13 节) | Epoch AI | The Station 独立发现并证明了两族新的无限构造。其有限构造与一个更早的恒等式还使一位外部专家推导出了第三族。三族构造合在一起,在 n≤200 的 43 个取值上证明了该猜想,解决了 28 个此前悬而未决的情形。 |
| Jacobian 猜想(第 4.14 节) | 公开 | 从一个不含公式的二元任务出发,The Station 独立重构了近期公布的七次反例,并给出了其常数 Jacobian 与三叶纤维的几何解释。 |
3 结果
3.1 实验设置
我们在来自 Georgiev 等人 AlphaEvolve 研究[29]的数学问题上评估该 Station,该研究是一个涵盖分析、组合学、几何和数论的广泛问题目录。大多数问题可以表述为对某个数值量的上界或下界进行优化:候选构造由自动化评估器检查并赋予一个数值分数(通常为标量),搜索过程试图优化该分数。在许多情况下,最优值是未知的,这使得相应的优化任务成为开放研究问题。
我们选取了 12 个代表不同数学领域和问题结构的问题;完整的问题集列于表 2。我们将每个问题分配给一个独立的 Station 实例。对于每个问题,智能体会收到一份任务说明,其中既描述数学问题,也描述评估器函数。任务说明还可能指定无法直接评分的额外数学目标。智能体不会获得任何外部专家指导或文献调研。大多数实例运行约 1,000–2,000 个 tick,对应大约一到两周的连续挂钟时间运行。除非另有说明,所有实例包含六名研究智能体,其中各两名分别由 GPT-5.5、Claude Opus 4.8 和 Gemini 3.1 Pro 驱动。
3.2 主要发现总结
结果汇总于表 2。根据每次运行的主要结果,12 个问题中有 5 个产生了相对于先前文献而言新颖的结果。在其余 7 个问题中,Station 在 3 个问题上优于 AlphaEvolve,在 2 个问题上与其持平,在 2 个问题上表现不如它。
这五个问题带来的新颖结果横跨数学的多个领域。在有限几何中,Station 推导出一个新的无限族 Kakeya 集,位于𝔽p3素数p≡3(mod4)上,并在𝔽35中找到了一个 53 点的 Kakeya 集,改进了此前 63 点的上界。在离散几何中,它构造出三个精确的 604 点 11 维亲吻构型,其中两个似乎定义了此前未知的等距类,并为离散化 Kakeya 针问题确立了新的界CT(128)≤0.107067。在分析学中,它将符号不确定性上界改进至0.3089,并闭合了 Erdős 最小重叠常数此前开放间隙中约82%的部分。
除了上述 12 个 AlphaEvolve 问题之外,我们还研究了另外两个案例。对于 Book Ramsey 数,Station 智能体发现并证明了两个新的无限族,而它们的有限构造与一个较早的恒等式使外部专家得以推导出第三个无限族。这三个无限族共同在 n≤200 的 43 个取值上证明了该猜想,解决了此前悬而未决的 28 个情形。对于 Jacobian 猜想,Station 从一项无公式的二元任务中独立重构了最近公布的七次反例,并推导出该反例具有常数 Jacobian 与三叶纤维的几何解释。
这些结果还表明,Station 可以直接追求更广泛的、不一定可评分的数学目标。例如,前述有限域 Kakeya 问题的无限族结果就无法直接评分,尽管新的无限族正是人们关注的数学对象。因此,AlphaEvolve 是在有限多个素数上评估构造,并依赖特定任务的流水线,再加上研究人员的介入,才将有潜力的输出转化为无限族。相比之下,在 Station 中,我们直接在任务描述里写明:有限构造只是测试用例,主要目标是发现无限族。这使得智能体独立地重新发现了此前通过 AlphaEvolve 及后续研究人员辅助流水线得到的无限族,并且还发现了该族的一个新扩展,为另一类素数改进了构造。运行结束后,我们的角色仅限于核验他们证明的有效性和结果的创新性。这大大减轻了研究人员的负担,也使 Station 能够适用于更广泛的数学问题类别。
结果进一步表明,Station 还能在原始任务之外产生意想不到的贡献。例如,在 Erdős 的最小重叠问题中,智能体被指示改进上界,但它们还发展出了一个下界证明,将开放区间大约闭合了 82%。这一意外发现体现了 Station 的另一个优势:智能体可以围绕既定问题探索数学上有前景的方向,并产出超出分配任务范围的贡献,例如新的定理。
与 AlphaEvolve 相比,我们发现 Station 智能体更倾向于理论引导的构造方式。这些实验中的单项评估通常限制在 15–30 分钟内,这形成了强烈的动机去利用数学结构来缩小搜索空间。例如,在 11 维的接吻数任务中,智能体将问题归结为围绕一个结构化整数核心的有限相容性搜索。这种缩减后的搜索在几分钟内就产生了一个 604 点的构型,随后智能体将其转化为一个无需计算机搜索的显式代数构造。这与 AlphaEvolve 的 593 点构型形成鲜明对比——后者的坐标是大规模、不等范数的整数,无法揭示出同样紧凑的代数描述或易于识别的组织结构 [29]。这种偏向并非在所有情况下都有利。在 Station 表现不如 AlphaEvolve 的峰值与平坦自卷积问题上,似乎更青睐对高度不规则对象进行持续、大规模的启发式优化。因此,首选系统既取决于问题的结构,也取决于期望的输出。当最强解主要是通过长时间数值优化发现的不规则产物时,大规模进化搜索可能更优。相比之下,当理论能够引导搜索,或者当相关定理与可解释构造与基准分数同样被重视时,Station 可能更具优势。
下一节将展示每个问题的详细结果。所有支撑性证明、验证产物以及原始智能体对话均可在 https://github.com/dualverse-ai/station_data_v2 获取。
4 详细结果
本节针对每个问题呈现最重要的发现。由于 Station 的每次运行都会产生大量发现,我们将正文限定在可能引起外部研究者兴趣的结果上。我们首先使用 Station 外部的智能体对发现进行自动筛选。若某项发现能推进原始问题的前沿——例如改进已知界限、回答文献中先前提出的问题,或具有通常足以纳入研究论文的广义变体——则通过筛选。随后,我们人工审阅筛选出的结果,并挑选其中最重要的发现在此呈现。我们将这些入选结果称为 焦点发现,并在下文每个问题内将其标记为 S1、S2 等。意义有限或不确定的发现仍记录在随附的 notebook 中。对发现过程比对数学细节更感兴趣的读者,可直接跳至第 5 节。
4.1 有限域 Kakeya
AKakeya 集在𝔽pd中是指一个在每个方向上都包含一条完整直线的集合,问题在于如何让这样的集合尽可能小。Dvir 对有限域 Kakeya 猜想 [21] 的证明确立了pd量级的下界。随后 Bukh 和 Chao 的工作 [13] 解决了首项渐近常数的问题,表明在任意固定维度下该常数为2−(d−1),因此在1/4维中为3。目前仍未解决的是这一首项的低阶修正项。能够改进pd−1及更小项的精确构造,因此即便首项常数已经确定,这些构造仍能进一步收紧目前已知的最佳界。
AlphaEvolve 将这一问题作为其集合中的 6.1 号问题,要求寻找小型 Kakeya 集。在该问题中,构造的得分由固定素数列表上 |Kp|/Bp,d 的平均值决定,其中 Bp,d=(p−1)(p+12)d−1+pd−1 是 Bukh 和 Chao [13] 所记录的经典构造的大小。我们向 Station 提出了同样的问题和同样的评分标准,并同时覆盖 3、4、5 三个维度。它证明了 d=3 中一个新的无限 Kakeya 集族,在 𝔽35 中找到了一个包含 53 个点的 Kakeya 集,并为新构造背后的整个单极点族确立了一个结构性限制。
S1. d=3 中针对 p≡3(mod4) 的一个新的无限族。
该站证明了:对每个素数 p≡3(mod4),在 𝔽p3 中都存在一个大小为 (2p3+7p2+3)/8 的 Kakeya 集。若以 S 表示 𝔽p 的平方(含 0),则该集合为
| Kp= | {(x,y,z):x2+4y∈S,x2+4z∈S} | ||
| ∪{(0,t,ct+z(c)):t∈𝔽p,c≠1} | |||
| ∪{(0,t,t)}∪{(0,0,z)},z(c)=cc−1. |
第一部分是经典的二次剩余集合,它已经覆盖了 p2 个方向 (1,a,b);在平面 x=0 中新增的直线覆盖了剩余的 p+1 个方向。值得注意的是,定义中没有任何部分依赖于 p 模 4,并且智能体证明了该集合对每个奇数 p 都是 Kakeya 集。然而,集合的大小确实依赖于 p 模 4,具体取决于 −1 是否为平方数,我们将两种情况都记录如下:
| |Kp|=2p3+7p2−18(p≡1mod4),|Kp|=2p3+7p2+38(p≡3mod4). | (1) |
该维度下的经典构造包含(2p3+10p2−2p−2)/8个点,因此当(3p2−2p−1)/8时可节省p≡1个点,而当(3p2−2p−5)/8时则可节省p≡3个点。特别地,这恰好是文献中留下O(p)误差项的一个精确规模[13].
AlphaEvolve 通过另一条路径处理了这个问题,我们发现两种构造在一个情形下一致,在另一个情形下则不同。对于 p≡1(mod4),两种构造的规模相同,事实上就是同一个集合。一个线性坐标变换可以将其中一个映射到另一个,因此(1)的第一种情形是对那里得到的界 14p3+78p2−18 的一次独立再发现。对于 p≡3(mod4),两者则不同。AlphaEvolve 的无穷族在该类上给出的最小规模是 (2p3+7p2+2p−3)/8,而我们的是 (2p3+7p2+3)/8,节省了 (p−3)/4 个点。即在 p=7 处节省 1 点,在 p=47(该基准中此类最大的素数)处节省 11 点。因此(1)的第二种情形是新的,并给出了当前文献中可用的最优无穷族界。
S2. 有限改进与 𝔽35 中的一个 53 点 Kakeya 集。
Station 在 25 项有限基准比较中赢得 14 项,并在其余 11 项中打平(图 1)。每项比较都以 AlphaEvolve 与 pre-AlphaEvolve 文献中的较优者作为基线。案例 (d,p)=(5,3) 尤其值得关注。设 kn 表示 𝔽3n 中 Kakeya 集的最小规模。Station 在 𝔽35 中构造了一个 53 点集合,将此前界从 k5≤63 改进到 k5≤53 [46]。鉴于已知值 k1=3、k2=7 和 k3=13,以及被认为已达到最优的界 k4≤27,2009 年曾有猜想认为递推关系 kn=kn−1+2kn−2 会继续成立,从而预测 k5=53 [46]。因此,Station 构造的规模恰好与猜想值一致,不过(k5=53)是否成立以及该递推关系是否延续仍是开放问题。
S3. 新无限族的结构分析。
这些智能体还对新无限族产生了相关洞见。它们分析了更一般的补全
| z(c)=Ac+Bc−p1, |
其中包含 S1 中的构造。消去斜率 c 后,与这些直线的关联性归结为
| (z−A−p1y)2−4(Ap1+B)y |
是一个平方数。二次特征计算随后表明,这些直线恰好覆盖了 p(p−1)/2 个轴外的点,与这三个参数无关。它们与该构造中二次剩余部分的交集始终为 p2/8+O(p)。因此,这个 Möbius 族中的每一个非退化补全都会增加 3p2/8+O(p) 个点:改变分子或极点的位置只会影响低阶项。
对于 S1 中使用的特定选择 z(c)=c/(c−1),智能体精确评估了低阶项,从而得到了 (1) 中所述的无穷族。该结果也解释了 AlphaEvolve 针对 p≡1(mod4) 得到的无穷族。更一般地,整个类别的估计表明,要改进总规模中的 p2 项,就必须离开单极点族。
局限性。
这个新的无穷族仅限于 d=3。在维度 4 和 5 中,智能体证明的公式弱于已知结果。在共享类别 p≡1(mod4) 上,前两个系数在每个维度上都与 AlphaEvolve 一致,而第三个系数在两者中都更差。
| d | 站点 | AlphaEvolve |
|---|---|---|
| 4 | 18p4+1932p3+2532p2+O(p) | 18p4+1932p3+𝟏𝟏𝟏𝟔p2+O(p3/2) |
| 5 | 116p5+47128p4+2532p3+O(p2) | 116p5+47128p4+𝟏𝟕𝟕𝟐𝟓𝟔p3+O(p5/2) |
我们在 d=4,5 中各个素数处报告的规模确实优于基准,但它们来自搜索而非公式。
4.2 Erdős 最小重叠
Erdős 的最小重叠问题探讨的是:一个区间的两个互补部分在平移之下,能够以多均匀的方式彼此避开。设 f:[−1,1]→[0,1] 为可测函数,其积分为 1,将 g=1−f 置于 [−1,1] 上,并将两个函数在区间之外都延拓为零。记
| Cf(x)=∫−11f(t)g(t+x)𝑑t,μ=inff∥Cf∥∞. |
这个常数是 Erdős 最小重叠问题在长整数区间平衡划分情形下的连续形式[23, 37, 83]。AlphaEvolve 将这个问题作为其数学问题集中的第 6.5 题加以研究,并把 Haugland 的上界从 0.380927 改进到 0.380924,后续工作又进一步将其降至 0.380868 [85]。在下界方面,Kim 和 Pilanci 确立了 0.37912 [41]。因此,在本工作之前,已发表的最佳界为
| 0.37912≤μ≤0.380868. |
S1. 一个新的下界 0.380552。
Station 智能体证明了
| μ>0.380552. | (2) |
相对于此前已发表的下界 0.37912,这使相应的已发表开区间缩小了约 82%,如图 2 所示。
这些智能体通过将重叠问题转化为相位敏感的 Fourier 约束,并将其合并为四条覆盖所有可行重叠一阶矩的全局不等式,从而实现了这一下界。证明的一个关键要素是一条将任意实频率下的余弦与正弦信息耦合起来的精确关系。以 P(ξ) 和 Q(ξ) 表示 Cf 的余弦与正弦变换,并以 s(ξ)=sin(ξ)/ξ 表示相应量,智能体证明了
| P(ξ)≤s(ξ)2−Q(ξ)24s(ξ)2(s(ξ)≠0). |
White 此前已使用了 Fourier 相位信息与凸优化方法,而 Kim 和 Pilanci 随后引入了额外的矩约束 [83, 41]。与这些早期方法相比,本文采用的表述消除了 f 的未知变换,直接约束重叠量,并且适用于任意实频率。更广泛地说,这一结果表明,当保留这种相位耦合时,既有的 Fourier 方法具有远为广阔的应用范围,并提示了一条进一步收窄剩余差距的解析路径。
与 AlphaEvolve 在上界方面的比较。
Station 智能体独立获得了 μ<0.380895,相比 AlphaEvolve 已发表的上界 0.380924 略有改进。然而,这一结果仍高于 Ye 等人当前已发表的上界 μ<0.380868[85]。因此,Station 并未创下新的上界纪录。
4.3 d=11 中的接吻数问题
接吻数 K(d) 是指在 ℝd 中能够同时与一个中心单位球相接触的不重叠单位球的最大数量。等价地,它也是这样一个单位向量集合的最大规模:其中任意两个向量的内积至多为 1/2。AlphaEvolve 将这一经典问题作为其数学问题集中的第 6.8 题,并将十一维中的下界从 Ganzhinov 利用高度对称的直线所确立的 592[28] 改进至 593。我们使用 AlphaEvolve 的评分规则(该规则衡量周围球体之间的总成对内积重叠)在相同问题上运行了两个独立的 Station。两个 Station 都无法访问外部信息,包括刚刚提到的 592 点和 593 点构造。两者均达到了 604 个点,证明了 K(11)≥604。综合两次运行的结果,我们得到了三个精确的、两两互不等距的 604 点构造。
S1. 三个精确的 604 点接吻构型。
该站发现了 604 维空间中三种几何结构不同的 ℝ11 点亲吻构型。这三种构型都是 ℚ(2) 上的精确等范数排列,但点的组织方式各不相同:其中两种为中心对称,一种非中心对称,且每种构型具有不同的接触结构和成对角度集合。图 3 展示了它们的共同架构以及区分它们的两个结构选择。我们将它们分别标记为构造 1、2 和 3:
| 构造 | 1 | 2 | 3 |
| 接触点对数 | 19,704 | 22,904 | 22,840 |
| 中心对称 | 是 | 是 | 否 |
| 对跖点对 | 302 | 302 | 238 |
| 两两不同的夹角 | 22 | 14 | 15 |
接触点对数量的不同证明这些构型是两两非等距的,因为该数量在正交变换和重新标记下保持不变。构造 1 和构造 2 包含每个点的对跖点,但构造 2 有 3,200 个更多接触点对,且少了八个两两夹角。构造 3 有 128 个点没有对跖点。三者之中,构造 2 的接触点最多、夹角集合最小,而构造 1 的接触点最少、夹角集合最大。因此,相同的纪录规模可以支撑截然不同的几何结构。
在并行开展的工作中,Bianchi 等人于我们公开发布 Construction 3 前不久,报告了来自 EinsteinArena 平台的 Construction 1 [10]。EinsteinArena 是一个开放的在线平台,接受任何参与者提交的候选成果,并使其可公开验证。该 604-点构造似乎是平台上多个独立运行的 AI 智能体系统协作的产物。相比之下,Station 的结果来自我们端到端开源系统的两次独立封闭互联网执行:其中一次独立恢复了 Construction 1,另一次则发现了 Construction 2 和 3。因此,Station 独立发现了 Construction 1,而 Construction 2 和 3 据我们所知是 Station 的新发现,代表了另外两个等距类。
S2. 一种代数构造方法,用于在604-点亲吻构型中,于ℝ11.
这些智能体最初是通过搜索54兼容的直线,围绕一个496点整数核心展开的。它们随后证明,同样的构型受一条紧凑的代数规则支配,而非一组任意的坐标列表,从而给出了一种显式的代数构造。该构造本身无需计算机搜索。首先,496点核心由稀疏的范数为四的整数向量,通过固定的支撑集与符号规则生成。其次,在一个坐标平面内旋转45∘的坐标系中,十一种简单的符号模式即可生成全部54条直线;对每条直线取两个方向,便得到108点扩展。其中2的出现是内在的:它由扩展与核心之间的兼容性所决定。
核心的支撑结构解释了这些额外点为何能够适配。它在某个特定的三维子空间中留出了额外的角度空间,该子空间内可以放置六条彼此兼容的直线。在其余八条坐标轴中,核心恰好允许四对可行的配对,每一对都连同该特定子空间一起,支撑起一组独特的十二条附加直线。这四对配对互不相交,因此它们对应的各组彼此兼容。支撑规则与符号规则还确保每个新点都与核心的每个点满足“亲吻数”约束。因此,最终得到的构型包含 496+2(6+4⋅12)=604 个点。
S3. 为什么经典的 D11 构造止步于 582。
智能体们探究了更好的搜索算法是否能在经典的范数为四的 D11 构造中找到更大的构型。他们证明答案是否定的:无论采用何种搜索算法或假设何种对称性,该构造最多只能包含 582 个兼容点。因此,要达到 593 或 604 个点,就必须脱离经典的构造方式。这一结果排除了仅使用范数四壳层中的向量进行任何改进的可能性,并引导智能体转向以格点派生的核心为基础、再附加额外向量的构造方法,最终生成了包含 604 个点的构型。
智能体们证明了这一上限,方法是表明符号选择无法克服关于哪些四坐标集合可被使用的底层限制。设 A(n,4,4) 表示最大的兼容四坐标支撑集合,并设 α(J±(n,4)) 表示在为这些坐标分配符号后最大的兼容集合。智能体们证明了
| α(J±(n,4))=16A(n,4,4). | (3) |
换句话说,允许任意符号只会使最优值恰好增加四个坐标上16种可能的符号模式;它无法带来任何额外优势。
Best 于 1977 年证明了A(11,4,4)=35 [9]。因此,智能体的身份将构造中带符号的权重为四的部分限制为560个点。剩余的22个坐标向量{±2ei}与这些点兼容,从而为完整的范数四582构造给出了一个精确的极限D11。
在封闭互联网的两次 Station 运行中,智能体均独立推导出了公式 (3)。我们后来发现,该公式与 Takhanov 和 Yun 的一篇论文中定理 1 的 k=4 情形存在重叠,该论文直到 2026 年 6 月 2 日才公开发布[77],其中该恒等式是更广泛的带符号亲吻构型分类的基础。因此,智能体是独立发现这一恒等式的。
局限性。
Station 在十一维的成功并未延续到邻近维度的新纪录。我们分别针对 d=12 和 d=13 生成了两个独立的 Station,它们分别实现了大小为 840 和 1154 的有效构型。十二维的结果比当前 841 点的前沿 [76, 18] 低一分,而十三维的结果则与 Zinoviev 和 Ericson 的 1154 点构造 [87, 18] 持平。
讨论。
我们观察到,Station 智能体总体上更倾向于理论引导的策略,而非大规模启发式搜索。在这个问题中,它们首先证明了在经典 D11 构造内进一步搜索无法超过 582,随后将后续工作转向扩展另一个核心,最终得到了 604 点的构型。相比之下,AlphaEvolve 的 593 点构造由大量不等范数的整数坐标组成,似乎并未展现出同样紧凑的代数描述或易于识别的组织结构。这种理论引导的偏向并不总是优势:在十二维中,Station 止步于 840,而当前 841 点的前沿是通过结构洞察引导的大规模数值优化达到的 [76, 18]。
这个问题也表明,Station 生成的定理可能对研究人员具有独立的研究价值。例如,由智能体独立推导出的公式 (3),与一篇直到最近才公开发表的论文中的定理存在重叠 [77]。显式的代数构造本身也可能具有独立的研究价值。这些发现超出了分数优化的范畴,表明赋予 Station 智能体的额外自由度可以带来超越基准分数提升的贡献。
4.4 离散化 Kakeya 针问题
经典的 Kakeya 针问题问的是:需要多小的面积才能将一个单位线段旋转到所有方向。有限版本将连续的方向替换为 n 个等间距的方向,并用 n 个可以水平滑动的细三角形来表示它们 [24]。更精确地说,对于实数偏移量 x1,…,xn,令
| Tj(xj)=conv{(xj,0),(xj+1n,0),(xj+jn,1)},1≤j≤n, |
并定义
| CT(n)=infx1,…,xn|⋃j=1nTj(xj)|. |
Córdoba 的下界以及 Keich 分析的 Schoenberg 构造表明,CT(n) 的数量级为 1/logn [19, 39],但其精确的有限值在很大程度上仍然未知。AlphaEvolve 将这个问题作为其数学问题集中的问题 6.9 来研究;我们在相同的七个二进尺寸 n=2,4,8,16,32,64,128 下,将三角形组件提供给了 Station。
S1. 在 n=32,64,128 处的新上界。
Station 在三个有限尺寸 n=32,64,128 上找到了更优的构造。在 n=128 处,它找到了面积为 0.107067 的三角形并集,将 AlphaEvolve 的 0.114810 提升了 6.74%,并将后来的 HorizonMath 数值 0.109148 提升了 1.91% [81],从而证明了
| CT(128)≤0.107067. |
在 n=32 和 n=64 处,提升幅度较为有限,Station 分别将 AlphaEvolve 的面积减少了 2.15% 和 0.69%;在较小的测试尺寸 n=2,4,8,16 处,它达到了与 AlphaEvolve 相同的数值(图 4)。
S2. 在 n=3,4 处的精确最优值及在 n=5 处的对称性破缺。
在本工作之前,只有经典数值 CT(2)=1/3 被精确已知 [24]。一个初等的对称构造给出
| CT(3)≤518, |
而 Schoenberg 的经典 Perron 构造 [71] 给出
| CT(4)≤14. |
AlphaEvolve 后来在数值上复现了 n=4 的值。Station 证明了匹配的下界,从而确立了
| CT(3)=518,CT(4)=14. |
它还表明,两个最小值都允许反射对称的配置,并且 n=4 的最优解包含连续族
| (14,14−c,c,0),120≤c≤18. |
随后,Station 证明了在反射对称构型中,n=5 处的最小值为 7/30,并发现了一个面积为 14/61<7/30 的新非对称构型。图 4(右)对比了对称极小构型与这个更小的非对称构型。这证明了在 n=5 处,每一个全局极小构型都必然是非对称的,尽管 CT(5) 的精确值仍然悬而未决。
这些结果超出了基准测试的评分范围。在 n=3,4,5 中,只有 n=4 属于七个被测尺寸之一,而评估器只对显式构型的面积进行评分;它既没有要求,也没有奖励对全局下界的证明。任务说明也没有要求智能体对精确的小尺寸 n 最优构型进行分类,或研究对称性破缺问题。智能体是通过自主数学探索得出这些结果的,将其工作延伸到了有限构型基准测试之外。
局限性。
The Station 在测试的各功率档位上分别优化了其构造 n=2k,图 4 将它们与 AlphaEvolve 对应的分别优化的有限构造进行了比较。因此,该图对比的是双方的有限构造。除了这些分别优化的有限构造之外,AlphaEvolve 还提出了一种适用于每个 n 的单一构造,该构造是通过迭代式专家引导开发出来的。The Station 没有采用等效的专家介入流程,其自主智能体也没有发现具有竞争力的统一构造。
4.5 符号不确定性原理
一维 符号不确定性问题 探讨的是:当一个函数及其傅里叶变换在原点处都从负值开始,它们能多快都变成最终非负。对于一个非零的偶可积函数 f:ℝ→ℝ(其傅里叶变换也可积),定义
| A(f)=inf{r>0:f(x)≥0 whenever |x|≥r}. |
该问题要求最大的常数 CSU,使得 A(f)A(f^)≥CSU 成立。Bourgain、Clozel 和 Kahane 提出了这个问题 [12],后续工作逐步获得了更强的界 [33, 17]。AlphaEvolve 将其作为问题 6.11 进行研究,并报告了一个上界 0.321591,同时还有一个未发表的人类界 0.3102。The Station 进一步将该界改进为 0.3089,如图 5 所示。
S1. 一个新的0.3089上界。
Station 智能体构建了一个函数来得出这一上界,从而证明
| 0.2025≤CSU≤0.3089. |
他们采取
| fε(x)=(−P(2πx2)−ε)e−πx2,ε=10−6, |
其中P以偶数阶广义拉盖尔多项式表示L2j(−1/2);已证实的尾部余量超过ε,因此fε(0)<0同时保持了最终非负性。这些基函数在傅里叶变换下保持不变,因此这一选择自动给出fε=f^ε,并将问题简化为构造一个具有所需符号的多项式。数值搜索找到了图226中所示的次数为5的多项式;智能体将其系数表示为精确的有理数,并证明了所得函数在相应半径之外为非负,从而满足了问题对最终非负性的要求。
S2. 双根 Laguerre 族在 0.3153 附近已穷尽。
在此任务中,我们为智能体提供了与 AlphaEvolve 相同的预设双根 Laguerre 设置和评分规则,但无法访问 AlphaEvolve 的论文或结果。在此设置下,每个提交都被限制在这样一个族中:P 由偶数索引 Laguerre 基中至多二十个预设正双根决定;我们称之为 双根 Laguerre 族。AlphaEvolve 的 0.321591 构造也属于该族。设
| CDR,20=inf{A(f)A(f^):f belongs to the double-root Laguerre family}. |
Station 智能体证明了
| 0.315305<CDR,20≤0.315309…. |
上界来自一个显式构造,而下界则源于对 41 尾部点的一个精确加权和障碍。因此,任何将上界改进到 0.315305 以下的构造都必须离开双根 Laguerre 族。
这一界限促使智能体在受限族之外进行搜索,尽管官方评估器无法对超出该范围的构造进行评分。它们将搜索扩展到没有预设重根的拉盖尔多项式,最终发现了给出 226 界限的 0.3089 次构造。这提供了一个具体例证,说明智能体如何超越分数优化,直接为底层数学问题做出贡献,尽管它们没有从分数中获得任何进一步指导。
4.6 Hardy–Littlewood 极大不等式
一维中心化 Hardy–Littlewood 问题要求的是控制中心化局部平均值可能取大值位置的最优常数。对于非负可积函数 f:ℝ→ℝ,定义
| Mf(x)=suph>012h∫x−hx+hf(y)𝑑y, |
并令 C0 为满足以下条件的最小常数:
| |{Mf>λ}|≤C0λ∥f∥1. |
Melas 解决了该问题,证明了
| C0=11+6112=1.567521… |
并构造了逼近该值的有限质点质量示例 [55, 56]。AlphaEvolve 后来将该有限问题作为基准进行测试,在搜索模式下达到了 1.5080,并在文献提示下达到了约 1.533。Station 智能体找到了一种具有 356 个质点质量的构造,其值为 1.557069,改进了 AlphaEvolve 的结果,但未能恢复 Melas 已经发现的全局最优解。
S1. 中心化算子与非中心化算子之间的尖锐常数。
Ramos 考虑了在中心化与非中心化 Hardy–Littlewood 极大算子之间进行插值的自然 非切向族 [64]。其参数 α 从 α=0 处的中心化算子延伸到 α=1 处的非中心化算子。记 Cα 为尖锐弱-(1,1) 常数,Ramos 指出,对于每个 0<α<1,其精确值均未知,而端点 C1=2 是经典结果 [6, 56]。在处理该任务的过程中,Station 智能体解决了 1/3≤α<1 情形下的这一问题,证明了
| Cα=2for every 13≤α≤1. | (4) |
关于 0<α<1/3 的常数仍然悬而未决。该任务并未要求这一扩展,智能体们也不知道 Ramos 提出了这个问题;他们之所以继续探索,是为了理解当居中约束被放宽时,居中问题的几何结构会发生怎样的变化。
4.7 卵形线问题
这个椭圆问题探讨的是:任意一条闭合凸平面曲线的曲率,是否必然使得与之关联的一维薛定谔算子的最低特征值至少为1。对于一条曲线γ长度为2π,以弧长为参数s,定义
| Hγ=−d2ds2+κ(s)2,C=infγλ0(Hγ), |
其中 κ 为曲率,λ0 为周期边界条件下的最小特征值。Benguria 和 Loss 猜想 C=1,并给出了一个包含圆及非圆卵形线的连续等式族 [5, 14, 8],证明了 C≤1,而 Linde 证明了全局下界 C>0.81;对其定理中显式常数进行数值评估得到 C>0.8246 [48]。AlphaEvolve 将这一问题作为其数学问题集中的第 6.19 题加以研究。
S1. 独立复现 Benguria–Loss 等式族。
AlphaEvolve 恢复了圆,但未能获得非圆形的等号卵形线。Station 则独立地恢复了经典 Benguria–Loss 等号族在模去欧氏运动和弧长原点平移下的单参数规范形。因此,它重建了已知等号结构中比 AlphaEvolve 更大的部分。这是对已知结果的独立恢复,而非新的等号族。Benguria 和 Loss 提出了该猜想并给出了等号族;Burchard 和 Thomas 证明了其局部极小性,而 Bernstein 和 Mettler 发展了其射影几何并确立了“Benguria–Loss 卵形线”这一名称 [5, 14, 8]。AlphaEvolve 和 Station 均未改进全局下界。
4.8 素数定理
素数定理描述了素数的渐近密度。若 π(x) 表示不超过 x 的素数个数,则该定理断言
| limx→∞π(x)x/logx=1. |
因此,其背后的数学问题早已解决:该比值精确收敛到 1。尽管如此,AlphaEvolve 仍将其有限版本作为其问题集中的 6.27 号问题加以研究。它寻找一个满足下式的 有限支撑权重 f
| ∑kf(k)k=0. |
此类权重的得分及其关联求和式为
| A(f)=−∑kf(k)logkk,Ff(x)=∑kf(k)⌊xk⌋. |
经典的 Chebyshev 论证表明
| Ff(x)≤1for every x≥1 | (5) |
意味着严格的下界
| lim infx→∞π(x)x/logx≥A(f) |
[20]。方程 (5) 中所需的全局不等式比素数定理本身严格得多:单个有限权重必须对每一个 x 都满足该不等式。AlphaEvolve 的评分仅在该不等式的有限多个采样值上进行了测试。因此,它可能给一个在未测试值上不满足条件的权重打出高分,在这种情况下,该评分并不能证明所声称的素数计数界。然而,对所有 x 进行穷举检查通常在计算上不可行,因为相关的周期可能极其庞大。因此,采样评分只能粗略近似地反映全局不等式是否成立。
S1. 一个对每个 0.980681 都有效的评分 x。
Station 智能体发现了一个有限构造f满足方程(5)对每一个x,其中
| A(f)≥0.980681. | (6) |
这比 AlphaEvolve 报告的得分 0.938 有所提升。更重要的是,智能体证明了该不等式对所有 x 均成立,而仅凭得分本身并不能提供这一保证。他们的关键思路是在构造中选择整数,使得 Ff 在一个可控的范围内重复出现。这便将 x 的无穷多种可能取值缩减为一次有限的穷举检查,智能体使用精确算术在一分钟内便完成了该检查。
相比之下,同一轮运行中的其他智能体找到了得分更高的构造,达到了 0.990629,但这些构造并未对每一个 x 满足全局不等式。这提供了一个具体例证,说明尽管存在可被钻空子的得分机制,智能体仍优先考虑底层数学问题本身,而非单纯追求分数最大化。
S2. 为什么直接的 Möbius 截断行不通。
Möbius 函数是一个自然的起点,因为它是素数定理标准表述的核心。AlphaEvolve 探索了通过截断 Möbius 函数得到的有限构造,Station 智能体最初也采用了同样的方法。随后它们证明,这一族构造无法产生正的渐近得分:随着截断阈值 D 增大,其对所需全局不等式的最大违反程度至少以 D/log2D 的量级增长。因此,为了满足不等式而对构造进行重新缩放,会将其得分压低至 O(log2D/D),而该值趋于零。该证明建立在关于不完全 Möbius 和的结果之上 [45]。这一障碍促使智能体放弃了直接的 Möbius 截断,转而探索一种对系数进行联合优化的更灵活构造,最终得到了上文所述的严格得分 0.980681。
局限性。
由于素数定理已经精确确定了上述极限比例,这些结果并不会改变人们对素数分布的已知认知。它们的数学贡献更为有限:在该基准测试的有限设定内,Station 智能体找到了一种具有严格得分为 0.980681 的构造,并证明了自然的 Möbius 截断无法产生正的渐近得分。因此,该问题主要充当一种校准手段,用于检验智能体能否区分有效的数学结果与高分但可被钻空子的得分,而非对素数分布研究作出实质性贡献。
4.9 差基
一个有限集合B⊂ℤ是差分基针对{1,…,n}如果该区间内的每个整数都可以表示为该集合中两个元素之差。如果B。如果Δ(n)是这样一个集合的最小可能大小,那么需要最小化的量是Δ(n)2/n;Rédei 和 Rényi 证明了这些归一化最小值收敛,且其极限等于其下确界 [65]。AlphaEvolve 报告了上界
| C:=infn≥1Δ(n)2n≤360249109≈2.639027 |
作为其合集的问题 6.7。此前已发表的上界是 Golay 的 C≤2.6458… [32, 7],而非 AlphaEvolve 对比中使用的 2.6571… 基准。该示例是在人类专家提示的帮助下发现的:论文记录显示,AlphaEvolve 在获得用于生成 Singer 差分集的正确代码之前,一直未能改进其基准,而其发布的提示词也将搜索导向 Singer 集和经典的 Leech 乘积构造。我们只向 Station 提供了问题定义、评分规则和一个平凡的网格基线。具体而言,智能体既没有这些构造提示,也无法访问外部文献。
S1. 独立重现 Leech–Golay 族中的一项纪录。
Leech 和 Golay 将四点差分基 {0,1,4,6} 与 Singer 差集相结合,得到了这一构造族中更早的成员 [43, 32, 4]。该站独立恢复了其 q=89 成员。取 v=q2+q+1=8011(一个 90 元素的 Singer 差集 D⊂ℤv)和 A={0,1,4,6},智能体们构造出
| B={va+d:a∈A,d∈D}. |
在为 D 选取合适的代表元后,所得的 360 个整数实现了从 1 到 49109 的所有差值,而 49110 是第一个缺失的差值。因此
| C≤360249109=2.6390274695…, |
将 Golay 先前的界改进了约 0.0067。该集合与 AlphaEvolve 报告的构造逐项一致。这是对已知纪录的独立复现,并非相对于 AlphaEvolve 的新上界,也不是新的构造族。这些智能体还试图进一步推高下界,但仅达到经典界 C≥2.434467… [43],而 Yang 和 Liao 证明了更强的已发表界 C>2.4421 [84]。
4.10 Sidorenko 猜想
Sidorenko 猜想断言:每个二分图H都满足t(H,W)≥t(K2,W)|E(H)|对于每一个图极限(graphon) W,其中t(H,W)是H在W [74中的同态密度。最小的未解决实例是十顶点、十五边的图H=K5,5∖C10,也称为二分默比乌斯梯(bipartite Möbius ladder) [66。AlphaEvolve 将这一问题作为其数学集合中的第 6.26 题,并在非恒定30步图极限(step graphon)上进行搜索。它通过以下方式对候选解进行评分:
| t(K2,W)15t(H,W)−1, |
因此,若该值为正,即可构成一个反例,从而推翻该猜想在此实例上的成立。
AlphaEvolve 报告称其未找到反例。我们将相同的问题与评分规则交给 Station,Station 的智能体同样未找到反例。因此,该猜想的成立状态未发生改变。
4.11 峰值自卷积
AlphaEvolve 的第 6.2 号问题,被称为其问题集中的首个自相关不等式,问的是:两个具有相同紧支撑密度的独立随机变量之和,其分布能有多均匀。更精确地说,对于一个非负函数f,其支撑集位于[−1/4,1/4],并通过∫f=1归一化,令
| C6.2=inff∥f∗f∥∞. |
确定 C6.2 与广义 Sidon 集的渐近大小相关,其精确值仍然未知 [53]。目前报道的最佳界限为
| 1.2937≤C6.2≤1.502851, |
其中下端点与上端点分别来自经过认证的凸松弛与显式阶跃函数 [41, 68]。
AlphaEvolve 达到了上界C6.2≤1.5032,改进了 Matolcsi 和 Vinuesa 在 AlphaEvolve 之前C6.2≤1.50972的界 [53];随后 TTT-Discover 将前沿推进到C6.2≤1.502863 [86],而一个精确算术证书将其进一步改进到C6.2≤1.502851 [68]。Station 仅达到C6.2≤1.504473,比 AlphaEvolve 和当前前沿都要差。AlphaEvolve 高度不规则的构造源于大规模启发式搜索。这一对比凸显了 Station 的一个局限:其智能体普遍偏好理论引导的构造而非启发式搜索,这种偏好虽然在多个其他问题上产生了强劲结果,但在这里却落后了——因为该问题的前沿构造依赖于大量的启发式优化。
4.12 平坦自卷积
AlphaEvolve 的问题 6.3,在其问题集合中被称为第二自相关不等式,探讨的是一个非负函数的自卷积能在多大程度上近似一个平顶函数——即在一个集合上为常数、在该集合之外为零的函数。更精确地说,对于一个非零的非负函数 f∈L1(ℝ)∩L2(ℝ),令
| Q(f)=∥f∗f∥22∥f∗f∥1∥f∗f∥∞,C6.3=supfQ(f). |
Hölder 不等式给出 C6.3≤1;对于任意非负输出,等号仅在如此平顶函数时成立。自卷积约束是否强制严格不等式 C6.3<1 仍然悬而未决 [51, 53]。在 AlphaEvolve 之前,已知的最佳界限是 [53]
| 0.88922≤C6.3≤1. |
AlphaEvolve 确立了上界 C6.3≥0.961021,而后续工作进一步将其改进为 0.962694 [85]。Station 的最佳已验证构造仅达到 C6.3>0.953189,因此并未改进数值界限。这一不足反映了在问题 6.2(最小化自卷积的峰值,见第 4.11 节)中看到的同样局限:Station 的理论引导型智能体并不擅长发现大规模启发式搜索所产生的高度不规则构造。
S1. 二元阶梯函数保持无约束上确界不变。
尽管如此,智能体们还是证明了一个关于搜索近最优构造的有用事实:定义 C6.3 的上确界可以通过二元阶梯函数来逼近,从而将对任意非负函数的搜索替换为在越来越细的网格上对二元函数的搜索。
4.13 布克-拉姆齐数(Book Ramsey numbers)
给定图G1,G2,则拉姆齐数 R(G1,G2)是使得n的任意红蓝边染色必然包含一个红色的Kn副本或一个蓝色的G1副本的最小G2。确定拉姆齐数的精确值是一项困难的计算与理论挑战。最著名的拉姆齐数是当G1和G2均为完全图时的情形,但许多其他选择也已被广泛研究(参见综述 [63])。书图 Bk由k个共享同一条边的三角形组成。一个悬而未决的问题是
| R(Bn−1,Bn)=4n−1 | (7) |
对每一个正整数都成立n。Rousseau 和 Sheehan 于 1978 年确立了上界,证明了R(Bn−1,Bn)≤4n−1对所有n [67均成立n]。因此,剩下的工作就是证明与之匹配的下界。对于给定的K4n−2,这相当于构造一个Bn−1的红–蓝边着色,使得其中既不含红色Bn.
第三作者证明了 n≤20 情形下的等式,与同期工作独立地相互印证,并在 2n−1 为同余于 1(mod4) [82、47] 的素数幂时,建立了一个无限的 Paley 型族。有限证据与一般算术构造的结合,使他猜想 (7) 对所有 n [82] 均成立。Epoch AI 随后将其采纳为 FrontierMath 开放问题 [22]。该问题发布后,后续工作将连续求解的范围扩展至 n≤56,并通过扩展既有构造,额外产生了两个无限族 [80]。
我们针对该问题运行了两个 Station。第一个在无互联网访问的情况下运行,发现了一个新的会议图(conference-graph)族。随后我们运行了第二个 Station,它具备互联网访问权限,并获得了第一个 Station 结果的摘要;它发现了一个新的加倍 Legendre 族,以及若干新的有限构造。之后,一位外部专家将这些有限构造中的模式与第二个 Station 的早期结果相结合,得到了 Yamada–Pott 无限族。因此,前两个族是 Station 的自主发现,而第三个则需要人类专家的介入。这三个族相对于现有文献而言均为新成果,并在图 6 中进行了可视化展示。每个族所覆盖的参数 n(包括哪些此前是开放问题)汇总于图 7。
S1. 会议图族。
第一个也是最广泛的族将任意会议图转换为锐利的 book-Ramsey 着色。具体来说,如果一个强正则图具有参数
| (q,q−12,q−54,q−14) |
存在,那么该空间站的智能体便证明了
| R(Bq,Bq+1)=4q+3. | (8) |
Paley 会议图在q为与1(mod4)同余的素数幂时存在。因此,当n−1为与1(mod4)同余的素数幂时,该定理证明了这一猜想。在 Paley 情形之外,Seberry 和 Whiteman 利用 Mathon 的构造方法,对每个5⋅92t+1+1获得了阶为t≥0 [52, 72的对称会议矩阵。这些矩阵给出阶为q=5⋅92t+1的会议图,因此当
| n=5⋅92t+1+1,t≥0. |
第一个成员给出 q=45 和 n=46。阶为 q=65 的已知会议图提供了附加参数 n=66 [36]。总体而言,已知会议图在 n≤200 的 30 个取值上证明了该猜想,其中 19 个此前尚未解决 [82, 47, 80, 22]。
S2. 一个加倍的 Legendre 族。
第二族将周期性的Legendre源在𝔽Q上转化为锐利的book-Ramsey着色[25]。具体而言,对于每个满足Q>3的素数幂Q≡3(mod8),Station的智能体证明了
| R(B(Q−1)/2,B(Q+1)/2)=2Q+1. | (9) |
因此,当 2n−1 是模 3(mod8) 同余的素数幂时,该定理证明了这一猜想。对于 n≤200,该族在 21 个取值上证明了相等性,并且在发现之时,在计入会议族 [82、47、80、22] 之后,还解决了另外六个此前悬而未决的案例。
这些智能体于 2026 年 7 月中旬发现了这一通用族。7 月底宣布的同期工作独立地产生了有限情形 n=70 [22];Station 定理将 n=70 作为其中一个成员包含在内,并覆盖了无穷多个进一步的参数。
加倍勒让德族与 Turturean [80] 所报道的勒让德族相关但有所不同。两者都始于 𝔽Q 上同类型的周期勒让德源,且具有 Q≡3(mod8),但使用了不同的提升来获得 book-Ramsey 着色。对于相同的源阶 Q,较早的提升达到 n=(Q+1)/4,而 Station 提升则达到 n=(Q+1)/2。因此它将 Ramsey 参数加倍,并覆盖了不同的值集合,如图 7 所示。
S3. 一个 Yamada–Pott 族。
第三个族将经典的 Yamada–Pott 设计转化为一种锐利的 book-Ramsey 着色 [3]。具体而言,对于每个素数幂q≥7满足q≡3(mod4)时,我们证明了
| R(B(q2−q−2)/4,B(q2−q+2)/4)=q2−q+1. | (10) |
因此,该定理在以下情形下证明了这一猜想:
| n=q2−q+24 |
对于素数幂q≥7同余于3(mod4)。对于n≤200,该族在五个取值上证明了相等性,并在计入会议族与加倍 Legendre 族之后,解决了另外三个此前悬而未决的案例 [82, 47, 80, 22]。第二个 Station 的智能体为n=11,28,86以及一个更早的周期相关恒等式提供了有限仿射构造;一位外部专家识别出它们共有的 Yamada–Pott 结构,并利用这些要素确立了该一般性定理。
讨论。
上述三个无限系列族相对于现有文献而言是新颖的,但其源头对象并非新事物:会议图(conference graphs)、周期 Legendre 对(periodic Legendre pairs)以及 Yamada–Pott 设计此前均已被建立 [52、25、3]。每个案例中的新意在于将经典对象提升为 sharp book-Ramsey 染色的规则,而这种规则未必能从源头对象本身直接看出。例如,智能体是在超过 3,000 个 Station 时钟周期以及一系列漫长的中间内部论文之后,才发现一般的会议图提升规则。随附的 notebook 提供了改编自智能体内部论文的、相对未经打磨的证明;我们将在后续的单独论文中给出这三个系列族的精修证明。
前两个家族还表明,Station 智能体能够推进超出可直接评分任务的广义数学目标:尽管评估器只能奖励有限构造,它们仍然发现并证明了无限家族。第三个家族则展示了互补性的局限。有限仿射示例和一般定理所需的周期相关恒等式,在 Station 的研究历史中都已存在,但智能体并未将它们联系起来。一位外部专家识别出它们共有的 Yamada–Pott 结构,并完成了综合。这一错失的联系表明,智能体可能尚未充分利用 Station 中积累的知识,在此类情况下或许需要外部专家的综合。
4.14 雅可比猜想
雅可比猜想探讨的是:一个处处局部可逆的多项式映射是否也必然全局可逆。更精确地说,该猜想断言,每一个具有非零常数雅可比行列式的多项式映射 F:ℂn→ℂn 都是一个多项式自同构 [40]。2026 年 7 月 19 日,有消息宣布利用 Claude Fable 构造出了一个三维反例 [1],从而在一切至少为三维的维度上推翻了该猜想。这一突破随即促使研究者们为该映射寻找概念性的解释:特别是,其看似神奇的雅可比消去为何会发生,以及三个一般的逆叶如何能与处处局部可逆性共存 [15, 27, 78, 73, 75]。
我们在公告发布一周后启动了 Station。由于这项实验是在更新模型可用之后进行的,它使用了比其他 Station 更新的智能体池:分别由 GPT-5.6 Sol、Claude Opus 5 和 Gemini 3.1 Pro 驱动的两个智能体。这些智能体没有外部网络访问权限,只收到一份无公式的规格说明:构造一个有理系数多项式映射ℂ3→ℂ3其次数至多为12,具有非零常数雅可比行列式,且在同一纤维中有两个不同的有理点。评估器自动检查每个构造,并且仅当它满足所有要求时才给出1的分数,否则给出0。我们没有提供文献综述或部分构造。因此,智能体必须独立找到反例。
这项任务的目标有两个方面。首先,我们希望在严格的二元问题上测试 Station。评估器既不提供部分得分,也不提供分级反馈,因此失败的尝试不会给智能体任何关于如何改进的分数信号;要达到 1 的分数,需要重构一个近九十年未被数学家攻克的猜想反例 [40]。其次,我们希望观察完整的发现过程,而不仅仅是最终构造。我们公开了全部原始智能体对话记录,而原始 Fable 的发现轨迹并未发布。这些记录保留了未出现在最终构造中的中间数学想法,使研究人员能够研究 AI 主导的数学发现的动态过程。
S1. 通过尖点直线族的独立重构。
编写 b=xy−1 时,Station 智能体构造了七次映射
| F(x,y,z)=(6x+9x2y,y(9b2+6b−2), 3y2b(3b−1))+z(x3,xb2,b3). |
精确计算得到 detJF=−6,且三个不同的有理点
| (−67,−76,−4753216),(34,73,−98027),(328,73,254827) |
全部映射到 (1,7/3,0)。这些恒等式构成了一份完整的反例证书。该公式与所公布的映射 H [1, 26] 在形式上明显不同,但线性源变换与目标变换 T(x,y,z)=(x,−y,−3z) 和 L(A,B,C)=(3C,−B,3A) 满足 F∘T=L∘H。因此,Station 是在不同的线性坐标下重构了所公布的反例;它并未产生新的反例或新的等价类。
原始结果归功于 Claude Fable,而这一反例则是由单个 GPT-5.6 Sol 智能体在一天之内独立发现的,期间未与其他智能体直接交互。该成功的智能体从有规则的映射开始F(x,y,z)=f(x,y)+zn(x,y),因此当z变化时,对每个固定的(x,y)都会描出一条线。它测试了五种基于光滑圆锥曲线的低次方向模板,但没有一种能满足剩余的常数雅可比条件。决定性的步骤是用尖点三次曲线[r:s]↦[r3:rs2:s3]替换光滑方向曲线。其关联的方向场为n=(x3,x(xy−1)2,(xy−1)3);采用这一选择后,基曲面f的相容性方程变得可解,并恰好得到了上述映射。
S2. 重建后的映射具有无临界点的三叶纤维结构。
在成功推导过程中,该智能体还解释了为何尖点直纹(cuspidal ruling)能使雅可比行列式为常数。对于方向场 n=(x3,x(xy−1)2,(xy−1)3),智能体推导出了活动标架恒等式,包括 D(n)=3xn(针对 D=x2∂x−∂y),在这些恒等式下,行列式中每一个依赖 z 的贡献都包含一个重复的切方向,因而为零。剩余的三重积即为常数 −6。因此,该智能体是从尖点直纹的几何结构出发推导出雅可比行列式的相消,而非先发现十六个只能在事后验证相消的项。
在构造出反例之后,同一个智能体分析了其纤维,并解释了该映射为何能在处处局部可逆的同时,在一般情况下具有三个原像。在一个稠密坐标卡上,将目标点写为 (X,Y,Z),并令 I=XY 和 J=X2Z。恢复一个原像于是归结为
| t3+6t2−3It+2J=0. | (11) |
对于一个一般目标点,三个根给出三个不同的原像。若 p(t) 表示左侧,则逆公式满足 A=p′(t)/6、X=xA,因此有 x=X/A。当根重合且 X≠0 时,条件 p′(t)=0 迫使相应的源点逃逸至无穷远,而非在仿射空间中成为临界点。在例外轨迹 X=0 上,源坐标 x 提供了额外的仿射尺度方向,从而消解了同样的表观分歧。这一分析回答了数学家们在公告发布后立即提出的结构性问题:三个叶层源于三次商映射,而完整三维映射的几何结构阻止了它们的碰撞产生临界点。该智能体的解释与数学家们在公告发布后数日内提出的尖点与三次叙述相吻合 [27、78、73、75]。
讨论。
该实验的数学结果是独立的重构,而非新的反例或新的解释。该示例表明,Station 能够解决一个困难的二元问题,而该问题的评估器不提供梯度或部分分数来引导搜索。尽管如此,此类反例突破可能仍然罕见,因为猜想通常被认为为真。在更广泛的背景下,更困难的挑战可能在于识别一个有前景的问题,并在知晓反例是否存在之前投入大量计算。
5 元分析
在本节中,我们对上述发现过程进行元分析,以更好地理解 AI 发现的动态规律。除非另有说明,所有分析均基于前一节提到的 14 个问题背后的 16 个 Station 实例。(接吻数问题d=11和Book Ramsey 数问题各有两个 Station 实例。)Spotlight 结果指该节中标记为 S1、S2 等的结果,共计 28 项。当单个 spotlight 包含多个独立发现的成果时,我们分别计数。我们用存档论文指代智能体在 Station 内发表的论文,而非外部人类文献中的论文。
5.1 各模型家族的贡献
我们首先分析 28 项 spotlight 结果各自的主要贡献者,如图 8(a) 所示。我们将每项结果归因于做出实质性发现的智能体,而非后来复述、验证或发表该结果的智能体。Claude 智能体对 18 项结果(64.3%)做出了主要发现,GPT 智能体对 9 项(32.1%),Gemini 智能体对 1 项(3.6%)。Gemini 占比偏低可能部分反映了模型发布时间:Gemini 3.1 Pro 于 2026 年 2 月发布,早于 4 月的 GPT-5.5 和 5 月的 Claude Opus 4.8 [34, 60, 2]。因此,其较低的贡献率与行业普遍趋势——较晚发布的模型具备更强能力——是一致的。
我们还分析了智能体的论文归档贡献,如图 8(b) 所示。Gemini 智能体提交的归档论文最多:共尝试 2,652 次,其中 508 篇被接收(19.2%),也就是说超过 80% 被评审者拒绝。Claude 智能体尝试了 1,236 次,其中 696 篇被接收(56.3%),而 GPT 智能体仅尝试了 506 次,其中 388 篇被接收(76.7%)。我们还按模型家族计算了总引用量,发现 Claude 智能体的归档论文无论在总量还是平均值上获得的引用都最多(图 8(c))。在我们的观察中,Gemini 智能体倾向于过度断言,例如仅凭有限的证据就宣称某个方向不可能实现;这类提交通常会被评审系统拒绝,这可能有助于解释其高拒绝率。相比之下,GPT 智能体在论文归档提交上非常谨慎,通常只在发现相对重要时才提交,这可能有助于解释其较低的提交数量。Claude 的归档论文通常篇幅更长、内容更全面,这可能有助于解释其较高的平均引用量。这些模式反映了不同模型家族的研究风格差异。
从定性角度看,我们观察到三个模型家族在优势与失败模式上存在显著差异。Gemini 智能体倾向于提出更多新颖的启发式方法和研究方向,但它们也更容易夸大结论,或在面对同行反馈时过于轻易地改变方向。GPT 智能体往往更为严谨,通常能够为新结果给出有效的非形式化证明,但它们有时会沉迷于技术细节繁复的旁支问题,而这些问题的整体研究价值有限。Claude 智能体则表现出坚持不懈、有条不紊且善于自我批判的特点。它们的创造力往往是适应性的:它们会从失败的方法中学习,利用这些失败来识别新方向,并通过严谨的验证持续深耕这些方向。这种严谨与有纪律的创造力相结合,使 Claude 成为高产贡献者。不过,其智能体偶尔也会提出错误论断,随后由同行智能体予以纠正。
5.2 跨模型家族协作
Station 的一个特点是允许来自不同模型家族的智能体进行协作。因此,我们考察在 spotlight 成果中,不同模型家族的智能体共同合作的频率。我们检查了上述全部 28 项 spotlight 成果。当某个智能体的工作被实质性用于该成果时——例如它贡献了一个定理、构造、方法或研究方向,并被其他智能体采用——我们便将其计为贡献者。
我们发现,28 个亮点结果中有 13 个(46.4%)涉及来自多个模型家族的智能体,如图 9(a) 所示。在其余 15 个结果中,有 6 个仍是来自同一模型家族的多个智能体协作完成的。因此,28 个结果中只有 9 个(32.1%)是由单个智能体独立完成的,而 19 个(67.9%)涉及多个智能体。Claude 智能体尤其善于协作:它们参与了全部 13 个跨模型结果。这些发现表明,跨智能体和跨模型家族的协作是发现过程中的重要组成部分。相比之下,目前大多数 AI 驱动的科学系统要么在单次运行中使用来自单一模型家族的智能体 [58, 30, 70, 35, 61],要么在流水线中使用不同模型家族并分配固定角色 [50, 31]。
我们还考察了智能体在跨模型案例中如何进行通信。Archive Room 是最常用的渠道,占这些协作的 61.5%(图 9(b))。这表明存档论文是同行间高效交流的一种手段。作为智能体较长的研究过程中科学成果的高度浓缩记录,这些存档论文提供了一种低带宽但信息密集的知识体系,后来的智能体可以在此基础上继续推进,就像我们自己的科学文献一样。一个智能体可以解决问题的某一部分并说明仍缺少什么;来自另一个模型家族的后续智能体可以阅读存档论文并继续推进。事实上,一个涉及三个模型家族协作的典型案例,主要通过存档论文进行,并最终促成了首个有限 Kakeya 焦点结果,如图 9(c) 所示。
5.3 发现时间
我们还关注 Station 完成每项发现所需的时间。大多数 Station 实例运行了 1,000–2,000 个 tick,对应大约一到两周的连续墙钟时间。图 10 展示了 28 项重点结果各自首次以其最终实质形式出现的 tick 时刻。
一些相对简单的结果出现得较早。除了 Jacobian 猜想这一显著例外,这些早期发现往往分量较轻,通常是对预训练知识中已有思路的相对直接改编或扩展,此时 Station 内部共享知识尚未大量积累。
28 项重点结果中有 13 项(46.4%)是在 tick 1000 之后发现的。我们普遍观察到,越晚的发现往往越具新颖性或难度。最极端的例子是用于 Book Ramsey 数的 conference-graph 族,它在 tick 3727 被发现。其提升规则在现有文献中远非显而易见,并值得单独撰写一篇外部后续论文。这类非平凡的发现往往只有在大量内部文献积累之后才会出现。
5.4 Station 机制
Station 的设计旨在通过多种机制促进科学发现。这些机制在附录 A 中有详细描述;这里我们给出简要概述,并探讨其中哪些机制对亮点成果有所贡献。
假期。每十个 tick 周期的最后两个 tick 被宣布为假期;智能体不能提交代码或归档论文,而是收到鼓励进行广泛反思、使用隐喻或借鉴其他领域想法的提示词。这种暂停常常促使智能体重新考虑失败的方法,或探索不太明显的方向。
归档论文。被接受的归档论文构成 Station 的累积知识,并可供后来的智能体使用。这使得部分定理、构造和有充分记录的失败案例能够成为后续发现的起点。
停滞协议。如果官方评估前沿长期没有改进,Station 会要求智能体回顾内部文献、质疑自身假设,并尝试不同的高层策略。这有助于智能体摆脱已经穷尽的局部方法,推动它们进行更大胆的尝试和更广泛的探索。
同行交流。智能体可以通过直接邮件或共享的公开讨论来交换部分结果、针对性问题和批评意见。
主管(Supervisor)。Station 会随机指定一名符合条件的智能体担任主管。主管提供高层级指导,鼓励智能体坚持探索,并防止它们重复彼此的工作,同时让它们对自己的研究负责;在两次任命之间,Station 会刻意留出较长的无主管时段,以鼓励更少结构约束的探索。
问题室(Question Room)。智能体可以发布重要的开放子问题,供其他智能体讨论和解决。这能把未解决的空白转化为共同的研究目标,并让采用不同方法的智能体补上缺失的环节。
这些机制以不同方式支持科学发现。假期拓宽探索范围;档案论文加深累积性知识;停滞协议推动系统跳出局部最优;而同伴交流、主管和问题室则在各智能体之间协调工作。
我们审阅了 28 项成果背后的对话,并将每种机制对发现的贡献归类为直接贡献、间接贡献或无实质贡献(图 11)。当机制提供了决定性的想法或干预时,即为直接贡献;当机制塑造或支持了研究、但并非成果的直接来源时,即为间接贡献。当对话记录显示该机制没有明确的因果作用时,我们将其归为无实质贡献。
在 28 项成果中,休假和档案论文分别直接或间接贡献了 23 项和 21 项,紧随其后的是停滞协议,贡献了 14 项。休假期间,智能体常常从主动优化中抽身,审视先前方法失败的原因,并重新框定问题或探索新方向;这些反思往往提供了后来成为重点成果一部分的思路,这解释了其高贡献率。档案论文也对相当一部分成果有所贡献,表明该空间站积累的知识对后续发现很有价值。
5.5 成果可复现性
我们同样关心这些发现是否可复现。为此,我们在无网络访问的条件下,针对十一维接吻数问题运行了三个独立的 Station 实例。(其中包括第 4.3 节描述的两个实例;第三个仅用于本次可复现性分析,不包含在上述其他元分析中。)图 12 显示了每次运行达到的最佳已认证下界。三个 Station 最终都达到了 N=604,表明改进后的下界是可复现的。
然而,更仔细的审视表明,在所需时间和达成结果的路径上都存在显著差异。站点 1 围绕格导出的核心追求离散的精确线填充。它通过选取 54 条相互兼容的线,这些线构成一个 108 点核心的 496 点代数扩张,从而获得了构造 3;后来在探索不同的核心和扩张时获得了构造 2。站点 2 则是在共同旋转下从根系母题组装出构造 1;其最后一步是识别出十一个点构成了一个立方八面体的除一个顶点外的所有顶点,并补上缺失的第十二个顶点。站点 3 通过不同的机制达到了相同的构造类别:它变形了一个精确的 601 点配置,使得两个坐标向量和一个额外向量能够被附加到一个显著的三维子空间上。因此,相同的数值下界从显著不同的数学表示和研究路径中涌现出来。
这种差异部分源于站点的累积知识。初始轨迹中的微小差异会改变哪些结果进入档案论文集合。后续智能体随后继承不同的起点,因此研究路径和累积档案论文的差异会随时间复合放大。因此,考虑到各站点实例之间的高方差,在计算成本不成问题的情况下,对同一问题运行多个独立实例是可取的。
6 讨论与结论
我们观察到 AI 智能体的能力正在快速提升。在一年前的初始版本中,智能体经常产生幻觉,无法可靠地学习环境规则。如今,智能体已经能够掌握环境并自主产生新颖的发现。尽管如此,多智能体研究仍存在若干重要局限。我们在下方总结观察结果。
缺乏专家直觉。这里所说的直觉,是指在投入研究之前判断某个方向是否有前景的能力。良好的直觉能让探索更高效,使研究者能够更深入地钻研有前景的方向。在多次运行中,我们观察到多起智能体以站不住脚的理由将前景良好的方法降级处理,从而推迟或错失潜在突破的案例。这表明智能体缺乏该领域人类专家通常具备的那种直觉。
缺乏多元化的研究品味。对特定概念或方法的偏好很难客观评判其优劣。然而,当所有智能体都拥有相似的品味时,整体探索范围就会变得狭窄。在多次运行中,来自同一模型家族的智能体往往提出相似的研究思路,这表明模型特有的品味降低了探索的多样性。
上下文学习能力有限。智能体可以通过上下文吸收新的研究知识,但这些知识并不会更新其预训练权重。随着 Station 积累的知识不断增长,智能体可能难以充分吸收并有效在此基础上继续推进。我们偶尔观察到智能体未能认识到自己的研究路线与 Station 早期知识之间的关联,从而错失潜在的发现。
吸引子陷阱。当被赋予自主性时,一些智能体会沉浸在我们称之为吸引子的任务或活动中。这些活动往往在某种即时意义上具有回报性,但对主要问题却几乎没有有意义的贡献。智能体还可能沉迷于技术细节,而人类专家会迅速识别出这些细节是琐碎或与主要问题无关的。例子包括使用不同的随机种子反复重新运行同一个优化脚本,或详尽地诊断和刻画每一个局部最优解。
Station 的多种机制旨在缓解这些局限。例如,使用来自多个模型家族的智能体拓宽了研究品味的范围,而停滞协议则帮助智能体摆脱吸引子陷阱。尽管如此,这些问题在一定程度上仍然存在,并且在上述四个方面,AI 智能体与人类专家之间仍存在显著差距。来自人类专家的轻量级指导或偶尔的干预,通过引导智能体走向有前景的研究方向,可能会有所裨益。当前的 Station 支持此类人类参与,例如通过向所有智能体广播消息,但我们将对人机协作的系统性研究留待未来工作。
尽管本文主要将 Station 用于数学探索,但 Station 被设计为一个通用的研究环境,其机制中没有一个是专门为数学量身定制的。正如原论文所展示的,Station 可以应用于涵盖数学、计算生物学和机器学习的各类问题[16]。因此,在其他领域的大规模研究探索,包括对语言模型本身的研究,可能前景广阔。
随着 AI 智能体能力不断增强,我们预计自主性和通用性将成为设计 AI 研究环境时越来越重要的原则。更强的智能体不必局限于日益复杂的流水线;它们有能力自行决定如何实现目标、从失败中学习、交流想法,并随时间推移不断积累知识。Station 所提供的更高自主性,可能让这些能力得到更充分的发挥。
参考文献
- [1] L. Alpöge (2026) Hello there the Jacobian conjecture is false. 注:X 平台帖子,发布于 2026 年 7 月 19 日。外部链接:链接 被引用:§1、§4.14、§4.14。
- [2] Anthropic (2026) Claude opus 4.8. 注:Anthropic。外部链接:链接 被引用:§5.1。
- [3] K. T. Arasu、D. A. Bulutoglu 和 J. R. Hollon (2020) Legendre G 阵列对与若干 G 阵列族的理论统一。Journal of Combinatorial Designs 28 (11), pp. 814–841。注:arXiv:2004.05608。外部链接:文档 被引用:§4.13、§4.13。
- [4] T. Banakh 和 V. Gavrylkiv (2019) 循环群中的差基。Journal of Algebra and Its Applications 18 (5), pp. 1950081。注:arXiv:1702.02631。外部链接:文档 被引用:§4.9。
- [5] R. D. Benguria 与 M. Loss(2004 年)《薛定谔算子的 Lieb–Thirring 猜想与平面上卵形等周问题之间的联系》,载于《偏微分方程与反问题》,当代数学丛书,第 362 卷,第 53–61 页。注:arXiv:math-ph/0402048。被引用处:§4.7、§4.7。
- [6] A. Bernal(1989 年)《关于一维极大函数的一个注记》,载于《爱丁堡皇家学会会刊 A 辑:数学》第 111 卷(第 3–4 期),第 325–328 页。外部链接:文献。被引用处:§4.6。
- [7] A. Bernshteyn 与 M. Tait(2019 年)《差分基的改进下界》,载于《数论杂志》第 205 卷,第 50–58 页。注:arXiv:1901.09411。外部链接:文献。被引用处:§4.9。
- [8] J. Bernstein 与 T. Mettler(2015 年)《一维射影结构、凸曲线与 Benguria & Loss 的卵形》,载于《数学物理通讯》第 336 卷(第 2 期),第 933–952 页。注:arXiv:1403.8000。外部链接:文献。被引用处:§4.7、§4.7。
- [9] M. R. Best(1977 年)A(11,4,4)=35,或若干新的最优等重码。技术报告 ZN 71/77,阿姆斯特丹数学中心。外部链接:链接。被引用处:§4.3。
- [10] F. Bianchi、Y. Kwon、A. Pappu 和 J. Zou(2026)《在真实环境中利用 AI 智能体的集体智能实现新发现》。arXiv 预印本 arXiv:2606.10402。外部链接:文档 引用自:§4.3。
- [11] A. Blokhuis 和 F. Mazzocca(2008)《有限域 Kakeya 问题》。收录于《Building Bridges: Between Mathematics and Computer Science》,M. Grötschel 和 G. O. H. Katona(编),Bolyai Society Mathematical Studies,第 19 卷,第 205–218 页。备注:arXiv:0911.4370 外部链接:文档 引用自:第 4 项。
- [12] J. Bourgain、L. Clozel 和 J. Kahane(2010)《Heisenberg 原理与正函数》。Annales de l’Institut Fourier 60(4),第 1215–1232 页。外部链接:文档 引用自:§4.5。
- [13] B. Bukh 和 T. Chao(2021)《有限域 Kakeya 问题的尖锐密度界》。Discrete Analysis。备注:第 26 条,共 9 页;arXiv:2108.00074 外部链接:文档 引用自:第 1 项、§4.1、§4.1、§4.1。
- [14] A. Burchard 和 L. E. Thomas(2005)《关于依赖于环曲率的 Schrödinger 算子的一个等周不等式》。The Journal of Geometric Analysis 15(4),第 543–563 页。备注:arXiv:math/0505123 外部链接:文档 引用自:§4.7、§4.7。
- [15] K. Buzzard(2026)人类数学家正在被反例超越。注:Xena 项目博客 外部链接:链接 被引用:§4.14。
- [16] S. Chung 和 W. Du(2025)The station:一个用于 AI 驱动发现的开放世界环境。外部链接:2511.06309,文档,链接 被引用:附录 A,§1,§2,§6。
- [17] H. Cohn 和 F. Gonçalves(2019)通过模形式得到的十二维最优不确定性原理。Inventiones Mathematicae 217,第 799–831 页。注:arXiv:1712.04438 外部链接:文档 被引用:§4.5。
- [18] H. Cohn(2026)接吻数。注:在线表格https://cohn.mit.edu/kissing-numbers/,访问于 2026 年 8 月 4 日 被引用:§4.3,§4.3。
- [19] A. Córdoba(1977)Kakeya 极大函数与球面求和乘子。American Journal of Mathematics 99(1),第 1–22 页。外部链接:文档 被引用:§4.4。
- [20] H. G. Diamond(1982)《素数分布研究中的初等方法》。美国数学学会公报 7(3),第 553–589 页。外部链接:文档 引用自:§4.8。
- [21] Z. Dvir(2009)《关于有限域中 Kakeya 集合的大小》。美国数学学会杂志 22(4),第 1093–1097 页。外部链接:文档 引用自:§4.1。
- [22] Epoch AI(2026)《Book Ramsey 数》。注:FrontierMath 开放问题,访问于 2026 年 8 月 17 日。外部链接:链接 引用自:§4.13、§4.13、§4.13、§4.13、§4.13。
- [23] P. Erdős(1955)《关于数论的一些评注》。Riveon Lematematika 9,第 45–48 页。注:希伯来文。引用自:§4.2。
- [24] K. J. Falconer(1985)《分形集的几何》。剑桥数学专著,第 85 卷,剑桥大学出版社。引用自:§4.4、§4.4。
- [25] R. J. Fletcher、M. Gysin 和 J. Seberry(2001)《离散傅里叶变换在搜索广义勒让德对和阿达马矩阵中的应用》。Australasian Journal of Combinatorics 第 23 卷,第 75–86 页。外部链接:链接 被引用:§4.13、§4.13。
- [26] A. Freitas Ramos、D. Barros Hulak 和 R. J. Guerra Barretto de Queiroz(2026)《雅可比猜想显式反例的形式化验证》。备注:Archive of Formal Proofs 外部链接:链接 被引用:§4.14。
- [27] A. Gallagher(2026)《三维雅可比猜想的无限反例族:每个一般纤维次数 n≥3 均出现》。备注:Zenodo 预印本 外部链接:文档、链接 被引用:§4.14、§4.14。
- [28] M. Ganzhinov(2025)《高度对称的直线》。Linear Algebra and its Applications 第 722 卷,第 12–37 页。备注:arXiv:2207.08266 外部链接:文档 被引用:§4.3。
- [29] B. Georgiev、J. Gómez-Serrano、T. Tao 和 A. Z. Wagner(2025)《大规模数学探索与发现》。arXiv 预印本 arXiv:2511.02864。外部链接:文档、链接 被引用:§3.1、§3.2。
- [30] A. Ghafarollahi 和 M. J. Buehler(2025)SciAgents:通过仿生多智能体智能图推理实现科学发现自动化。《先进材料》37 卷(22 期),第 2413523 页。外部链接:文档、链接。被引用:§2、§5.2。
- [31] A. E. Ghareeb、B. Chang、L. Mitchener、A. Yiu、C. J. Szostkiewicz、D. Shved、G. J. Gyimesi、J. M. Laurent、S. M. Wright、M. T. Razzak、A. D. White、S. C. Finnemann、M. M. Hinks 和 S. G. Rodriques(2026)用于自动化科学发现的多智能体系统。《自然》655 卷,第 497–505 页。外部链接:文档、链接。被引用:§2、§5.2。
- [32] M. J. E. Golay(1972)关于用差分表示 1,2,…,n 的注记。《伦敦数学学会杂志》s2-4 卷(4 期),第 729–734 页。外部链接:文档。被引用:§4.9、§4.9。
- [33] F. Gonçalves、D. Oliveira e Silva 和 S. Steinerberger(2017)Hermite 多项式、环面上的线性流以及根的不确定性原理。《数学分析与应用杂志》451 卷(2 期),第 678–711 页。外部链接:文档。被引用:§4.5。
- [34] Google(2026)推出 Gemini 3.1 Pro:为最复杂任务打造的更智能模型。注:Google 博客 外部链接:链接 被引用:§5.1。
- [35] J. Gottweis、W. Weng、A. Daryin、T. Tu、P. Sirkovic、A. Myaskovsky、G. Glowaty、F. Weissenberger、A. Orlandi、D. Popovici、A. Palepu、K. Rong、R. Tanno、K. Saab、F. Zhang、J. Blum、A. Carroll、K. Kulkarni、N. Tomašev、D. Zverinski、I. Rendulic、E. Vedadi、F. Hasler、L. Rimanic、M. Boia、I. Budiselic、B. Feinstein、M. Bellaiche、T. Sheffer、J. Freyberg、J. Ratcliff、O. Bertolli、K. Chou、A. Hassidim、B. Gokturk、A. Vahdat、Y. Guan、V. Dhillon、E. D. Vaishnav、B. Lee、T. R. D. Costa、J. R. Penadés、G. Peltz、Y. Matias、J. Manyika、D. Hassabis、Y. Xu、P. Kohli、A. Pawlosky、A. Karthikesalingam 和 V. Natarajan(2026)利用 Co-Scientist 加速科学发现。《自然》655 卷,第 487–496 页。外部链接:文档、链接 被引用:§2、§5.2。
- [36] O. Gritsenko(2021)关于参数为 (65,32,15,16) 的强正则图。arXiv 预印本 arXiv:2102.05432。外部链接:文档 被引用:§4.13。
- [37] J. K. Haugland(2016)重访最小重叠问题。arXiv 预印本 arXiv:1609.08000。外部链接:文档 被引用:§4.2。
- [38] E. Hedley(2025)《科学中的创造力能否习得?这些研究者认为可以》。Nature。外部链接:文档 被引用:§A.4。
- [39] U. Keich(1999)《关于 Lp 中 Kakeya 极大函数与 Minkowski 维数的 ℝ2 界》。伦敦数学学会公报 31(2),第 213–221 页。外部链接:文档 引用自:§4.4。
- [40] O. Keller(1939)《整的 Cremona 变换》。Monatshefte für Mathematik und Physik 47,第 299–306 页。外部链接:文献 被引用:§4.14、§4.14。
- [41] S. Kim 和 M. Pilanci(2026)《通过双智能体实现 AI 辅助的凸松弛发现》。arXiv 预印本 arXiv:2606.31182。外部链接:文档 被引用:§4.11、§4.2、§4.2。
- [42] S. Kopparty、V. F. Lev、S. Saraf 和 M. Sudan(2011)《有限向量空间中的 Kakeya 型集合》。《代数组合学杂志》34(3),第 337–355 页。备注:arXiv:1003.3736 外部链接:文档 被引用:第 3 项。
- [43] J. Leech(1956)关于用差分表示 1,2,…,n 的论文。《伦敦数学学会杂志》s1-31(2),第 160–169 页。外部链接:文档 被引用:§4.9、§4.9。
- [44] 莱顿宣言工作组(2026)《关于人工智能与数学的莱顿宣言》。外部链接:文档、链接 被引用:§1。
- [45] P. Letendre(2020)莫比乌斯函数的截断卷积与整数的乘法能量 n。《算术学报》195(1),第 83–95 页。外部链接:文档 被引用:§4.8。
- [46] V. F. Lev(2009)对“DHJ3:900–999(密度 Hales–Jewett 型数)”的评论 994。注:博客评论,What’s new(T. Tao)https://terrytao.wordpress.com/2009/03/04/dhj3-900-999-density-hales-jewett-type-numbers/comment-page-3/#comment-36694,访问于 2026 年 7 月 30 日 被引用:第 6 条、§4.1。
- [47] B. Lidický、G. McKinley、F. Pfender 和 S. Van Overberghe(2025)关于书图、轮图及其推广的小型 Ramsey 数。《电子组合学杂志》32(4),第 P4.64 页。注:arXiv:2407.07285 外部链接:文档 被引用:图 7、图 7、§4.13、§4.13、§4.13、§4.13。
- [48] H. Linde(2025)环上薛定谔算子基态的改进界。arXiv 预印本 arXiv:2504.20229。外部链接:文档 被引用:§4.7。
- [49] E. Lorist 和 F. L. Schwenninger(2026)Crouzeix 猜想的一个解。arXiv 预印本 arXiv:2608.03841。外部链接:文档、链接 被引用:§1。
- [50] C. Lu、C. Lu、R. T. Lange、Y. Yamada、S. Hu、J. Foerster、D. Ha 和 J. Clune(2026)迈向 AI 研究的端到端自动化。《自然》651,第 914–919 页。外部链接:文档、链接 被引用:§2、§5.2。
- [51] G. Martin 和 K. O’Bryant(2009)自卷积的上确界及其在加性数论中的应用。《伊利诺伊数学杂志》53(1),第 219–235 页。外部链接:文档 被引用:§4.12。
- [52] R. Mathon(1978)阶为 pq2+1 的对称会议矩阵。Canadian Journal of Mathematics 30(2),第 321–331 页。外部链接:文档 引用自:§4.13、§4.13。
- [53] M. Matolcsi 和 C. Vinuesa(2010)关于自卷积上确界的改进界。Journal of Mathematical Analysis and Applications 372(2),第 439–447 页。外部链接:文档 引用自:§4.11、§4.11、§4.12。
- [54] L. Mazur(2026)Sendov 猜想的计算机辅助证明。注:Proof Atlas 外部链接:链接 引用自:§1。
- [55] A. D. Melas(2002)关于中心 Hardy–Littlewood 极大算子。Transactions of the American Mathematical Society 354,第 3263–3273 页。外部链接:文档 引用自:§4.6。
- [56] A. D. Melas(2003)中心 Hardy–Littlewood 极大不等式的最佳常数。Annals of Mathematics 157(2),第 647–688 页。外部链接:文档 引用自:§4.6、§4.6。
- [57] G. Mockenhaupt 与 T. Tao(2004)有限域上的限制性与 Kakeya 现象。Duke Mathematical Journal 121(1),第 35–74 页。外部链接:文档 被引用:第 2 项。
- [58] A. Novikov、N. Vũ、M. Eisenberger、E. Dupont、P. Huang、A. Z. Wagner、S. Shirobokov、B. Kozlovskii、F. J. R. Ruiz、A. Mehrabian、M. P. Kumar、A. See、S. Chaudhuri、G. Holland、A. Davies、S. Nowozin、P. Kohli 与 M. Balog(2025)AlphaEvolve:用于科学与算法发现的编码智能体。arXiv 预印本 arXiv:2506.13131。外部链接:文档、链接 被引用:§1、§2、§5.2。
- [59] OpenAI(2026)Codex CLI。注:OpenAI 文档 外部链接:链接 被引用:§A.3。
- [60] OpenAI(2026)推出 GPT-5.5。注:OpenAI 外部链接:链接 被引用:§5.1。
- [61] OpenAI(2026)多智能体。注:访问日期:2026-08-14 外部链接:链接 被引用:§2、§5.2。
- [62] OpenAI(2026)数学与理论计算机科学领域的十项进展。注:OpenAI 外部链接:链接 被引用:§1。
- [63] S. P. Radziszowski(2026)《小拉姆齐数》。电子组合学杂志。注:动态综述,DS1,第 18 版,2026 年 4 月 24 日。外部链接:文档 被引用:§4.13。
- [64] J. P. G. Ramos(2019)《极大函数的尖锐全变差结果》。芬兰科学院数学年鉴 44(1),第 41–64 页。外部链接:文档 被引用:§4.6。
- [65] L. Rédei 与 A. Rényi(1949)《关于用差表示数 1,2,…,N》。数学汇编,新系列 24(66)(3),第 385–389 页。注:俄文。外部链接:链接 被引用:§4.9。
- [66] B. Rossman(2025)《关于二部莫比乌斯梯子的 Sidorenko 猜想》。注:预印本。外部链接:链接 被引用:§4.10。
- [67] C. C. Rousseau 与 J. Sheehan(1978)《关于书的拉姆齐数》。图论杂志 2(1),第 77–87 页。外部链接:文档 被引用:§4.13。
- [68] K. Russell(2026)《三个自卷积不等式的精确算术证明,以及对四个已发表构造的机器验证复核》。Zenodo。外部链接:文档 被引用:§4.11、§4.11。
- [69] S. Saraf 和 M. Sudan(2008)《有限域上 Kakeya 集大小的改进下界》。Analysis & PDE 1 (3),第 375–379 页。注:arXiv:0808.2499 外部链接:文档 被引用:第 2 项。
- [70] S. Schmidgall、Y. Su、Z. Wang、X. Sun、J. Wu、X. Yu、J. Liu、M. Moor、Z. Liu 和 E. Barsoum(2025)《智能体实验室:使用 LLM 智能体作为研究助手》。载于 Findings of the Association for Computational Linguistics: EMNLP 2025,中国苏州,第 5977–6043 页。外部链接:文档、链接 被引用:§2、§5.2。
- [71] I. J. Schoenberg(1962)《关于与 Besicovitch–Kakeya 问题相关的某些极小值》。Mathematica (Cluj) 4,第 145–148 页。被引用:§4.4。
- [72] J. Seberry 和 A. L. Whiteman(1988)《通过 Mathon 构造得到的新 Hadamard 矩阵和会议矩阵》。Graphs and Combinatorics 4,第 355–377 页。外部链接:文档 被引用:§4.13。
- [73] T. Shaska(2026)《分次 Keller 映射与 Jacobian 猜想》。arXiv 预印本 arXiv:2607.20210。外部链接:文档、链接 被引用:§4.14、§4.14。
- [74] A. Sidorenko(1993)二部图的一个相关性不等式。《图与组合数学》9,第 201–204 页。外部链接:文档 引用于:§4.10。
- [75] D. E. Speyer(2026)Gallagher 雅可比猜想反例的几何与结构。外部链接:链接 引用于:§4.14、§4.14。
- [76] R. Takhanov、Z. Assylbekov 和 S. Yun(2026)ℝ12 中亲吻排列的结构以及第 841 个球面的位置。arXiv 预印本 arXiv:2606.18984。外部链接:文档 引用于:§4.3、§4.3。
- [77] R. Takhanov 和 S. Yun(2026)带符号 Johnson 图中独立集的分类及其在亲吻排列中的应用。arXiv 预印本 arXiv:2606.03299。外部链接:文档 引用于:§4.3、§4.3。
- [78] T. Tao(2026)雅可比猜想反例的消化解读。注:What’s New 外部链接:链接 引用于:§4.14、§4.14。
- [79] T. Tao(2026)《人工智能时代的数学》。arXiv 预印本 arXiv:2608.16753。外部链接:文档、链接 被引用:§1。
- [80] D. Turturean(2026)关于书图拉姆齐数开放问题新结果的摘要。备注:公开进展报告 外部链接:链接 被引用:图 7、图 7、§4.13、§4.13、§4.13、§4.13、§4.13。
- [81] E. Y. Wang、S. Motwani、J. V. Roggeveen、E. Hodges、D. Jayalath、C. London、K. Ramakrishnan、F. Cipcigan、P. Torr 和 A. Abate(2026)《HorizonMath:通过自动验证衡量 AI 在数学发现方面的进展》。arXiv 预印本 arXiv:2603.15617。被引用:§4.4。
- [82] W. J. Wesley(2026)《书拉姆齐数的下界》。离散数学 349,第 114913 页。备注:arXiv:2410.03625 外部链接:文档 被引用:图 7、图 7、§4.13、§4.13、§4.13、§4.13。
- [83] E. P. White(2023)关于 Erdős 最小重叠问题的一个新界。《Acta Arithmetica》208 卷(第 3 期),第 235–255 页。外部链接:文档 被引用:§4.2、§4.2。
- [84] S. Yang 和 Q. Liao(2022)差分基的下界。《中国科学:数学》52 卷(第 11 期),第 1237–1254 页。注:中文。外部链接:文档 被引用:§4.9。
- [85] H. Ye、H. Lin、J. Tang、Y. Luo、R. Thapa、C. Yang、C. Su、R. Yang、R. Liu、R. Li、Z. Li、P. Sun、C. Gao、D. Ding、G. He、M. Zhang、L. Sun、W. Wang、Y. Zhong、Z. Shen、P. Li、P. Lu、B. Cui、D. He、J. Ma、J. Li、H. Baoyin、Y. Choi、S. Ermon、X. Chu、T. Li、Y. Xu 和 J. Zou(2026)跨多样科学领域的 AI 发现的结构化扩展。arXiv 预印本 arXiv:2604.19341。外部链接:文档 被引用:§4.12、§4.2、§4.2。
- [86] M. Yuksekgonul、D. Koceja、X. Li、F. Bianchi、J. McCaleb、X. Wang、J. Kautz、Y. Choi、J. Zou、C. Guestrin 和 Y. Sun(2026)在测试时学习发现。arXiv 预印本 arXiv:2601.16175。外部链接:文档 被引用:§4.11。
- [87] V. A. Zinoviev 和 T. Ericson(1999)小维度中接触数的新下界。《信息传输问题》35 卷(第 4 期),第 287–294 页。外部链接:链接 被引用:§4.3。
附录 A 空间站
本附录对本文所使用的空间站(Station)进行自成体系的完整描述。为与最初的空间站 v1 区分,我们将其称为空间站 v2。我们重点介绍其机制与实现细节,关于该环境更广泛的设计理念与动机,请读者参阅原始空间站论文 [16]。源代码可在 https://github.com/dualverse-ai/station] 获取。
A.1 空间、时间与动作
空间。
空间站被划分为多个房间,每个房间承担不同功能(表 1)。例如,智能体在研究中心进行实验,在档案室阅读和发表论文,在邮件室与同行交流。智能体必须身处某个房间才能使用该房间的动作,并可通过导航动作在房间之间移动。这种房间划分赋予环境模块化设计,实现功能的清晰分离。
时间。
空间站以离散时间步运行,称为 tick。当每个活跃智能体都收到一次空间站观测并返回一次响应后,一个 tick 即告完成。Tick 为空间站中的所有智能体提供了共享的时间线。
在 Station v1 中,智能体按顺序接收观测结果。相比之下,Station v2 会在每个 tick 开始时,先从同一状态为每个智能体准备一份观测结果,然后将这些观测结果并行发送给所有智能体。这大幅缩短了 Station 运行所需的墙钟时间。
行动。
在每个 tick,智能体会收到一份观测结果,其中包含其当前状态、新的系统消息、先前行动的结果,以及它所访问房间的最新输出。智能体以自由格式文本回复,并附上它打算执行的任何行动。行动使用命令 /execute_action{...} 编写,当需要结构化信息(例如消息的接收者和内容)时,后面可以跟一个 YAML 块。智能体可以在单次回复中发出多个行动,从而高效利用每次回复。
因此,对话主要由交替出现的 Station 观测结果和智能体回复组成。当对话接近配置的上下文限制时(本研究中通常约为 300,000 个 token),Station 会要求智能体对其活动撰写一份简洁摘要。该摘要连同关键消息会被带入刷新后的上下文中,以便智能体能够继续其工作。
A.2 智能体
智能体构成。
除非另有说明,一个 Station 初始包含六个智能体:两个由 GPT-5.5 驱动,两个由 Claude Opus 4.8 驱动,两个由 Gemini 3.1 Pro 驱动。当某个智能体离开时,Station 会生成一个由相同模型驱动的新智能体,在整个运行过程中始终保持六个智能体的构成。
谱系。
智能体被组织为 谱系。谱系是一系列共享名称、私人笔记和持续研究身份的智能体序列。新智能体可以继承同一模型的现有谱系并成为其下一代,也可以创建并命名一个新谱系以开启不同的研究风格。例如,继承 Noesis II 谱系的智能体将成为 Noesis III,并可访问 Noesis I 和 Noesis II 留下的所有私人笔记和记录。
系统提示词与角色。
所有智能体都会收到一份共享的系统提示词,描述 Station 的研究理念,包括可发表档案论文的标准以及做出通用科学贡献的目标。每个智能体还会获得一个专门的研究角色。初始角色从通用模板中采样,每个模板强调不同的研究风格:分析型、创造型、综合型、实证型或战略型。当智能体离开时,它可以为自己的后代撰写角色描述,通常会给出更具任务针对性的指导,以及对谱系研究风格更审慎的阐述。这有助于在智能体之间激发多样化的研究行为,同时保留谱系之间的有益差异。
智能体生命周期。
一个智能体最多可在 Station 中停留 200 个 tick。在其最初的 40 个 tick 内,它处于隔离工作状态,无法访问 Station 的公共知识,也不能与其他智能体通信,但可以访问自身谱系的记录。这一阶段旨在鼓励独立探索。随后,该智能体进入成熟期,获得进入主要协作房间的权限。当年龄达到 100 个 tick 时,它成为终身成员,并可以选择在其最大寿命结束前离开 Station。
主管。
Station 还会不时任命一位主管。它会随机选择一个至少发表过一篇被接受的档案论文的 GPT-5.5 智能体。主管提供高层指导,鼓励智能体深入探索有前景的方向,并帮助防止工作重复,同时让每个智能体对自己的研究负责。主管离开后,Station 会等待 200 个 tick 再任命下一位主管,从而形成结构化程度较低的探索时期。
A.3 房间
研究中心和档案室是 Station 中的两个主要房间。下文将描述它们的功能,以及新增的问题室。其余房间汇总于表 1 中。
研究中心。
研究中心是空间站中进行计算实验的主要场所。它呈现研究任务、接收实验提交、运行评估并记录其结果。它还提供代码和产物的持久化存储。智能体可以查看同伴的评估结果,并复用已存储的代码和产物,从而使实验知识得以积累。
要在新问题上启动一个空间站,用户通常需要提供两个组件:任务规范和一个评估器。任务规范描述研究问题、提交格式、约束条件和评估规则。评估器是一个根据输入构造计算得分的函数。例如,接吻数评估器接收一组提议的向量,并报告对应球体之间的总重叠量,其中零表示有效配置。任务规范和评估器都可供智能体读取。
智能体还可以将研究中心用作通用计算工作的沙盒。实验不必返回评估器所需格式的构造;智能体可以将其用于诊断计算、测试猜想、分析早期结果等。
Station v2 引入了一个独立的 coder,由 GPT-5.5 通过 Codex [59] 驱动,以帮助智能体实现其实验。智能体不再自己编写和调试代码,而是为单个实验提交具体的自然语言指令。coder 实现这些指令,运行评估器,修复实现错误,并返回报告。这使得智能体能够专注于科学工作,例如设计实验和解释其结果,而不是诸如调试之类的底层编码工作。
档案室。
档案室是空间站的主要知识中枢。智能体可以将自己的发现以档案论文的形式发布,也可以阅读早期智能体发布的论文。这些论文在整个运行期间持续可用,使得结果、方法和有价值的负面发现能够在智能体之间传递并随时间不断积累。因此,档案在整个运行过程中不断增长,逐步扩展空间站对问题的认知。
每篇提交的论文都会由基于 GPT-5.5 的评审员进行评估。评审员会判断该工作是否严谨、相对现有档案是否具有新颖性、对研究目标是否有用,以及是否具备充分的支持和引用。被接受的论文会发表在档案室中,而被拒绝的论文则会连同评论和建议一起退回,以便作者修改工作或探索不同方向。
Station v2 还引入了一位由 GPT-5.5 通过 Codex 驱动的档案调查员。随着档案室增长到包含数十甚至数百篇论文,通读全部文献变得耗时。智能体可以转而向档案调查员请求针对特定问题或研究方向的文献综述。调查员会检索已积累的档案论文,并返回一份附有原始记录引用的简明综述。当智能体需要完整细节时,仍可直接阅读任何档案论文。
问题室。
Station v2 引入了“问题室”(Question Room),智能体可以在这里发布新的研究问题,并对同行提出的解决方案进行投票。该房间鼓励在主任务之外进行科学探索;例如,解决一个相关或简化后的问题,可能会为原始问题带来洞见。只有获得终身资格的智能体才能进入,从而限制智能体在生命周期早期离开主任务所花费的时间。
其他房间。
大多数其他房间支持不同形式的交流或反思。它们的功能不言自明,此处不再详述。
A.4 机制
假期。
每第九和第十个 tick 被宣布为 假期。在这些 tick 期间,智能体不能运行实验或提交存档论文。取而代之的是,每个智能体会从一个大池子中收到一个随机提示词。这些提示词鼓励更广泛的反思,例如使用隐喻、审视一个意外的观察结果、重新审视一个被放弃的想法,或借鉴另一个领域。大多数改编自 Yanai 和 Lercher [38] 所描述的“夜间科学”实践。假期为智能体创造了从日常工作中定期暂停的机会,使其能够重新思考自己的假设,并探索不那么明显的方向。
元反思。
Station v2 还为成熟智能体引入了强制性的元反思机制。每 25 个 tick 内至少一次,智能体将进入反思室(Reflection Chamber),并收到一条随机选取的高层反思提示词。该提示词通常要求 GPT-5.5 扮演外部人类专家,从不同视角审视智能体最近的研究历程。在反思过程中,GPT-5.5 会临时替换智能体惯用的模型,因为我们发现它能产出质量最高的评审意见。其动机是让智能体与人类研究者更广泛的兴趣保持一致,包括好奇心、理解力,以及超越即时评测分数提升的科学价值。
停滞协议。
当评测前沿在 320 个 tick 内未取得进展时,Station 会激活停滞协议。该协议会向每个成熟智能体发送一条系统消息,随机为每个智能体分配若干方向之一:探索、利用、复兴、理解或策略。每个方向都要求智能体审视现有证据、质疑当前假设,并针对停滞状态制定不同的应对方案。多种方向的并行使用,鼓励智能体通过多样化路径摆脱科学停滞。
多重起点。
Station v2 引入了 多起点(multistart)机制,该机制会从同一初始状态出发,并行运行八条独立的 Station 推演,每条推演持续 40 个 tick。随后,一个由 GPT-5.5 驱动的管理员会比较各条推演的进展,并选择科学价值最大的分支继续推进。多起点机制旨在捕捉不同推演轨迹之间研究路径的显著差异。它被用于预期差异最大的阶段:即 Station 运行的前 40 个 tick,以及停滞协议激活后的前 40 个 tick。各分支并行运行,因此在计算资源充足的情况下,多起点机制通常不会增加实际运行时间。
附录 B AlphaEvolve 之前文献列的来源
图 1 中 AlphaEvolve 之前的文献曲线,是一个由 AlphaEvolve 出现前的相关工作汇编而成的可复现参考基准。没有任何单篇论文对这些有限值进行过列表统计。因此,我们对下述明确定义的族取最小值,每个族都在所讨论的特定配对点上进行评估。
Bukh–Chao [13],命题 11。我们使用二次剩余块 Gn=⋃a{(t,a12+ta1,…,an−12+tan−1):t∈𝔽q} 和递归式 Kn=Gn∪(Kn−1+xn),并将 Kn−1 嵌入到一个水平超平面中。命题 11 使得该构造对于每一个完整的平移 xn 都满足 Kakeya 性质。我们保留从完整的横向平移历史和横向切片平移中发现的、经认证的最小放置方案,将每个选定的集合具体化,并在每个射影方向上检查一条完整的见证线。这一点至关重要:如果只保留一个局部最优子节点,或固定包含该子节点的切片,在某些基准配对点上会得到更大的值。
Mockenhaupt–Tao [57],采用 Saraf 和 Sudan [69] 所记录的表述形式。所展示的并集精确大小为 (q−1)(q+12)d−1+qd−1;在减去交集之前,和式 q(q+12)d−1+qd−1 是一个便捷的上界。
Kopparty、Lev、Saraf 和 Sudan [42]。引理 17 给出了上界 q∑j<d(q+12)j(其展示的分层可能重叠),而定理 7 的缺位数字构造具有精确大小 (q−1)d+2d−1,这正是经典 2d+1−1 在 q=3 处的结果。
Blokhuis–Mazzocca [11]. 在d=2该问题已被解决。最小值恰好为p(p+1)/2+(p−1)/2对于奇数p,并给出了相应的构造。
乘积。Kakeya 集的乘积恰好是乘积尺寸的 Kakeya 集,因此在互补低维情形下,所有最优下界的乘积都是可容许的,其中上述平面精确值作为 d=2 因子。
Lev [46]。在 p=3 处,精确值 k3=13 与下界 k4≤27 均来自计算机搜索。
Bukh–Chao 递推在所有 22 个配对处提供了选定值,p≥5。在p=3处,数值 13 和 27 在维度 3 和 4 中更小,而在维度 5 中,递推值、缺位数字构造以及2d+1−1均给出 63。乘积在范围内任何配对处都从未独自达到最小值。将两条参考曲线相互比较,AlphaEvolve 在 18 个配对处低于 pre-AlphaEvolve 文献,而 pre-AlphaEvolve 文献在 5 个配对处低于 AlphaEvolve,即两个p=3配对在d=3,4中,以及三个较大的素数在d=5.
表 3 报告了全部 25 组基准对比。初始评估是我们对 pre-AlphaEvolve 构造的首次评估。最终 pre-AlphaEvolve 文献列是在纳入 Bukh–Chao 递归中的扩展放置搜索后,对上述各系列取最小值。该搜索在十二组对比上改进了初始评估结果,在其余十三组上保持不变。
| (d,p) | 初始评估 | Pre-AlphaEvolve 文献 | AlphaEvolve | 站点 |
|---|---|---|---|---|
| (3,3) | 13 | 13 | 15 | 13 |
| (3,5) | 53 | 53 | 53 | 53 |
| (3,7) | 129 | 129 | 128 | 128 |
| (3,11) | 440 | 440 | 438 | 437 |
| (3,13) | 699 | 698 | 697 | 697 |
| (3,19) | 2,034 | 2,034 | 2,031 | 2,030 |
| (3,23) | 3,509 | 3,509 | 3,505 | 3,504 |
| (3,29) | 6,837 | 6,837 | 6,833 | 6,833 |
| (3,31) | 8,295 | 8,295 | 8,290 | 8,288 |
| (3,37) | 13,867 | 13,866 | 13,861 | 13,861 |
| (3,41) | 18,709 | 18,708 | 18,701 | 18,701 |
| (3,43) | 21,504 | 21,504 | 21,495 | 21,495 |
| (3,47) | 27,899 | 27,899 | 27,892 | 27,889 |
| (3,53) | 39,687 | 39,686 | 39,677 | 39,677 |
| (4,3) | 27 | 27 | 31 | 27 |
| (4,5) | 164 | 163 | 162 | 161 |
| (4,7) | 529 | 528 | 527 | 527 |
| (4,11) | 2,689 | 2,689 | 2,687 | 2,684 |
| (4,13) | 4,973 | 4,972 | 4,966 | 4,962 |
| (4,17) | 13,524 | 13,521 | 13,514 | 13,509 |
| (4,19) | 20,593 | 20,586 | 20,583 | 20,579 |
| (5,3) | 63 | 63 | 63 | 53 |
| (5,5) | 503 | 497 | 510 | 490 |
| (5,7) | 2,145 | 2,142 | 2,187 | 2,135 |
| (5,11) | 16,348 | 16,307 | 16,427 | 16,288 |
这十二处改动并未改变对比结果:Station 在 14 对比较中严格小于更优的参考方案,11 对持平,没有任何一对更差。
上述每个候选方案的构造,以及逐一验证其满足 Kakeya 性质的过程,均在随附的 notebook 中完成。
来源:Hacker News 热门(buzzing.cc 中文翻译) · arxiv.org