Grant Sanderson 谈 AI 与数学的未来
Grant Sanderson – AI and the future of math
3Blue1Brown 创办人 Grant Sanderson 正在制作记录 AI 在数学领域进展的新项目。他在与 Dwarkesh Patel 的对谈中指出,AI 在 IMO 获金牌并不等于 AGI,只是又一个被攻克的基准。即使 AI 未来解决千禧年大奖难题,仍可能存在大量人类任务无法被自动化。对话还探讨了概念突破验证周期可长达一个世纪、Riemann 假设的 AI 证明能否被人类理解、AI 能否在已有文献间发现隐藏联系,以及现实经济任务难以套用强化学习环境等话题。
这次对谈没有停留在AI刷数学题的喜报上,而是追问了‘验证循环’和‘定义生成’两个终极难题。Grant Sanderson的视角让人重新思考AI的进展究竟缺什么,数学家未来的角色会是什么。
0:00今天我和 Grant Sanderson 聊天,他运营着 3Blue1Brown,现在正在做一个新项目,记录 AI 在数学领域取得的进展。我想和你聊这个话题,是因为 AI 在数学领域的进展速度超过了其他任何领域。
0:13所以这里发生的一切,以及我们看到 AI 进展发生或未发生的一切,都会告诉我们,随着 AI 变得越来越好,世界其他地方将会发生什么。所以我想从三年前我第一次采访你时问你的那个问题开始。我当时问你,
0:27一旦我们有了能在国际数学奥林匹克竞赛中拿到金牌的 AI,那不就等于是 AGI 了吗?鉴于这些问题有多难,它不就什么人类能做的事都能做了吗?你当时给出了一个答案,事后看来非常明智且正确,大意是,
0:40这只会是又一个基准测试,就像他们正在通过的所有其他基准测试一样。显然,自那以后 AI 在各方面都变得更好了,但当这件事发生时,不会有某个顿悟时刻。首先,我想了解你对为什么这被证明是正确的直觉判断。
0:56其次,我很好奇你认为这种狭隘性还能持续多久。那么到了 AI 解决了百万美元问题的时候,你认为到那时是否仍然可能有很多人类正在做的工作是 AI 在经济中仍然无法自动化的?
1:11 这是个有趣的问题,因为如果事先不知道解决方案长什么样,就很难回答。我的意思是,如果我们拿 IMO 来说,我觉得你三年前那个问题的精神在于,去看这些问题的一些解法是如何真正似乎需要创造力的。
1:26 而这些问题的设计者,会试图让题目涉及那些你没法那么容易通过训练来应对的东西。我觉得 IMO 不为人知的秘密是,其中很多题目你其实真的可以通过训练来应对。所以……随着整个 AI 与数学项目的推进,我认为,正如你指出的,
1:41 它之所以有趣,其中一个原因就在于 AI 存在一个尖刺状的前沿。数学恰好就位于其中一个尖刺之上。但这种尖刺性又有一种分形的特质,因为当你放大到数学内部的具体进展时,你会发现有些东西比另一些要容易得多。
1:56 所以如果我们只想想 IMO,这在现在已经算是旧闻了,差不多是两年前的事,它们确实做得相当好。如果不是因为下面这个原因,它们在 2024 年本可以拿到金牌。它们非常擅长。基本上就像是冷冰冰地解几何题。而 IMO 有这四类题目。
2:12 那就是几何、数论、代数和组合数学。所以几何在 2024 年大概 19 秒就能解出来,因为它有点像是一个暴力求解器。而不为人知的秘密是,对学生来说,也有一种类似暴力的方式可以应对。
2:26 组合数学是最像变数的那一类,题目看起来更像好玩的智力谜题。那一年的考试里有两道组合数学题。并不是每年都这样。一共四个类别、六道不同的题。所以哪一类会出两道题,多少有点碰运气。
2:43 如果当年几何题更多一些,它们那年就能拿到金牌了。但它在那些组合数学题上很吃力。而且,你知道,那些试图守护人类在数学上最后阵地的人可能会说,嗯,你知道,那些题恰恰是需要更多创造力的。不过即便如此,我觉得……
3:01 你那个问题的精神在于,比如,如果它们能解决,你知道,一个千禧年大奖难题,那是否也意味着它能胜任大量白领工作?这暗示着,从我们现在的水平到那一步之间的那个限速因素,和让白领工作做得更好的限速因素是同一个。而我们也许可以,比如,
3:17 描绘几种不同的路径,比如,我们聚焦于,我不知道,黎曼猜想。比如,解决它会是什么样子?一种可能是,这些东西在某个特定知识领域极其擅长,并且对它了解得极为深入,然后又了解另一个领域,再了解另一个领域,
3:35 而且你指出过这一点,拥有这种超人类广度、对所有这些领域都如此了解的东西,却不仅仅是在寻找那些连接它们的闪电,这感觉很奇怪。我想我们正在开始,我开始看到这方面的火花,就是真正在它所擅长的那些事物之间找到联系。
3:50 我相信我们会谈到这个话题。如果黎曼猜想的解决之道是类似那样的东西,那在我看来,它与精通白领工作所需要的能力是相当不同的。而且确实有理由相信,那或许正是其解决之道的本质。
4:04 我不知道你是否知道 Hugh Montgomery 和 Freeman Dyson 在 IAS 的那段故事。这算是题外话,但这是个挺有趣的故事,讲的是……我不确定那是不是在午餐时发生的。基本上,你有一位数论学家,他正在指出、试图理解
4:20 黎曼 zeta 函数零点对之间的统计相关性。所以黎曼猜想的核心就是,所有这些零点是否都落在一条直线上?这是你可以提出的一个定量问题。然后他写下一个公式。它看起来像是 1 除以 sin 平方之类的形式。
4:35 物理学家 Freeman Dyson 就说,我认识这个表达式。这个表达式出现在研究随机 Hermitian 矩阵特征值的过程中,而那正是研究原子核能级时会遇到的东西。这两个看似不同的东西在统计上竟然相同,这一想法在某种程度上促成了一个潜在的探索方向,那就是,嘿,
4:55 随机矩阵理论中是否有某些方面可能与黎曼 zeta 函数相关?我认为这在某种程度上仍是一个未解的问题,比如那里是否真有可挖掘的东西?但那种跨越两个不同领域的连接,就像如果黎曼猜想的解决之道最终是在探索
5:11 把这样的想法再往前推一步,它就带有那种你预期 LLM 擅长数学的特征。就好像它们是量子物理的专家,是解析数论的专家。它们应该能够以某种方式看到其中的相似性,
5:23 而不需要像 Montgomery 和 Dyson 那样恰好共进午餐、恰好聊到那件事。这跟白领工作完全不同,对吧?就你在多大程度上可能难以把 AI 当作编辑来用而言,问题并不在于它们什么都懂,而你只需要它们找出
5:39 中间那道闪电。另一种可能性是……什么才是恰当的类比?也许就像我们看待费马大定理那样,从费马提出这个问题的那一刻,到最终解答本身长什么样,最终这个解答涉及数学中极其沉重的机器,对吧?
5:57 所以这个问题的美妙之处在于,你可以把它表述得如此简单。你问的是,x 的 n 次方加 y 的 n 次方等于 z 的 n 次方。当 n 大于 3 时,它有整数解吗?而这……你可能会预期存在一种初等数论的方法
6:12 来处理它,但就我们所能判断的而言,根本没有。而实际的解答,你知道,也许存在某种更简单的东西,但这可能就是它必须有的样子。有如此复杂的一套思想,建立在围绕椭圆曲线数百年工作的基础之上。
6:28然后还有另一座像山一样的想法体系,围绕着所谓的模形式。这两座山都必须先建好,你才能提出那个把它们连接起来的正确问题。所以,如果黎曼猜想的解决方案涉及建造一座新的山,那是一种技能,
6:42就像能够提出正确的新想法的那种能力,感觉与他们目前智能的特征足够不同,以至于……这并不是说你雇佣的视频剪辑师本身就需要这个,但如果它能够建造出正确的新理论之山,
7:00从而明确我们该如何思考一个学科,那就是一种如此之高的智能水平,以至于它开始让人觉得——如果这没有渗透到经济中除数学本身的山之外的其他方面,那才会令人惊讶。
7:13是的。或者至少,即使它不能像字面意义上那样做白领人类能做的每一件事。是的。它也会产生变革性的影响,就像在 IMO 中拿到金牌并没有对世界产生变革性影响一样。首先,
7:25我想指出,我在这里完全是在移动球门柱,因为大约两三年前我采访 Dario 时,我问过这个问题:为什么他们没能利用其庞大的知识将想法连接起来,从而以那种方式做出新发现。那看起来像是那种事情,
7:38 即使是一个中等智力的人掌握了这么多信息,也能据此得出医学诊断——比如这种药会导致偏头痛,而另一种东西,你知道,不管是什么导致了什么,也许同一种药能同时治愈这两种问题。嗯,我也不知道,从一个局外人的角度来看,
7:53 数学显然像是一个领域,找到单位距离问题猜想的这个反例就是这类事情的一个例子。这完全是移动球门柱,但接着我们可以问,好吧,既然 AI 能做这件我们本应认为它们能做到的事了,那下一个基准测试是什么?
8:09 下一件会相当令人印象深刻的事情是什么?这里有几个候选想法。一个可能是首先提出有趣的问题。另一个是提出新种类的对象或概念化,从而创建或统一各个领域。关于第一个,
8:27 目前我们只是训练这些模型去,就像我们有这些千禧年大奖难题,因为黎曼提出了这个想法,这个黎曼函数,因为他认为它会与素数的密度有某种联系,或者如果这个函数的零点会与
8:43 素数有某种联系,所以弄清楚为什么我们一开始认为这是一件值得研究的有趣事情,为什么我们要构建这个对象并试图回答关于它的问题,回答关于它的这个特定问题,似乎就是那种会成为下一个基准测试的事情
8:59 我的意思是,你在那里举了两个很好的例子。对于任何对单位距离猜想感到好奇的人,有一个数学频道 Polylog 制作的非常棒的视频,他们在里面讨论了这个问题。而其中一位参与者——因为所有这些讨论都会促使人们反思做数学的过程,对吧?
9:15 他们会说,啊,这东西能做到这么厉害的事情。那这对我们意味着什么?他强调了这句话:好的数学家证明定理,伟大的数学家提出猜想,而最伟大的数学家提出定义。这或多或少正是你在这里的框架,关于那两类,就像我们需要猜想生成器,
9:33 然后是定义生成器,那才是顶级数学家。我不太理解你要怎么把它做成一个基准,因为通常当我想到“基准”这个词时,我想的是某种你有的东西——它就像一根球门柱,球穿过球门
9:48 或者不是,你不能清楚地说,是的,这完成了——部分是为了能够做像我们的 LVR 这样的事情,但也部分只是为了能够知道你没有移动球门柱,并且回答——你知道,OpenAI 可以拿他们的头条来宣称推翻了
10:00 单位距离猜想,因为这是一个清晰明确的——就像它确实做到了,对吧。而想象一下试图拿一个头条来宣称,比如 255.4 提出了一个非常好的猜想。我们保证所有人都认为这是一个好猜想。它就是不会以同样的方式打动人。
10:16 但这或许并不能否定这样一个事实:这仍然是值得思考的正确方向。所以,如果它最终以某种基准测试的形式出现,我们有一个分数说它已经超越了这个基准,我会感到意外,因为我们无法量化一个猜想有多好。
10:30 但大概它的本质会是:你在与数学家的对话中会感受到一种语气上的转变,关于怎样与它协作才是有用的,对吧?还有你提到的那一系列内容,目前完全还没有制作出来
10:43 而且可能还要再过几个月才会推出,它的形式是我们采访很多数学家。有趣的是,我们大概一年多前就开始做这件事了。看到他们谈论 AI 的方式出现了一点语气上的转变,这很有意思
10:54 从大概 2025 年中期到我们现在所处的 2026 年之间。你知道,在现实世界里,那是一段非常短的时间。在 AI 世界里,那是极其漫长的岁月。而我们能够在这段漫长岁月中看到这种语气上的转变。我认为你衡量猜想生成能力的方式将会
11:10 更多地依赖于那种语气转变上的主观判断,届时会是数学家在说,他们不仅仅是用它来解决自己的问题,而且当他们退一步思考自己的研究领域究竟应该是什么时,与某某模型的对话对此确实有帮助。
11:24 我不认为它有可能以一条标题的形式出现,说这又是一个被攻克的基准测试。
11:32 对,所以很有意思的是,那些你没法为之制定基准测试的东西,也正是——至少在当前的范式下——你没法轻易训练的东西,对吧?因为基准测试和训练环境之间其实并没有本质区别。我觉得很容易构想出某种二分法,比如,
11:50 这里有一个深刻的原因解释为什么 AI 做不到某件事,然后结果发现,好吧,你只是思考方式不对,实际上我很快就能做到了。但我要提出……你还是要提出几个的,对吧?而且我觉得这很可能,
12:04 很可能结果是,在相对近期的未来,我们会有办法训练 AI 去做这类事情。但这似乎必须不同于当前的 RLVR 训练。所以我好奇的事情是,
12:13 而且在我看来,推动数学和科学总体上取得许多重大进展的,正是提出一种思考问题的新方式,或者理解世界的新方式,然后……统一不同的领域,催生出全新的领域,
12:30 解决我们一开始甚至没想过要解决的问题。爱因斯坦思考广义相对论,并不是因为他想解释光为什么会弯曲,或者黑洞为什么存在。这些现象他一开始甚至不知道需要被解释。但在数学中,似乎常常……
12:46 好吧,一个彻头彻尾的门外汉,我甚至不了解自己在这里谈论的细节。从外部来看,似乎常常有一些方法……比如说证明一个具体问题,从而激发一种新的概念化,一种催生出全新领域、全新思维方式的概念化,它极具生产力,而另一种则不然。
13:04 我想,我很想听听你谈谈,Galois 提出群论来区分他关于五次方程无根式解的解法,而 Abel 在几年前提出了一个不同的证明,那个证明没有引出群论,但后来……
13:18 如果你想做一个验证回路,比如群论是不是一个有趣的概念,这里是不是做出了有用的东西,为什么这个证明可能更好,那个验证回路长达一百年,它涉及密码学的出现、物理学的进展,以及那些思想……
13:33 在群论中变得相关,并理解物理学中的对称性以及诸如此类的东西。这就像一个长达一百年的验证回路,但为什么这从一开始就是一个富有生产力的概念呢?
13:41 是的,天哪,是的,你触动了一根神经,因为我有一个关于 Galois 的项目,本来打算在 2022 年做,但我把它搁置了,不过我花了大约一年的时间大量思考他所做的事情。所以我有可能不小心在细节上讲得太久。
13:56 你可以在这点上反驳我。这对你的论点来说是个完美的例子,因为解释它为何是一项有价值的洞见,并不来自即时的实用性。所以当然,如果你在考虑 RLVR 环境,那就像是,好吧,这会非常难做。但有意思的是,即便有像人类
14:17 当时的人类验证者,也花了很长时间才认识到它是有用的。我觉得爱因斯坦的广义相对论,人们多少能感觉到,你立刻就能感觉到这像是个好理论。伽罗瓦理论之所以是个如此有趣的例子,是因为你实实在在地有这 100 年跨度的一个想法
14:34 它流经许多不同人的头脑,最终才沉淀为数学界一致认可的好东西。稍微往回退一点,我是说,你到底想不想要这个问题的背景?好吧。那么,我们在学校里都学过二次方程求根公式。
14:50 我还以为你要说,我们在学校里都学过群论呢。我错过了那门课。我们都学过群论,学过二次方程求根公式。
14:57 所以这在某种意义上是已知的,比如希腊人能解二次方程,但他们并不真的用代数来书写。所以更像是阿拉伯人写下了那个公式。有一个有趣的故事,讲的是几个……决斗的意大利数学家,不是真正的决斗,只是智力挑战,他们偷偷地找到了一个公式
15:18 三次方程。紧接着不久之后,又找到了四次多项式的求根公式。于是,对数学家来说,一个自然的未解问题就是:能不能找到一个求解五次方程的公式?至于四次方程,那已经是个怪物了。要把它写下来简直疯狂。你通常并不会真的把它完整写出来。
15:36 你会把它拆解成一种程序化的东西。所以你可能会相信,这些东西有着这种指数级增长的复杂度。于是几百年来,没有人真正回答那个问题。通常我们说阿贝尔是第一个证明它的人。他是那位年轻、早慧的挪威数学家,他证明了这根本不可能。
15:54 并不是说你能找到一个五次方程的求根公式。他以为自己找到了一个,但他证明了这是不可能的。不过我认为真正的功劳,你得稍微往回退一点,谈谈拉格朗日,因为拉格朗日找到了就这个问题该提出的正确问题。
16:08 如果你愿意,我可以深入细节,但我会讲得非常高层。他在研究这个问题时,意识到能够求解这些多项式,实际上与理解某些代数表达式的对称方式密切相关,也就是它们对称程度的高低。
16:24 比如,如果我写下 a 加 b 加 c 加 d,就像把四个变量相加,表达式的值不会改变;而如果我写成 a 加 b 乘以 c 加 d,某些其他排列不会改变它,但有些排列则会改变它。而他有一个非常
16:38 这个洞见很妙:如果你能找到像这样带有四个自由变量的表达式,它就能与把四次降为三次这件事产生出人意料的关联。于是他开始着手研究,比如,我们能不能找到一个五次多项式,他心里想的是,不知道我能不能把那个方法推广出去。而要推广那个方法,
16:57 你就得有一个带有五个自由变量的表达式,使得当你对它们进行全部五的阶乘种排列时,它只取四个或更少的值。所以你可以把这个放进一本谜题书里。你可以把它放进一道脑筋急转弯里,连一个 12 岁的孩子都能参与进来。
17:12 而且不难发现自己会觉得那是一项不可能完成的任务。于是 Lagrange 坐在这里说,嗯,这是我试图解决这个问题的一个策略。我能找到一个五次多项式吗?这个策略不行。看起来这也许是不可能的,至少从这个策略来看是这样。
17:28 但那是历史上第一次,人们有了一种直觉:某种关于对称性的问题才是研究这些多项式的正确方式。在他心里,这只是一种方法。当时尚未发现的是,实际上存在着更紧密的关联。而且,也许与其去寻找那个公式,
17:43 我们不如反过来问:你能不能证明这是不可能的?所以他算是埋下了那颗种子,大约 50 年后,Abel 肯定读过 Lagrange,并受到了影响。Galois,我们知道他热爱 Lagrange,那时他正像坠入爱河一样爱上数学,所以很难想象
17:57 就像这两位年轻的天才,他们针对那个问题提出了相当相似的洞见,这并非源自 Lagrange,但回到你关于能否验证这是一个好想法的问题——Lagrange 并没有得出任何类似的结果。
18:12 从来没有那种情况——他解决了问题,因此我们就知道那是正确的提问。他提出了这个问题。其中有些内在有趣的东西。而且这在当时的数学中也并不太重要。就像大多数人更感兴趣的是它在物理学中的应用。这几乎是在
18:26 那种像是边缘的、近乎消遣性的业余爱好者的东西,就像 Abel,你知道,他开始研究五次方程相关的东西,但后来有人建议他把更多精力花在研究椭圆函数上,所以在他英年早逝之前,他的更多工作是在那方面。他 26 岁死于肺结核,然后是 Galois,他
18:46 把这两个想法都推向了正确的方向,他真正理解了抽象的本质。所以他在狱中写下了一篇非常精彩的文章。他就像——我们可以大谈他的生平故事。那相当疯狂。但他就是这样一个少年。他在监狱里。
19:01 他曾试图提交他的数学论文,但都被拒绝了。所以这又像是可验证的奖励。那个验证函数——也就是当时的学术界——拒绝了他写的东西。因为坦率地说,它并不太连贯。它不是一个完整的证明。他并没有清晰地表达出像是……什么
19:15 这个理论实际上是这样的——他当时就像一个初出茅庐的年轻数学家,正在摸索自己的方向。所以那里的可验证奖励,可以说并不理想。但他有一种直觉,觉得那里确实有些东西。于是他写下了这篇论述,谈论数学的本质是什么,它是某种……
19:30 它会随着时间经历这些转变,他谈到了代数本身的出现,从仅仅用数字来思考,转变为对纯代数表达式拥有某种流畅的驾驭能力,不再被束缚于对这些表达式进行解读,而他有一种直觉,觉得还存在另一个抽象层次……
19:48 那似乎才是我们应该做的事——与其思考公式本身,不如思考那些公式背后 underlying 的对称性。但这在当时仍然是一个相当不成熟的理论。所以如果你想问,好吧,他所解决的那个可验证奖励,是不是一个别人没有解决的问题?
20:03 那就好比,Abel 证明了五次方程不可解。然后你说,Galois 在做什么呢?嗯,原则上,Galois 理论能让你做的事是:取一个具体的多项式,它给你规则来判断那个具体的多项式是否有你可以写下来的根。比如说,
20:16 就像 x 的五次方减一,你知道一个解是一,或者 x 的五次方减二,你可以写下二的五次方根。所以并不是每一个五次多项式你都写不出解,而是你能不能找到一个具体的多项式,证明你无法用根式写出它的解?
20:30 他甚至也没有精确地解决那个问题。
20:32 他有一个更抽象的思路,他并没有针对某个具体例子展示自己做不到。所以即便是描述他到底解决了什么问题,都非常棘手。然后他就死了。这是一个非常浪漫的故事——他卷入了一场决斗。我们可以再深入聊聊这个。
20:45 围绕这件事有很多传说,据说他在决斗前夜把自己所有的想法都写了下来。实际上,在此之前他已经尝试发表这些想法大约五次了。
20:50 研究五次方程似乎对你的健康没什么好处。
20:52 非常糟糕。是啊,是啊,是啊。如果你是个年轻的天才,别去碰五次方程。于是他请求他的兄弟和密友,把这些笔记交给 Gauss,交给当时那些重要的数学家,因为我觉得这里面有东西。即便到了那时,事情也没有真正被接受,
21:06 他的兄弟和朋友试着把这些笔记传出去。又过了 20 年,Louisville 才看到这些笔记,才意识到里面可能有些东西,并试着去整理和理解——Galois 到底想表达什么。而即便到了那时,
21:19 又过了大约 20 年,Jordan 才真正整理出一套……某种类似现代群论处理方式的东西,而他们将其归功于 Galois。你很容易想象历史走向另一种可能——这些想法从数学的其他方向逐渐浮现出来,而 Galois 本可能在历史中被遗忘,如果他
21:37 不太像那种辞藻华丽的角色。但从 Lagrange 的时代,那种隐约觉得也许根的对称性才是正确路径的直觉,到一切看起来都像现代群论的样子,这中间跨度很长。很多时候,它甚至都过不了人类评审员那种经过验证的奖励,对吧?
21:54 因为它就像被放到某个人的桌上。他们说,我真不知道这里面有没有什么东西。它被放到某个人的桌上。他们不知道。你得有这么一个能认出它来的人。而即便到那时,它在那个阶段也并没有真正解决实际问题。就像你指出的密码学和物理学之类的东西。
22:07 你得进入 20 世纪,才会有像 Gell-Mann 这样的人去想,嗯,也许理解某些群如何分解的本质,与粒子由什么构成之间存在某种关系。而他就基于一个纯粹的群论问题预见了夸克。
22:25 而群论比较有意思的应用之一就是,甚至要预测夸克的存在,都是一个群论式的问题。那已经是拉格朗日之后很久的事了,远在任何类似的东西出现之前。所以你必须问:衡量进展的方式,如果不是基于解决某个问题,那又是什么?
22:44 而这在某种程度上捕捉到了:当伽罗瓦说“我觉得这里面有点东西”时,他脑海中那种直觉是什么?当拉格朗日说“我觉得这才是思考这个问题的正确方式”时,他脑海中的直觉是什么?当刘维尔说……时,他脑海中的直觉又是什么?
22:57 这些来自这位早已离世的年轻人的零散笔记,说不定还真有点东西?这很难说清楚,但我的意思是,我现在正在做的另一个系列视频,讲的就是“压缩即智能”这个理念,尽管这其实并不是
23:13 我所采取的角度。你知道,这个想法确实有几分道理:更简洁、更具预测性的表达,感觉上更智能。所以我很好奇,你能在多大程度上给出某种可验证的奖励,不仅仅是针对你是否解出了它、或者它解的是什么,
23:29 而是针对解决它所需要概念的简洁程度。我的意思是,回到黎曼猜想的证明,如果 AI 解出了它,那会是什么样子?我认为它可能发生的第三种方式,就是直接和你可能用初等证明来证明费马大定理一样,
23:44 那种证明只是铺陈在数千页之上,会让人读不懂,但更清晰的看待方式是用椭圆曲线那一套。也许存在某种上千页的黎曼猜想证明,没人能从中真正得到什么,而你真正想要的其实是
23:58 那些想法的简洁版本、压缩版本是什么样的,它们会更容易被人类理解。我不知道,比如柯尔莫哥洛夫复杂度,也许你可以把它纳入你试图量化“优雅”含义的尝试中。但我不觉得这很容易,
24:15 但我确实认为,为了奖励类似伽罗瓦那样的直觉,而不是仅仅奖励“你是否解决了一个问题”,这是你必须做的事情。
24:23 要为科学提炼出启发式方法是非常困难的。但很明显,人类一直在以某种方式这样做,而且显然 AI 在某个时候也会做到。这不仅在……
24:34 在可验证奖励的层面是相关的,而且大概最终目标是理解,比如人类的理解,所以即使你确实有某个数学东西的千页证明,或者某个宏大的新物理理论,目标也是理解。对,没错。也许如果目标是预测能力,你大可以让……
24:50 自动化工程师去造火箭飞船之类的。我们就像,我们完全不知道这些东西是怎么运作的,但我们能在恒星之间穿梭。但会有很多人想要理解。你仍然会想要那个无论是什么的精简函数,把……
25:03 这种复杂的思维方式蒸馏成正确的那一个,就像牛顿的万有引力定律那样。你仍然会想要训练 AI 能够做到这一点,并找到压缩后的表示。
26:15 AI 会证明它们的人类假设,而我们对数学的理解并不会因此变得更好。关于这一点我有几个问题。第一个是,这是不是你应当预期会发生的事情。难道人类提出一般性自然对象和子目标的原因不正是……
26:34 当我们在处理一个大问题时,情况就像你在试图解决一个复杂而重要的问题,所以我们可以从理论上想一想,相比其他方式,这是否会是一种更简单的解决黎曼假设的方法
26:46 而不是仅仅提出那些与思考该问题相关的自然抽象概念,然后从经验层面来看,这就是我们今天在 AI 确实取得进展时观察到的现象吗?当 AI 提出那个针对单位距离问题猜想的反例时
27:00 你完全可以直接阅读它的思维链,对我来说似乎无法理解,因为我对数学一无所知,但在其他数学家看来,它似乎是可以理解的,它利用了已知的数学概念,并且证明了它们之间的关系
27:12 以及所有的自然语言,结果加速了我们对这个对象与这个猜想之间联系的理解,那么从经验层面来看,这真的是我们应该担心的事情吗
27:23 我认为这取决于其性质。是的,再说一次,如果我们把解决黎曼假设的三种可能方式拆解一下,那一个以及今年另一个重大的问题,是某个编号大约为 1196 的 Erdos 问题,但它涉及的是所谓的本原集。
27:40 但基本上,它具有从看似不同的领域引入一个想法的特征。一旦你把这个基本想法呈现给一位数学家,你说,嗯,如果我们试着用这个,比如尝试马尔可夫链过程,在其中我们展示
27:54 这件事是从下而上、以概率方式构建的,而不是自上而下,并且要用 von Mangold 函数。如果你对懂行的人这么说,他们大概就知道该怎么接着往下做了。所以你有了这个非常小的想法,它具备某个领域专业知识的形式
28:06 一个领域的专业知识,另一个领域的专业知识,在它们之间画一道小闪电。就像那些——那些将会是非常容易被人类解析的,对吧?因为你所要做的只是展示那些连接起点和终点是什么。如果它的性质是造山,
28:19 你确实得投入多得多的时间去理解那座被造出来的新山,因为它就像一条新的线索,而不只是它们之间的一道闪电。而如果进展的本质只是纯粹的苦干,对吧?就像这个超级长的东西,
28:32 没有新理论,但它只是一条长长长长的推理链和答案。那么你就会遇到那种情况,就是好吧,这里有一整个消化过程,所以我不认为有一个明确的答案,我认为这取决于那里的解决方案会是什么样子,而在造山这一侧,
28:46 我其实会非常感兴趣地想知道,它默认是不是非常容易被人类理解,就像我们从伟大数学家那里看到新理论的方式那样,还是说它像一座外星式的、不同类型的山正在被造出来,以至于我们甚至不得不重新处理那些种类
29:00我们与之打交道的那些抽象概念,对吧,这里最接近的例子大概就是那个,你知道,对 ABC 猜想的尝试性解答,我们也许不该深入那个话题,但它很可能不是一个正确的解答,但基本上它是一种全新的思维方式
29:18是由日本那位原本声誉卓著的数学家想出来的。而数学家们花了很长、很长时间才勉强理解他在说什么,但它给人的感觉就像是一块外星数学,属于理论构建。它不仅仅是长期的
29:32所以你会有这样的担忧,就是,是的,它确实会那样,最大的担忧就是它会那样做,然后就像 ABC 猜想一样,人们花了好几年去攀登这座山,如果它最终被证明是错的,那这一切就不对了,但它当时看起来确实是对的
29:49即使它是对的,攀登一座新山也需要付出大量努力,是的
29:54如果我们最终陷入那种境地,David Bessis 写过一篇非常棒的博文,叫《定理经济的衰落》,他在里面谈到了这一点,你知道,从历史上看,正如你所说,数学是围绕着这些定义和问题展开的,核心就是证明关于它们的定理。
30:12而真正获得所有功劳的其实是定理证明那一块,但它其实像是寄生在定义那一块之上的。而且在历史上,这甚至算不上一个功劳分配的问题,因为如果你提出了一个定义,你很可能就是那个会提出定理的人。
30:27 但现在我们面临的情况是,如果有价值的工作在于提出洞见,而 AI 只是把后面的部分自动化了。那么,好吧,想象一个场景:AI 针对世界上一些重要的猜想,提出了类似 Abel 那样的直接论证,然后我们就有了这些证明。
30:46 而接下来就取决于人类或未来的 AI 去整合——我的意思是,我相信如果你能接触到它,它会让你更容易去思考,比如,这里到底发生了什么?有没有某种更深层的方式,让你能够理解为什么这个证明成立,
31:07 从而让你更容易提出群论背后的那些想法?
31:10 是的,我觉得会……那会有巨大的帮助,对吧?因为尝试发现新数学的过程,很大程度上就是在不断犯错。你在试图解决一个问题。它感觉并不像是沿着山路不断迈出正确的步伐。大多数时候,它感觉像是一场随机的醉汉漫步,你只是在做某件事。
31:29 所以,至少如果你知道,试图消化你所掌握的东西最终会导向一个正确的解,那感觉就像是进步,仅仅因为它提供了一种知道它通向某个解的确定感。而且在数学的近代史上有大量这样的例子,
31:46 感觉像是所及超出了所握,有些东西在被理解之前很久就已经被证明了。而我个人最喜欢的论文开篇之一——它甚至不算是一篇研究论文,更像是一篇阐述性的文章——
31:59 其中一个来自一位名叫 Timothy Chow 的数学家,他当时试图理解一个叫做“力迫法”(forcing)的概念。于是就有了这个叫做连续统假设的问题,它大致是在问:自然数有一个无穷大的大小,实数也有一个无穷大的大小,那么两者之间是否存在某种中间的大小?
32:16 而答案是既存在又不存在。这取决于你采用哪套公理。它某种程度上超出了我们通常公理系统的范围,这是一个很有意思的答案。但描述它的方法真的非常非常难以理解。这就是所谓的力迫法。而在这篇论文的开头,
32:30 他写道,每个人都知道“未解决的研究问题”这个概念。那么我想提出一个概念,叫做“未解决的阐述问题”——也就是说,我确信我们已经证明了它,但我们并不真正理解它为什么成立。然后他突然提出了针对这个阐述问题的一个部分解决方案。你能想象我为什么喜欢这个框架吧,
32:47 因为这正是我一生的追求。我不做研究型数学,它完全就是关于——什么是最清晰的理解方式,即使它已经被证明了。就像证明和解释之间是有区别的,等等。在那一方面,我觉得你基本上触及到了这种区分的重要性。
33:04 是的。而这将成为主要的激励因素,或者说这种激励不仅需要在数学中改变,在其他科学领域也需要改变——从证明关于世界的命题,转向将证明整合为问题或更高层次的洞见。不过我们之前在午餐时讨论过你最近做的一场演讲,
33:25关于设计,以及它如何帮助我们理解事物。那么,在极限情况下,对一个想法的概念化与想法本身之间,真的存在区别吗?所以,你知道,如果你想想狭义相对论,想想时空图和闵可夫斯基时空,是不是就像,是的,这就像是我们用来阐明这个想法的一种方式
33:47比如为什么会有长度收缩和时间膨胀。但这是不是就像,是不是就像那就是现实本身?所以在这里,这种阐述似乎在某种意义上确实就像是解释。
33:58是的,我是说,这里面有几件有意思的事。其一,那些提出真正新颖洞见的人,与那些在沟通表达上实际上相当清晰的人之间,似乎存在非常强的相关性。比如,你可能会想,鉴于大学生的体验往往是
34:14在那里教他们的专家未必是那个主题最好的讲解者,因为他们被自己的专业知识惯坏了。但至少在某些情况下,似乎情况是……那些真正提出相当新颖东西的人,比如你有爱因斯坦,或者像克劳德·香农,
34:29诸如此类,你去读他们的论文,那是非常清晰的论文,对吧?不会让人觉得,哦,这只是写给专家的,你得拿砍刀劈开才能读懂,他们就像是非常出色的阐述者,费曼也有这个特点,非常出色的阐述者。所以也许……
34:44 大脑中那个能在研究层面想出正确的新思考方式的部分,同样也具备擅长出色解释的能力。我认为这与 AI 的情况相关,我过去曾认为 AI 会变成这些自动定理证明器,
34:59 但数学家的角色将转向类似我的工作,也就是解释这些东西。我有点怀疑,实际上它们也会相当擅长做这件事,而且很可能在解释那一半和提炼那一半上,比大多数人类做得更好。
35:14 而实际上留给数学家的并不是这些,而是消化并解释正在发生的事情。很可能事情的发展本质就是如此。我可以设想——我们可以讨论一下可能并非如此的方式——但很可能那个能提出
35:28 真正出色的新想法、解决某个新问题的同一个东西,也恰好擅长解释它。是的。这就是我新的——这是我信念发生改变的一种方式。
35:37 你认为你最后会做的事情是什么?既包括你自己,也包括数学界、人类数学界将会做什么?
35:45 我可能会一直做类似我现在做的事情,直到我死去。即使,就像,即使……我知道末日论者是对的。
35:54 也许那也会是一样的。正是如此。原因也会是一样的。
35:58 对,对。你知道,这就像,你给一个人生一堆火,他能暖和一夜,但你把一个人点着了,他这辈子都暖和。所以我对 AI 就是这种感觉。不,我,因为有些
36:10 讲解者或老师的一部分作用,是给某个人好奇的东西增加清晰度。这是一方面。但另一部分则更偏向关系性,更像是提供动力、提供一种策展感。我听过一个有趣的观点
36:26 说的是数学家最终会变成什么样,其实更像艺术博物馆的策展人,而不是别的什么。他们解决问题,所以艺术已经存在了,对吧?他们甚至知道怎么把它解释得非常好,你知道,全都在那儿了。你仍然希望有人能帮你在这个近乎无限的空间里导航
36:43 去判断哪些想法值得投入,就像有人在帮你做这件事。而这一点,即便 AI 在某种意义上更擅长,我觉得我们还是会始终更偏好一个和我们有关系的真人,因为我们被激发去对某些事物产生兴趣的方式,本质上是一种社会现象。
37:00 如果你要构建某种特定的技术,那可能就不一样了。你在那里需要知道。听这个播客的人,他们某种程度上信任你的策展,信任你对什么才算有趣话题的判断。他们不是随便落到这里的,不是因为你的下一个
37:13 话题是,这就像是他们此前想要理解的东西,他们信任你,是的,所以我的角色,可以说还有其他数学家的角色,可能实际上只是微妙地转向那个策展方向——判断哪些想法值得展示,而这占了很大一部分
37:28 我现在的工作,甚至现在,基本上就是——我觉得人们很多时候以为一个视频的功夫都花在视觉呈现上,当然有一点,不是立竿见影的那种,但实际上很大一部分只是决定什么值得在一开始说出来
37:41 或者什么值得放在那里,嗯,因为那就是——我就想参与其中,而且我觉得我和某些人之间有信任,他们好奇我会选择提出什么,即使 AI 在这方面做得更好,也是同样的道理
37:54 就像人类音乐家永远会有自己的角色,因为那种社会功能——他们背后的故事,即使某个模型产出的 mp3 文件在客观质量上更好,这大概就是我看到发生在我工作上的情况,是的
38:08 我想回到之前那个问题,我们当时在说,就在 AI 跨过这个门槛——这个重要的基准,即能够把现有想法连接起来,得出新发现,或者证明或证伪某个东西——就在它跨过
38:23 这个门槛的时候,我们就像,好吧,但下一件事是什么,嗯,我只想,嗯,有
38:27 顺便说一句,这件事还有很多工作要做,就像仅仅因为已经有一些闪电被激发出来,我仍然认为未来几年会有一个蓬勃发展的前景,就是真正把这些连接起来,所以
38:36 在极限情况下,你甚至可以说,嗯,我不确定这样说是否准确,但可能很多也许是最大的突破在某种程度上看起来就是这样。就是广义相对论。哦,你只是把黎曼几何和狭义相对论连接在一起,对吧?
38:54 所以随着 AI 在这种连接的事情上变得越来越好,也许很多重大突破其实并不是真正具有不同的质性。我不知道你对此有没有看法。
39:04 我的意思是,很多讨论的焦点一直集中在问题求解以及数学的那种本质上,你知道,比如攻克 Erdős 问题之类的。我想说,甚至可能不是大多数数学家会把他们的工作描述为真正瞄准下一个要攻克的问题。
39:18 你熟悉 Langlands 纲领吗?不。啊,好吧。它甚至不太算是一个数学领域,它更像是一种研究精神,费马大定理只是其中的一个端倪,你有两个看似毫不相干的东西,而它们之间的联系引出了一个解。Langlands 是一位数学家。
39:39 他现在有一封很出名的信,基本上阐明了为什么很可能存在更多类似的联系。而且他甚至对这类联系的性质讲得更具体了一些,以至于你可以想象这样一张巨大的地图,上面有这样一个山谷,还有那边那样一组平面
39:56 有很多数学家会把他们的工作描述为试图理解这张地图上的线索。而那里的进展,甚至并不是说“这就是那个我们知道会被这种联系解决的具体问题”。更多的是,已经一次又一次地出现过足够多的案例
40:11 那些重大问题被攻克,靠的是找到联系,几乎是先发制人地去寻找联系。所以你可以有——是的,其实非常有意思的是,这个,嗯,每当你遇到一位数学家,问问他们,他们工作的性质更接近 Langlands 纲领,还是
40:30 更接近瞄准某一个特定问题,你会看到某种二分化的分野。但 AI 成为超强连接器的可能性,感觉可能会成为这一追求中的一种放大工具。不过很难衡量,对吧?因为这正好切中了我们之前所说的。
40:51 你怎么给“是的,你做到了”打分呢?如果攻克的是一个具体问题,你就有明确的方式说,是的,你做到了。你可以写出标题。你可以作为 AI 公司做公关宣传,说这是我们做到的。
41:03 而如果感觉那是正确的关联,你就可以围绕它写出定理。这就是该领域论文的样子。但我认为……我认为这会需要更多类似人类在环的方式
41:14 基本上就是说,我们追求的是什么样的关联,但这就是我的猜测——这些模型在未来五年内大多数有用的进展会是什么样子,就是真正去填充那片关联的图景,如果你是专家的话就能画出的那些关联
41:30 在多个领域,正如你指出的,有点令人惊讶的是我们居然还没有实现这一点,而我好奇的是——我会好奇从技术层面来说,是什么导致了那里的突破?因为一方面,你可以在脑子里勾勒出一种解释,说明为什么你可以是一个专家
41:48 在所有这些事情上却不画出那些关联,那就是当这个东西在推理时,推理的方法就是这种自回归链式思维现象。自回归实际上是一种非常非常奇怪的生成东西的方式,我觉得,如果你仔细想想的话。你是一个聪明人。
42:07 想象我把你锁在一个盒子里,对吧?然后你与世界互动的唯一方式就是你收到一张纸条,然后有人说,你能不能预测接下来会发生什么,对吧?然后你预测接下来会发生什么,然后你的记忆就被抹掉了,对吧?
42:20 然后你又拿到另一张纸片,你说,想象一下这被做了很多很多次,然后从另一端出来的东西,他们说,看看你写的这篇文章。你可能会看着它说,这太糟糕了。这不是我会写出来的那篇文章,对吧?
42:31 因为反复预测某样东西的过程,跟作为一个写作者去构思、去思考推敲等等的方式,是相当不同的。尤其是,很可能发生的情况是,你在某种程度上成了你上下文的奴隶,你可能会在回答某个特定领域的某个问题,
42:48 当我们把围绕那个问题的所有上下文都拉进来,你往那边走,而真正所有实质内容将要来自的那个连接,本质上是一个非常不太可能的连接,你知道你可以做所有
42:59 你想要的 RL,试图以某种方式变得更好,但问题是,当绝大多数这类连接都不是那种可预测的、你知道会出现在那里的下一个 token 时,到底是什么东西在专门加权和激励去做出这些不太可能的连接呢?所以这就好像
43:13 情况可能是,你只是有这样一种智能,它有点被锁在那个盒子里,但这只是一种与它互动的奇怪方式。所以我好奇的是,你是否曾经仅仅通过这样就能得到任何成果,
43:25 质疑 token 生成方式的前提,就像时不时以某种方式那样,对吧?我不认为这会像调节 temperature 之类那么简单。但有没有什么办法,能在现有智能水平的基础上……
43:38 ……找到正确的方式去激发那些连接,从而解锁我们看到的这类东西?还是说你需要再多一点智能,以至于在预测层面,它差不多能预测到它应该向另一个领域打出那道闪电。
43:55 我认为从数据角度去推理,比从架构甚至损失函数角度去推理更有成效。就像,我不知道,我们有做文本的扩散模型,它们生成的东西并不是完全不同性质的东西,只是我觉得还没被充分探索。
44:14 更相关的问题是,无论你用什么架构、什么损失函数,你所依据的数据在激励你去产出什么。而且看起来它们确实在变得更好,好吧,先不谈数学。我是说,我们确实有过这类例子,几个这样的例子。
44:32 但如果你只是看看它们为什么在作为自主智能体方面变得更强,那就只是,我不知道,它们就像身处一个环境中,自回归地生成这样一步:让我们退一步,在整个代码库上做一次搜索。对。然后让我们退一步,评估一下我的错误。
44:48 这就像是那个行之有效的办法。我猜在科学领域或者数学领域取得进展的情况是这样的:你会有前沿数学这类问题,它们需要数学家专门设计,因为它们需要把两个不同的领域连接起来,而且我猜有各种各样
45:07 巧妙的方式,比如部分合成的方式,来制造越来越难、需要这类连接的问题,举个例子,通过消除假设、同时仍然要求 AI 继续得出答案,然后这最终其实并不太重要,损失函数
45:22 是什么,真正关键的是你能不能想出一个环境,来激励这种能力。是的,感觉你应该能够
45:30 做到。我肯定没法说清楚实现这一点的正确方法,没法说清楚如何解锁这一切,但如果未来三年里没有多得多
45:42 的那种灵光乍现,你不觉得那会挺令人意外的吗?所以我认为这是一件值得思考的重要事情,那就是我们常常思考单个系统有多聪明,却不思考
45:49 AI 拥有的优势更多是源于它们的其他一些事实。在这个语境下,关于它们的关键事实是,我们可以直接并行化并任意扩展它们,所以无论它们拥有何种能力水平,都不只是像数学史上某一位特立独行的天才那样
46:11 建立一些联系,然后在一场决斗中死去。我觉得这是数字心智天生拥有的众多优势之一,而我们对此思考得还不够——你可以……其他的优势还包括,它们至少可以把所有知识融合在一起
46:31 会有技术让这一切成为可能,你可以生成拥有完全相同知识水平的副本。但没错,我觉得这种并行化是一个相当重要的特性。我很好奇你的预测——即使它们不如你的数学家那么聪明,
46:46 事实上它们只是,
46:47 你知道,
46:47 数十亿——因为出于公关原因,AI 公司正在砸下数十亿又数十亿美元,而数量本身就有其自身的质量。
46:57 如果这看起来方向正确的话,我想——我的意思是,如果我们拿那个例子来说,你知道,Montgomery 和 Dyson 在 IAS 的那次对话,它暗示了黎曼假设或黎曼 zeta 函数零点与随机矩阵之间的某种联系,那感觉就是你可以尝试去自动化的事情,而且你拥有,
47:17 你知道,代表各个领域专业知识的智能体,基本上就是——好吧,我们都知道一个研究院比一个人更聪明,而把人们聚集在同一个地理位置的 reason 就是因为你希望那些偶然的对话能够发生。那么,在智能体之间去工程化地制造这种对话,会是什么样子?
47:35 我的意思是,有意思的是,你指出了你可以把所有的知识汇集起来。我其实在想,其中一个优势是否在于你可以做相反的事情——有时候 AI 失败,是因为它陷入了
47:48 一条糟糕的思维链,而且很难从中摆脱出来。就像重新开始一样,人类也是如此,对吧——有时候你开始以某种方式思考问题,而实际上需要做的可能就是退一步,有时候形式是
48:01 你知道,有些故事讲的是人们试图证明某个东西很长时间,然后某一刻他们说,等等,如果我试着证明它是不可能的呢,比如证明相反的结论?而像这样解开你自己的上下文、以全新的心态去面对它,你可以想象把这系统化
48:15 或者让多个不同的智能体刻意被赋予不同的上下文片段,然后试着比较其中的可信度。就像我们对自己上下文的操控程度达不到这种水平。在这个 AI 与数学系列中,第一集将关于他们解决 IMO 的时候。
48:31 我想聚焦于他们失败的一道具体的 IMO 题目,那是一道很多非常聪明的学生都失败的题。Terry Tao 也没做出来。这道题的本质基本上是,人们对这道题非常愤怒,因为他们称它为一道钓鱼题。
48:47 我几乎不想剧透,因为我想围绕着一个引导方式来做这一集——让听众在不知道它其实有一个简单解法的情况下被带入,因为你能真正共情一个学生解这道题时的感受。基本上,
49:02 有一种非常优雅的思路,会让你觉得基于国际数学奥林匹克竞赛题目的背景,这一定就是答案,它的定位如此,解法的性质也确实很诱人,但很难证明它是最优的。原因是,它并不是。
49:16 有一个几乎无脑的解法才是最优的。而这件事与整个 AI 叙事的关联在于,对于人类来说,回答这个问题所需要的是逃离你的语境。逃离你身处 IMO 的语境。逃离你被训练来解决这类竞赛数学题的方式的语境。
49:34 如果你把它当作一个我从街上随便拉来的人都能答的脑筋急转弯来对待,他们可能反而答得很好。有时候你在其他情境下也想要同样的东西……比如人类研究,有时候就是能够说刷新一下你的思维,完全换个角度来看,所以在
49:52 数字心智所拥有的所有优势中,这可能实际上是其中之一,就是更系统化地思考:刷新你的思维看起来是什么样的,尝试回答两个独立的问题,比如衍生出两个智能体,一个试图证明它,一个试图证伪它,一个
50:05 有人用这种方式尝试,也有人尝试时故意设置不同的上下文。我很好奇,如果我们三年后再进行这样的对话,那些登上头条的重要成果中,有多少具有这种特征——基本上就是抹除之前的上下文,像是尝试一堆
50:21 不同的东西,而不是把一堆不同东西的结果合并起来
50:25 这非常有意思,因为人们对 AI 的一个常见担忧就是这种熵坍缩——它们都以相同的方式思考,因为它们是用相似的方式训练的。这就是为什么它们不擅长写作。它们基本上就是沿着同一条路走,有相似的说话模式等等。
50:40 但也许实际上 AI 的关键优势在于你可以系统性地……听起来单位距离问题猜想之所以花了那么久才被证伪,其中一个原因是人们假设这个猜想实际上是真的。所以大多数时候他们在试图找出证明它的方法。
50:57 所以也许 AI 的关键优势之一实际上是……通过系统性地尝试对任何给定命题同时进行否定和证明其正面,或者能够系统性地给不同的智能体赋予不同的偏见,来增加熵。
51:16 说得好。
51:17在人类科学史上,一个重要的现象似乎是:爱因斯坦恰恰是被这样一种偏见所驱动——事物在不同参考系中应当看起来相同。然后他还有多个类似的其他偏见。但这在他的思考中极具塑造性。而你可以就像,是的。
51:36所以你会建议,基本上就是在提示词层面系统性地增加熵,即使你在自回归层面有这种不可避免的坍缩。是的。是的。而且我的意思是,爱因斯坦会是一个有趣的例子,因为就像他有一种偏见,认为事物应该能够做到。他也有一种偏见,倾向于
51:54就像上帝不应该掷骰子,对吧?而这几乎就像是你要确保你不会意外地让你所有的 LLM 都变成爱因斯坦,因为你可能会阻碍量子力学的进展,
52:03对吧?这实际上恰恰向你表明,科学并不存在一个正确的启发式方法。完全正确。你实际上就是需要多个独立的研究,是的,是的。
52:11而这感觉就像是老派软件,对吧?只要你能以某种方式描述它,你就有老派软件以某种方式放大那种熵。而如果你能为你想要提示的那些不同思维方式建立一个清晰的本体论,你就能探索那整个本体论。
52:28 然后每一个个体就各自去执行它该做的事。我认为这里存在一个设计问题,即你究竟该如何描述这些不同的方法。简单的一种是,你是试图证明它还是证伪它?更难的一种则是,你能采取哪些所有策略来证明这一点?
52:44 并确保你在探索这一点时应用了足够的广度。
52:50 我认为人们没有意识到,当你给这些模型配备像 cursor 这样的良好工具框架时,它们能直接替你处理哪些事情。例如,我开始在 Bilibili 上发布我的节目,希望能吸引一批正在成长的中国受众,但我上传到那里的所有内容都需要把赞助片段剪掉。
53:06 通常这意味着我得让我的剪辑师回头翻遍所有旧节目,把那些剪掉。显然,AI 在数学方面的进展比其他一切都要快得多,而人们指出该领域的可验证性是这种情况发生的关键原因。我认为这是两个重要原因之一,
53:59 但我不认为,我觉得人们真的忽略了另一个原因。而且我身处实验室之外,我不知道实际发生了什么,但这完全是一个天真的理论。好,一个与为什么 AI 在数学方面取得如此大进展相关的题外问题:为什么它在计算机使用方面一直如此缓慢?
54:18 也就是你,你知道,计算机其实是非常可验证的。就像,你知道,我的 Etsy 包裹到了吗?或者,我的活动预订成功了吗?你知道,随便什么。这些都是极其可验证的事情,可以用来做调查。计算机使用所缺乏的是可 grind 性。因为网站有类似机器人检测器的东西,而且还需要大量的
54:36 算力来运行并行 rollout。你很难在 Amazon 上同一个结账流程里直接跑一千个并行 rollout,因为你会被 Andy Jassy 亲自关停,对吧?亲自按下 Dorkesh 按钮上的红色 X。没错。所以你可以尝试为每一个网站都构建克隆。
54:55 这非常耗费人力,而且会拖慢你的速度。顺便说一句,目前在深度学习中,你需要做这么多并行 rollout 才能学会一项技能,原因是我们还没有解决样本效率问题。
55:07 把监督信号榨到一滴不剩。
55:09 正是如此。当然,人们在研究许多不同的技术,但根本上,训练 AI 的方式存在一个大问题——存在一个巨大的约束,就像代码一样,你可以把某一水平的进展封装进一个代码仓库,然后直接启动成千上万个并行容器,或者数百个
55:27 并行容器,然后说,试着实现这个功能。而且这完全是确定性的。正因为它是确定性的,你就能解决信用分配问题,因为你知道,无论是什么导致这次 rollout 成功、那次失败,那个 diff 就是起作用的东西。这样一来,你就解决了信用分配问题。
55:41 如果你的情况是从不同的起点出发,这个信用分配问题就会变得难解得多。但现实世界中的大多数事情就是很难用同样的方式容器化。比如编程和数学……是这条规则的例外。
55:55 但如果你只是想搞清楚,我该怎么建立一个成功的新业务?我该怎么去市场上交易一天然后赚到钱?你没法忽视这样一个事实:你必须与真实世界互动,而且事情每天都在变化,这意味着你没法一直反复重放
56:08 然后反复刷、反复在模拟器里farm。但数学当然是例外,我觉得这实际上是这个领域以及编程领域进步的一个重要驱动力。这不仅仅是可验证性。它必须是可反复刷的。人们指出 AI 正在快速进步的第三个原因是,他们非常关注
56:28 lean 和形式化。再说一次,我完全不知道实验室里在发生什么。我觉得 lean 对于 AI 当前水平的进步来说就是没那么重要,或者说,为什么 AI 能够解决单位距离问题?嗯,他们,或者说抱歉,是证伪了单位距离问题的猜想。
56:43 他们发布了思维链,或者至少是思维链的一个改写版本。里面没有任何 lean。我觉得 lean 所提供的那种基于过程的监督——你知道每一步都是正确的——似乎不如拥有这种可反复刷的、可验证的结果来得重要。
56:59这是个很有意思的观点,可研磨性更重要,我想说的是,对,好吧,所以天真地想,你可能会觉得 Lean 为数学提供了某种独特的东西,因为你能看到它是否能证明,你有老派的软件可以告诉你“是”或“否”,你把它当作你的验证器,我是说,那又怎样
57:17所以能佐证你观点的是这样一个想法:最初的尝试,我还是回到 IMO 来说,最初 DeepMind 基本上就是这么做的,一切都用 Lean,然后到了第二年就全用自然语言了,所以正如你所说,并不需要。我确实认为有一个……
57:32这种形式化领域还有一个尚未被探索的好处,那就是目前你仍然需要,你知道,最终得由人类来审查那个单位距离猜想(unit distance conjecture)的反例,说“看起来没问题”。而这就在某种程度上限制了你能够无止境地探索的程度。如果你想想 AlphaGo、
57:52AlphaZero 那一类的东西,它们就待在自己的宇宙里,只是不停地下围棋、自我探索,完全可能偏离任何人类所需的方向,但它们仍然拥有这种可自动验证的奖励。不仅仅是说,嘿,你可以对它做 RL。还在于,
58:10你基本上永远不需要去检查,你可以直接向它们投入算力,就像探索围棋的宇宙一样。有意思的是,也许这最终行不通,但我认为对于这是否会带来任何成果,应该仍然悬而未决。有了 Lean,你可以想象拥有一个,
58:28 基本上就是一个永不停歇运行的程序,不断尝试扩展 mathlib。mathlib 是那个 GitHub 仓库,基本上就是把全部数学用代码写出来。它离“全部数学”还差得很远,但他们希望它成为全部数学的代码化版本,你可以问它,这个证明正确吗?写这些证明非常耗费人力。
58:45 围绕它有一个完整的子社区。但你可以想象,如果你有一个 AI,你只需要说,试着扩展 Mathlib。也许它是 Mathlib 的一个 fork,这样里面就不会有,你知道,垃圾内容,因为人们,你知道,人们
58:59 所以你有了自己的那个纯 AI mathlib 的 fork,它就一直在跑,就是不停。它不需要任何人来检查它,对吧?它可以一直跑下去。它可能会提出自己的猜想。它可能会提出自己的理论和不同的定义。
59:14 也许其中很多都没什么用,但它就是有这棵无限的树可以生长出来,这是数学非常独特的地方,其他任何东西都没有这种特性:你可以按下开始,然后就把算力倾泻进去,转头不看 10 年,然后再回来
59:27 说,你有什么成果?那肯定会有一些东西,对吧?然后问题就是,它有用还是没用,比如你怎么判断出来。能够做到这件事本身就很有意思。如果这都不能从中产出某种有趣的数学洞见,那才会非常令人惊讶,对吧?
59:41 所以我认为这才是真正的理由,好吧,Lean 在这个故事里重要的方式有两种。这是第一种,基本上就是你可以放手不管,甚至不用检查,进展也会发生。用围棋你可以做到这一点。
59:55 我不认为用自然语言做数学你能做到这一点。
59:57 嗯。这非常有意思。你看到 Karpathy 的自动研究想法了吗?他基本上写了一个 Python 文件来做基础的 LLM 训练,然后搞了一个 repo,让智能体尝试对这个文件做修改。如果它加快了 speedrun 的速度,这个修改就保留下来。
1:00:18 Eric Jang 之前来上节目解释过 AlphaGo 是怎么工作的,他在尝试构建一个非常强的围棋机器人时做了类似的事情,他有一些很有意思的观察,关于这类系统——它非常擅长跑一个实验然后沿着那条路走下去,但它不擅长在死胡同处停下来,
1:00:35 也不擅长做极度并行的事情。总之,这很可能会改变,未来会改变。思考它在极限情况下是什么样子非常有意思。我的意思是,这从根本上来说就是人类数学研究这个制度,对吧?它就像是一个以有趣且有用的方式扩展的库。
1:00:53 而这样一来你没有任何基于结果的监督。没有你想要激励的结果。但你有一个过程,你知道步骤是正确的,你只是不知道它是否在朝着一个有趣的方向前进。但没错,就像如果你在做——
1:01:05 你不希望它完全失控,像是在逻辑空间里随机游走。你大概会想要某种类似监督模型的东西,试图提供启发式判断,看它是否有用。但没错,就是那种性质的东西。你知道,人们正在研究它,而且就像
1:01:19 这是那种五年后我会很好奇的事情之一,希望能让未来的我们来聊聊,看看那条路是不是可能走不通。但陶哲轩谈到了一个研究项目,基本上是在尝试穷举搜索这个空间
1:01:34 可能的代数结构。你可以想象不同的公理,应用到代数系统上。所以当我们提出群论时,有一套特定的公理系统,它带有这种味道——除非你知道背后的动机,否则它们看起来就像是随意的规则
1:01:47 但基本上就是,如果你把所有这些都试一遍会怎样?其中有没有哪些能产生有用的东西?绝大多数在某种意义上就是垃圾。全都坍缩成没有有趣结果的东西。但偶尔会出现一座小岛
1:01:58 一种完全不同的公理系统,至少从能推导出的定理数量来看,似乎内容很丰富。而这正是你会想象自动证明器擅长的事情。就是探索那个空间,看看哪一个最终能成为真正有价值的东西。
1:02:13 也许其中某个岛屿实际上最终会被证明是你可以追溯性地赋予动机的东西,说这就是它试图达到的那种结构,就像你可以想象看着群论的公理却不知道它关乎对称性一样
1:02:24 但事后才意识到,哇,这跟研究对称性非常相关。所以你可以想象那种风格的结果,但不是仅仅探索可能的代数系统,而是像所有可能的、任何种类公理的逻辑推论。
1:02:39 关于能否在没有 Lean 的情况下提供基于过程的监督这一点,DeepSeek 有他们的 DeepSeek math 模型,他们发表了一篇关于如何训练它的论文,相当有意思。所以他们面临的问题是,自然语言证明你不知道它是否正确,而
1:02:56 所以他们有一个验证器,然后这个验证器由一个元验证器来训练,元验证器确保他们训练这个模型去解决的所有问题——以及像解题艺术这类——验证器给出的反馈是好的。所以这挺有意思的,自然语言验证加上某种
1:03:13 元验证,至少在已发表的文献中目前看来是有效的。而且在我们正在使用的已发布产品中似乎也有效。比如你看编程智能体,它们在写整洁代码、重构代码之类的事情上变得越来越好了。
1:03:27 而且我确信存在基于过程的、类似 LLM 评判的东西,它们试图提供品味,说:嘿,这是不是一种干净利落的函数写法?有没有重复的同类型模块化形式等等?我觉得这在数学上应该同样行得通,对吧?
1:03:46 这在数学上似乎比其他任何领域都更可行——即便你只用自然语言工作,你也可以信任一个验证器。我的意思是,你和我之前聊过为什么它们不擅长写作,我当时问为什么不能直接……它们似乎是很好的评判者。
1:04:00 如果我给它们两篇学生写的文章,它们能说出哪一篇更准确、更有洞见。那为什么不能直接用一个验证器来说,这是不是一篇好文章?也许最终的失败之处在于,即便它们擅长区分一篇 B 级文章和一篇 A 级文章,
1:04:17 它们实际上并不擅长区分一篇 A 级文章和一篇你真正想读、在 Substack 上能读得下去、有洞见的那种东西。它们最终反而偏好那些没有洞见的文章。所以在数学方面,我想问题大概就是那一步——
1:04:34 单纯地知道这是不是一个正确的证明——这本身就适合用自动化验证器,即便在自然语言中,你大概仍然能取得大量进展。但它仍然不能……我仍然觉得,逻辑树脱离了 Lean 前端,就在于你真的可能跑偏,对吧?
1:04:50 就像之前那种表述方式完全没有约束一样,你知道,大家都在谈论 AlphaGo 里的第 37 手之类的。那么,究竟是什么东西能够让它跳出先前的启发式规则呢?
1:05:05 而且在这种探索中与外界保持脱节,似乎是富有成效的,可以作为自然语言数学方向的一种互补性研究追求。我是说,Lean 的另一个相关性在于,好吧,假设你有你的纯自然语言……
1:05:24 强化学习环境,你有一套纯自然语言的证明集,人们说,好,AI 数学家们继续吧,然后它们每天生成 10 篇论文,产出大量东西。如果错误率——如果这里面存在任何错误率的话。Alex Kontorovich 谈过这个问题。
1:05:43 这就变得让人无法忍受了,作为一名数学家,因为你基本上会觉得,每次我看到其中一篇,我都不确定它是否值得我花时间。即使 100 篇里有 99 篇是对的,我也不确定是否值得我花时间去逐一过目。
1:05:55 因为找出那个错误非常耗费精力,而且如果你发现自己把所有时间都花在了一篇被废弃的论文上,那真的非常令人沮丧。所以,如果有任何东西能够给你那个绿色的勾选标记,告诉你即使这篇东西理解起来会很复杂……
1:06:09 即便它会很麻烦,你至少知道它是正确的。就像其他任何领域都会为此拼命一样,对吧?数学就有这一点,嗯,如果模型也能把它们的自然语言证明形式化,那似乎就是件大事,对吧?拥有那种能力
1:06:24 每个领域都会渴望拥有这样的东西,所以我觉得你说得对。是的。
1:06:44 我也很喜欢把 MathLiv 作为一个隐喻来延伸,用来描述我们的文明很快将会发生什么。几千年来,人类一直在构建这个知识与理解的语料库,而我们现在所拥有的一切都被蒸馏进了这些模型之中。而在某个时刻,模型将只是任意地扩展它。顺便说一句,在写作方面,
1:07:08 我其实有一个理论,解释为什么写作的进展比这些其他领域更差。所以我认为其中之一就是你说的,它们不擅长评判,不仅是 A 与 B 之间的评判,而且它们会被 B star 彻底带偏,B star 就是那种糟糕的文章,却恰好命中了所有
1:07:25 所有那些花里胡哨的东西,而 A 本应命中的正是这些,于是奖励黑客的问题就彻底失控了。但我认为另一个重要原因是,写作不像代码和数学那样是模块化的,就像
1:07:40 你知道的,你可以用许多不同的方式写一个函数,它们大致做同样的事,当然你希望它非常干净整洁之类的,但归根结底,它能用就是能用,数学中的引理也是一样,而且
1:07:48 然后你知道,你可以有一个与生产方式不同的最终产品,所以代码是生产某个最终产品的东西,你想要的是一个功能性的最终产品;而在写作中,最终产品直接就是 AI 正在生产的东西,每一个段落、句子,
1:08:08 词语都很重要,因为那就是实质本身。它不像是从写作中生产出来的某种分离的东西。所以它不能只是——它不能像代码那样可以是垃圾代码却仍然产出你想要的结果。
1:08:25 但你刚才指出,实际上我们在智能体编写代码方面已经进步了很多,不仅能写出功能性的代码,还能写出整洁的代码。为什么同样的进步——让你从仅仅功能性到整洁、到可合并的 PR——不能同样带来更清晰的写作呢?
1:08:41 是的,这是个好观点。我的意思是,还有……难道不是吗?我同意在很多方面它们是很糟糕的写作者,但对于我消费的大量写作内容,我发现直接复制粘贴到 LLM 里然后说“给我解释一下”会更好。
1:08:56 解释会比人类生产出来的东西更好,所以很有趣的是,我们说这些是这么糟糕的写作者,而我的显示偏好却是——能不能再让另一个来解释一下,即使我是在跟
1:09:07 一个像人类专家那样实时在线通话的人,嗯,如果这是他们拥有、只有他们才拥有、并且没有被编码进分布中的某条知识,我希望他们能向我解释。但接下来,如果为了理解那条知识,我需要先理解一个更基础的概念,
1:09:20 我更希望的是,如果社会能接受我直接说:我们在这里暂停一下,我先去问另一位校友那是怎么回事,然后再回来听你那条特别的知识。
1:09:32 听起来,我是说,那就是知识蒸馏,对吧,还有解释。所以如果你——如果我考虑的是你作为文章写作者的水平,如果是这样:我给你一本书去读,我想要一份读书报告,对吧,那么我可能会认为,好吧,大语言模型也许能给我一份更好的读书报告。
1:09:48 但我认为,当人们说它不擅长写作时,他们真正想说的是——写作到底是什么?它不只是对已有想法的知识蒸馏。它不只是你如何清晰地解释,因为它们确实很擅长解释。它更像是:洞察力是什么?
1:10:01 而这就是问题所在,自回归是一种非常奇怪的生成方式,因为当你在写作时,你多少知道,要想写得好,就必须有不可预测的元素,而这并不只是增加——
1:10:15 而是要精确地知道那个正确的时刻,在那一刻你想做出一个不可预测的举动,而那才会是更有洞察力的。所以即使它更擅长解释一个已经存在的东西,那最初生成你想要蒸馏的那本书的,又是什么呢,对吧?
1:10:29 它不是由 LLM 生成出来的、你直接拿来就能用的东西,而是像某位作者在世界上抛出了大量对想法的探索,然后决定其中哪些方面是有趣的、哪些呈现方式构成了连贯且动机充分的叙事,就像他们把这一切整合在了一起。
1:10:46 在某种意义上,而且你知道,如果他们是一位好作者,那大概你宁可去读他们的书,而不是读那份蒸馏产物,但即便如此,究竟是什么让一开始去探索这件事本身、以及把它上传这件事本身变得有价值,我认为全都在
1:10:59 那一面,就是当人们会提到它们不擅长写作时所指的那个东西,正是那种不可预测性的要素——刻意选择某种新颖的东西,某种与事物被生产出来的方式非常直接地相矛盾的东西。
1:11:12 是的,这是个好观点。我认为它们也非常不擅长构建关于人的真正好的心智模型,而我认为这是写作中一项非常重要的技能。所以 Annie Matuszak 和另一位合作者——我一时想不起名字了——做了一份有趣的报告,他们试图教 LLM 写出好的间隔重复提示。
1:11:29 我真的很喜欢这个,因为尽管它看起来像是一项完全随机的技能,就像人们一年后就在谈论递归自我改进了。是的。而你却没法让这些东西写出好的抽认卡。那这到底是怎么回事,对吧?对。他们尝试了许多不同类型的技术,然后他们说,
1:11:46你知道,那些很懂行的人。比如他们尝试对开源模型做 RL。他们试过各种方法,包括思维链,以及把一大段提示词发给最好的闭源模型等等。而在我看来,关键的约束在于,写好一张卡片的关键是
1:12:03去预判某个人三个月后的想法,以及他们会以什么方式联想到这个问题,比如他们此刻会想到什么样的答案,而这种引导是否正是你想从你打算做成卡片的那段文字中真正提取出来的细节?
1:12:22我觉得写作也类似,如果你在写东西,它之所以是一个如此耗神、耗时如此之长的过程,是因为每一个词、每一句话,你都应该去想:此刻我的读者脑中正在发生什么,哪怕我把措辞颠倒过来
1:12:37于是结尾的短语跑到了开头,而这就像是你读到句子其余部分之前脑海中浮现的第一个画面。那种或许带有自我攻击性的做法在这方面并不擅长,或许它更需要一种更像扩散模型的特性,去考虑整体,而不是逐句推进。
1:12:51但我也觉得,那需要大量的心智化,而这些模型奇怪地在这方面很吃力。
1:12:55嗯,我是说,这是个有趣的问题。比如,它们在这方面吃力,这算奇怪吗?那么……我可能会把这点讲砸。你知道那种情况吗,你引用你曾经读过的研究,结果那项研究可能根本不存在之类的?有一个非常令人难忘的,关于……好吧,假设你想测试人们的 EQ。
1:13:14 就像你展示一张某人面部表情的闪卡,然后让人试着描述那是什么情绪。所以我把这些非常好的测试放到网上,会有一张脸,然后四个可能的情绪选项。要准确描述出正确的情绪,出乎意料地难。
1:13:30 但你也能感觉到,确实存在一个正确答案,如果你拿这个去测试你生活中的人,你会注意到那些在社交上相当敏锐的人,在这上面表现得非常好,而那些
1:13:38 稍微更偏左脑型的人,就不太行。所以这是一种你可以做的测试。我隐约记得有一个类似效果的实验,他们找来刚以某种方式打过肉毒杆菌的人,做了一次前测和一次后测,而在后测中他们的表现要差得多,
1:13:54 在解读别人的表情方面差得多。这感觉有点奇怪,他们打了肉毒杆菌然后做测试。就像,你先做测试,然后你去打肉毒杆菌,你的脸整个都僵住了。现在你在理解你所看到的情绪方面变得更差了,对吧?
1:14:08 而这里的想法是,理解你所看到的这种情绪,有一部分是靠你自己去做的。就像在面部层面,你在动你的面部肌肉,你看到那个表情,你模仿它,然后你就想,哦对,那是焦虑,对吧?在某种非常潜意识的层面上。所以从这个意义上说,
1:14:27 如果模型的心智理论确实很差,那也不奇怪,它们之所以什么都知道,是因为读过所有人写下的东西。但到了真正能设身处地代入你的处境这一层面——就像我的面部肌肉会模仿你的面部肌肉,正是这一点帮助我理解你的感受——它们做不到,这一点毫不令人意外。
1:14:43 它们没有面部肌肉。它们的大脑运作方式完全不同。这就像一个外星人试图共情。它怎么可能拥有心智理论?拥有心智理论对它来说会是一种非常涌现性的东西。而我们则可以直接把它接入自己的心智。就好像我们已经有现成的硬件,直接把它放进去就行。
1:14:58 这非常有意思。从这个角度来看,就不那么令人意外了。
1:15:03 好,Grant,我们俩都是 Jamestreet 的合伙人。我相信这些年来你和很多 Jamestreet 的人打过交道。你发现他们或他们的文化有什么独特之处?
1:15:11 今年我对他们做了这次采访,部分有意思的地方在于,他们通常没有什么对外公开的东西。我的意思是,在业内他们以极高的留任率著称,人们就是会一直待在那里。我觉得能深入了解这一点很有意思。我记得有人说过一句评论,尽管
1:15:26 人们的职位头衔有研究员、交易员或工程师。他们往往不知道同事的实际角色是什么,因为每个人都在做一点其他领域的事。即使你名义上是交易员,你也在做大量研究。即使你名义上是研究员,你也在写大量代码。
1:15:40 我怀疑这或许正是他们拥有如此惊人留存率的部分原因,因为任何想要成长的人,都能获得去做许多不同种类事情的机会。
1:15:49 好了 Grant,这次我来帮你打广告。如果你想观看 Grant 与那里一些人的完整面对面访谈,请访问 3b1b.co/janestreet。好了 Grant,让我们多聊聊 AI 和数学。
1:16:02 关于使用 LLM 来学习,你有什么建议?
1:16:07 正如我刚才描述的,对于许多众所周知的概念,我觉得它们非常有帮助,但往往再往下聊几条消息,当我试图理解某个东西时,它们自己就糊涂了,把我也搞糊涂了,而且它们没有用正确的方式解释,
1:16:24 然后我知道,跟对的人聊一聊,三分钟就能解开我的困惑。我觉得我们会越来越想把这些东西当作——作为一个在教育、表征等方面教过很多的人——我们会越来越想用这些东西来学习。
1:16:42 你有没有注意到更高效地使用它们来理解概念的方法?
1:16:45 我很想听听你对此的看法。我先说说我的。即便在 LLM 出现之前,我觉得学习中的一个相关洞见就是认识到"谁"比"什么"更重要。所以给任何大学生的建议,在选课时就是:少在意一点你已有的兴趣,因为它们往往
1:17:03 现在可以随意一些,更多地关心教你的人是不是一位好老师、是不是你能产生共鸣的人。我认为在选择读什么——比如读哪些书——作者是谁可能比它是否是你原本就感兴趣的领域更重要。所以如果有一本
1:17:16 你以前喜欢的书,那就去读那位作者写的其他作品,而不是去读同一主题的另一本书。我越来越倾向于用这种思路来看待 LLM。所以,尝试学习某样东西时,感受是不一样的——如果你看的是
1:17:28 它的维基百科页面,对比一下,假设这是一个哲学话题,你去看《斯坦福哲学百科全书》,或者这是一个数学话题,你去看类似《普林斯顿数学指南》那样的东西,区别在于,那些文章是由某一个人刻意撰写的,这个人
1:17:46 会真正围绕它精心构建一套动机脉络等等。而维基百科则是达到了某种局部最优,基本上每一句话都必须正确。我认为一段好的阐述,你在过程中对正确性的在意会少一些,但你可以刻意构建一些稍微不太准确的东西,
1:18:03 然后在过程中逐步修正,而这些在众包环境中会被编辑掉。所以就是这样。目前在我看来,LLM 给出的解释很像维基百科,也就是说,很了不起,对吧?想象一下维基百科出现之前的世界,你得花多长时间才能找到并核实这些东西。
1:18:20 但尽管如此,维基百科页面最有用的部分是什么?往往就是底部的参考文献,对吧?你去看那些关键参考文献,然后点进去读。有时候这实际上能给你一个更好的概览。所以
1:18:33 我经常喜欢直接问大语言模型,比如,我该读谁的东西?甚至我还能给出一些具体的学习方式偏好。我有一次还真被它忽悠了,我记得当时想学半导体之类的东西。我心想,这感觉非常依赖视觉呈现。结果全是文字。
1:18:48 我就想,有没有什么真正好的、可视化做得很棒的视频?不是数学,抱歉。是一个可视化做得很棒、能解释你想了解的那些概念的视频。然后 Claude 说,有啊,这里有几个,最上面那个。它说,这是 Three Blue and Brown 出的一个。我心想,我敢保证根本没有。
1:19:06 而且那确实是一个真实的视频、一个真实的链接,只是它把别人的东西张冠李戴了。不过那个视频确实不错。结果就是,我点过去看那个视频来学习这个东西,体验比在那里继续追问要好得多。所以从这个意义上说,
1:19:20 基本上就是把它当作一个超级强化版的 Google 来用,精准定位到正确的人类撰写的资源。你呢?你经常用这些东西。
1:19:29 从中学习的最佳方式是什么?我觉得你说到点子上了。我最高效的学习时段,是当有一个由人类产出的成果——无论是一篇文章、一本书还是一段视频——以正确的顺序组织相关概念,并逐步建立起动机的时候。
1:19:44 让你明白为什么构建下一个概念会与你遇到的下一个问题相关,然后是下一个概念,再下一个概念。接着用 LLM 在这本书已经确定的这条分支上做一点修剪。所以我当时在过……
1:20:04 我记得你可能推荐过 Steven Strogatz 的教科书,关于……那本讲混沌的?对。讲混沌与非线性动力学的。对。我很喜欢那本书。所以我当时在过这本书。而且……那感觉就像极乐。就像你的视频变成了书的形式。他写得太好了。超级有趣。
1:20:20 我学习它的方式是,屏幕三分之一放他在大学的讲座,三分之一放教科书的那部分内容,三分之一放一个 LLM。
1:20:30 我当时其实在想,如果我回到大学时代现场听这堂课,那完全会超出我的理解。这些孩子一定非常聪明。因为我得暂停、读教科书、跟 LLM 讨论,然后再重新开始——但有了他来编排什么是正确的顺序。
1:20:46 要理解概念,什么是激发理解一个概念的正确问题?哦,还有另一件事,LLM 真的很不擅长,而一个非常优秀的人类能做到的是:当你问一个问题时,他们会说,其实你根本就没有真正在思考
1:21:00 关于这个话题,正确的方式,比如你真正应该问的问题是,组织这些概念的正确方式是 X,而 LLM 就是做不到这一点
1:21:08 是的,它有点太顺从了。我的意思是,这最终就像那种,就像那些谄媚者,你知道,就是那种,哦,多么有洞察力的问题啊,你知道,那种感觉。你想把那些东西剥掉。这是个好观点。而且我觉得这稍微触及了心智理论。
1:21:24 比如认识到,提出某种类型的问题,揭示了其心智结构至少与讲解者的心智结构不同。而有时候人们这样做会过头,对吧?比如我觉得一个真正好的老师,假设你有一个初中数学课堂之类的。
1:21:41 如果一个学生问了一个表明他们正以不同方式思考的问题。在那个当下,要真正认真对待其实是很难的,等一下,你能不能先用那种方式得到一个正确答案,然后你再说,哦,与其那样,我们不如这样做。
1:21:54 而真正优秀的老师能够以柔克刚地利用学生思考的那个创造性方式,把它引入进来。我的意思是,LLM 做不到这一点,它们不会重新构建你的问题。相反,它们有点像是直接跑偏了。
1:22:11 但至少感觉这里有三个层次,比如 lom 处于第一层,好的讲解者是另一层,但 A+ 级的讲解者是那种能像柔术一样扭转你的思维方式的人,然后说,哦,那才是它有用的地方
1:22:23 所以也许存在某种完整的循环,同样地,五年之后 LLM 仍然会做那件事,但会以更好的方式来做。你对那些
1:22:35 肯定会给你发邮件的学生有什么建议?
1:23:06 我不会信任我给出的任何建议。这大概就是我会加的前缀吧。即使在 AI 出现之前,对于你要从事的任何工作来说,真正理解……比如,如果我们谈论的是一份工作,对吧?我们不是在说,你是一位绅士科学家,你想要
1:23:22 比如投身数学界之类的。你应该理解钱从哪里来,你实际在增加什么价值,以及这两者之间的联系。而且我觉得,人们在这上面投入的思考量往往少得惊人。尤其是学生,他们身处这样一种环境中,他们……
1:23:37 他们想进入数学领域,可能是因为他们一直擅长数学,而且在人生中一直因为正确地穿过下一个圈、迈出下一步而得到奖励,当他们觉得自己想成为数学家时,那是因为这是继续投身于
1:23:48 就是那种“我会去想,人们在哪里才能做这件事”,而不是去想“我给别人带来了什么价值?薪水流向我又在多大程度上是因为这个?”实际上,不同情况下差别很大。有些情况下,是一位非常有声望的数学家,
1:24:05 而他们在一所大学的存在本身就带来了一定的品牌价值。这大概就是大学想要他们的原因。有些情况下,则像是 NSF 拨款之所以给出来,是因为你持有这样一种公共利益的信念——我们认为基础科学具有这种价值——而且你周围有这套机构,
1:24:20 还会有整套官僚体系围绕着它运转,试图把它当作我们所认为的那种公共利益的代理指标,并且还有一整套繁文缛节,围绕着如何正确地、嗯,让他们预测你的进展会符合那笔资助的精神。有时候,
1:24:33 那就纯粹是教学,对吧。就像人们喜欢把孩子送到有专家授课的机构,而这就是你在做的事:你通过身为专家提供了品牌价值,又通过身为教师提供了直接价值。所以不管
1:24:47 这份清单上 AI 是否在证明定理,也不管我们说的是 2016 年还是 2026 年,这都是那些想着“我想成为数学家”的学生思考得不够多的一件事,但我认为它值得思考。对我来说,我觉得
1:24:59 你知道,我当时并没有刻意去想这件事,而是有点误打误撞地走进了这条职业道路——基本上就是把数学探索变现为娱乐,对吧。我算是偶然闯进了这个领域,我非常感激自己做到了这一点,但这纯属意外,并不是什么深思熟虑的安排。
1:25:14 我觉得我本可以避免依赖机缘巧合,或许可以更多地去刻意设计,如果我当时能批判性地思考这件事的话。所以回到你的问题,如果情况是几乎已经实现了定理自动证明,然后再假设它们同时也是非常出色的讲解者——
1:25:31 那么即便只是为了让人理解,我认为数学家所承担的大量社会角色实际上并不会发生太大变化,对吧。作为公众,我们仍然有一种感觉,觉得基础科学是有价值的,我们信任数学家的判断力来决定他们的精力
1:25:49 最好花在哪里,而声望来自这个群体内部——是其他成员说这是一个非常好的成果,而不是靠那个真正懂代数数论的经费申请撰写者来理解这是一个好成果。所以会存在某种内部文化来界定什么算是——
1:26:31 我实际上认为教学是 AGI 之后最稳定的工作之一,因为它太依赖人与人的关系了。如果父母拥有充裕的财富,他们愿意把钱花的地方就是好的教学和好的教育。而它远远超出了讲解本身。即便大语言模型是很出色的讲解者,
1:26:49 老师所做的事情,本质上是一种社交性的、像教练和导师一样的工作,这大概是未来 50 年最稳定的职业之一。所以就很多数学家的角色而言,它与这一点是重叠的。
1:27:05 你知道,作为即将进入这一领域的学生,你可以往这个方向靠拢。其实我觉得应该有更多学生去思考并重视这样一个想法——就是成为一名数学教育者,以及这能为下一代带来的价值。所以我再说一遍,
1:27:21 我不觉得我是那个该说"嘿,未来的年轻数学家,你应该这样看待未来"的人,因为我就是个 YouTuber,对吧?我不在他们考虑进入的那个机构里,所以我是以一个局外人的视角在观察。但感觉上,总体而言,
1:27:38 好的通用建议是:知道钱从哪里来,知道你在哪里接入其中。如果你只是在问这些问题,你其实已经比所有其他那些刚起步的准数学家领先了好几步。是的,而且
1:27:51 事实上我认为,在这个疯狂的世界里,在这样一个世界里——五到十年内,AI 不仅能给出千禧年大奖难题的解答,而且还能从一开始就提出全新的待解决问题、全新的数学领域和对象等等。
1:28:09 在那个世界里,首先会有大量的富足,其次,AI 心智走得最远、超越我们视野最远的地方将是数学,而且会有巨大的需求,比如“AI 看到了什么,你能解释一下吗”
1:28:28 给我们听 对对,我觉得在那个世界里,如果还有什么工作的话,那肯定会有把 AI 所学到的东西提炼出来这一项。而且有意思的是
1:28:39 所有这些多少都预设了它是没用的,对吧?我们不是在谈论所进行的数学研究的实际应用。所以只要它有任何经济效用,你会想象那些理解它、并且能够
1:28:52 决定它应该指向哪里的人,他们作为策展人能够做出那种判断、把这头新数学的巨兽指向有用的方向,实际上就拥有多得多的经济价值。突然间,这变成了一个比之前杠杆效应大得多的举动。
1:29:06 我能就这一点问问你吗?显然,AI 用于数学的一个问题是,它不仅能不能做,而且它做得好不好?还是说它对任何事情都没用。你刚才描述了群论的各种方式,我们试图解决这个,我们试图弄清楚关于不同种类根的随机事实
1:29:27从函数,到如今横跨众多不同领域、切实可用的各种应用。你有没有某种感觉,如果我们真的完全走到那一步——人类数学领域被加速 10 倍或 100 倍——会不会发生什么疯狂的事,还是说我们实际上会被……卡住
1:29:48我觉得有些领域大概会,我是说,这东西非常参差不齐,对吧?比如代数数论方面的进展,感觉不太可能就此解锁什么东西。但我也说不准,我记得和一位数学家聊过,他做的更偏向动力系统和偏微分方程求解
1:30:10他当时提到的基本上是,他的团队有一些想法,让我看看我有没有概括对——就是波音造飞机的方式,他们会先造出来,然后做一大堆测试,还得根据这些测试把飞机拆开再重新组装
1:30:25他们本质上是有了一些洞见,知道如何在仿真里做更多事情,这样就不必拆解再重建,这给波音省了大概几十亿美元之类的,然后他们就开始资助那个团队,所以这就像是
1:30:39明显更贴近应用,因为偏微分方程差不多就是干这个的。所以那个领域的进展,你会想象它确实能解锁一些东西,我不知道是不是那种阶梯式的突变,但也许更多是像发动机设计变得稍微更流畅一点
1:30:57或者,你知道,比如想出正确的机翼形状,而不是运行一大堆复杂的 CFD,又或者你能够加速你的 CFD 仿真,因为某些纯数学的洞见让这些变得更高效。我敢打赌,你会在那里看到大量很棒的渐进式改进。
1:31:14数学上的重大突破似乎不太可能立刻转化为这种巨大的经济突破。你解决了 Navier-Stokes 问题,然后这就解锁了模拟更多东西的能力。但你很可能会在那些边缘地带看到一些有意义的溢出,从纯数学洞见渗透到其他事物中。另外,我的意思是,
1:31:39有大量的人在研究诸如 AI 工程师、物理工程师、材料科学之类的东西,你得想象他们会有能力去审视 AI 的数学洞见,并判断它们是否在某种方式上具有相关性。所以……
1:31:57这又是那种事情之一,我不会坐在这里像插旗立誓一样预测一定会有。如果在未来五年内没有出现经济上有价值的改进,那会有点令人失望,也有点令人意外,
1:32:10而这些改进可以直接归因于 AI 在数学上的进展。如果只是解决了一堆类似 Airtish 的问题,而实际上没有一个,你知道,没有做任何真正直接触及物理世界的数学,那确实会有点令人失望。
1:32:24 是的。我的意思是,就你说的那一点而言,很多历史和数学都是在搭建这些概念、联系之类的堆积。是的。有时候这些堆积会彼此连接起来,或者你在别的地方发现了某种应用。至少,你只是搭建起了这一大堆东西。而且,作为一个,你知道,
1:32:41 社会中更广泛的进步发生在奇点期间,当我们进入奇点的工业化阶段时,你就拥有了所有这些不同的想法,希望它们能在世界其他地方派上用场。
1:32:53 我的意思是,是的,就像我说的,正在发生的事情中一个有趣之处在于,它促使人们退后一步去问,数学到底是什么?也许其中一个尴尬的结论将会揭示出,哦天哪,在过去这段时间里,它已经完全变得毫无用处了。
1:33:06 就像人们提出的那些问题已经变得如此脱离……那些在物理上可应用的领域。这是数学家们不得不接受的事情之一,所有人都会看着然后说,等一下,你们这些人到底应该,那个,
1:33:18 如果那里有那么多,比如 10 倍的进展,那为什么我们在这边看不到呢?
1:33:22 然后 MathChurch 就会说,唉。每次我们写那些经费申请,说,相信我们,椭圆曲线的进展会帮助密码学之类的。这就像揭示了一个事实,也许它并不会。所以这是一种可能性。Grant,这超级有趣。非常感谢你来做这个。当然。
1:33:38 很高兴。
和 Grant 聊天总是那么有趣。AI 在数学领域的进展比其他领域快得多。因此,数学正在非常具体地向我们展示,AI 在其他领域的进展将会是什么样子。即便在数学内部,也呈现出一种参差不齐的格局。它究竟是什么样子?数学史上最重要的概念性突破,其本质是什么,它们与 AI 目前所能做到的事情有多大差异?AI(净效应上)是增加还是减少了人类对这一领域的理解?让 AI 系统性地尝试连接已有文献中的想法,这种积压的潜力有多大?对于有志成为数学家、程序员,以及其他对正被 AI 最深刻改造的领域充满热情的学生,Grant 有什么建议?在 YouTube 上观看;在 Apple Podcasts 或 Spotify 上收听。
(00:00:00) – AI 正在发现新的证明。这算 AGI 吗?(00:11:32) – 概念性突破的验证循环可能长达一个世纪 (00:26:12) – 我们能理解 AI 对黎曼猜想的证明吗?(00:38:08) – AI 能发现领域之间隐藏的桥梁吗?(00:53:48) – 为什么现实世界的任务不适合放进 RL 环境 (01:07:07) – 好的写作需要 AI 仍然缺乏的心智理论 (01:16:02) – 为什么学习仍将依赖人类的筛选整理 文字记录
00:00:00 – AI 正在发现新的证明。这算 AGI 吗?
Dwarkesh Patel:今天,我和 Grant Sanderson 聊天,他运营着 3Blue1Brown,现在正在做一个新项目,记录 AI 在数学领域取得的进展。我想和你聊这个话题,是因为在所有领域中,AI 在数学上的进展最快。无论这里正在发生什么,无论我们看到 AI 进展以何种方式发生或没有发生,都会告诉我们,随着 AI 变得越来越强,世界其他地方将会发生什么。我想从三年前我第一次采访你时问你的那个问题开始。我当时问你,一旦我们有了能在国际数学奥林匹克竞赛中拿到金牌的 AI,那不就等于是 AGI 了吗?鉴于这些问题如此之难,它不就什么人类能做的事都能做了吗?你当时给出了一个答案,事后看来非常明智且正确。你说,它会成为又一个基准,就像 AI 正在通过的所有其他基准一样。显然,自那以后,AI 在总体意义上变得更好了,但当这件事发生时,不会有什么“啊哈”时刻。首先,我很好奇想听听你的启发式判断,为什么这被证明是对的。其次,我很好奇你认为这种狭窄性还能持续多久。到了 AI 解决了一个千禧年大奖难题的时候,你觉得是否仍然可能有许多人类在经济中正在做的任务,AI 依然无法自动化?Grant Sanderson:这是个有趣的问题,因为如果事先不知道解法会是什么样子,就很难回答。如果我们拿 IMO 来说,你三年前那个问题的精神,在于审视这些问题的一些解法看起来确实多么需要创造力。这些问题的设计者试图想出那些你不太容易通过训练来应对的东西。IMO 不可告人的秘密是,其中很多题目你其实真的可以通过训练来应对。随着整个 AI 与数学项目推进,正如你指出的,它之所以有趣,其中一个原因就是 AI 的前沿是尖刺状的,而数学恰好就在其中一个尖刺上。但这种尖峰式表现具有分形特征,因为当你放大到数学内部的具体进展时,会发现有些部分比其他部分容易得多。如果我们只看 IMO,这现在已经算是旧闻了。距离他们真正表现出色已经过去两年。如果不是因为下面这个原因,他们在 2024 年本可以拿到金牌。他们非常强。他们基本上就是冷解了几何题。IMO 有四类题目:几何、数论、代数和组合。几何题,自 2024 年起,它 19 秒就能解出来,因为它是一个暴力求解器。一个不太光彩的秘密是,对学生来说,也存在一种暴力破解的方法。组合才是那个变数:更爱玩、看起来更像智力游戏的问题。那一年的测试里有两道组合题,而并不是每年都有。总共四类、六道题,所以哪一类会出两道题完全是碰运气。如果当时几何题更多,他们那年就能拿到金牌。但它在那些组合题上很吃力。那些想为人类守住数学最后堡垒的人可能会说,那些才是更需要创造力的问题。即便如此,你这个问题背后的精神——如果它们能解决千禧年大奖难题,那是否也意味着能服务于大量白领工作?——暗示着,从我们当前所处的位置到那一步之间的速率限制因素,与让白领工作表现更好的速率限制因素是同一个。我们可以从几个不同角度来描绘。如果我们聚焦黎曼猜想,解决它会是什么样子?这些东西极其擅长某个特定知识领域,能非常深入地掌握它,然后再掌握另一个领域,再一个领域。你指出过这一点。拥有这种超人的广度、对所有领域都如此了解,却找不到那些把它们连接起来的闪电,这很诡异。我认为我们开始看到一些火花,它实际上开始在自己擅长的那些事物之间找到联系。我相信我们会谈到这个话题。如果黎曼猜想的解决之道在性质上与此类似,那在我看来,它与精通白领工作所需的能力相当不同。而且有理由相信,解答的性质可能正是如此。我不知道你是否了解 Hugh Montgomery 和 Freeman Dyson 在 IAS 的那段故事。这是个题外话,但很有意思。我不知道那是不是在午餐时发生的,总之,这位数论学家当时正试图理解黎曼 zeta 函数零点对之间的统计相关性。黎曼猜想的核心就是所有这些零点是否都位于一条直线上。他找到了一个可以提出的定量问题,并写下一个公式。它看起来像是 1/sin² 之类的形式。物理学家 Freeman Dyson 说:“我认识这个表达式。这个表达式在研究随机 Hermitian 矩阵的特征值时会用到”,而随机 Hermitian 矩阵又出现在研究原子核能级的问题中。这两个看似不同的东西在统计上竟然相同,这一想法促使人们探索随机矩阵理论中是否有某些方面可能与黎曼 zeta 函数相关。那里是否真能结出果实,我认为在某种程度上仍是一个未解的问题。但把两个不同领域这样桥接起来——如果黎曼猜想的解答最终被证明是沿着类似这样的思路进一步探索——那恰恰符合你预期 LLM 擅长数学的方式。它们是量子物理的专家。它们是解析数论的专家。它们应该能够看出这种相似性,而不需要 Montgomery 和 Dyson 恰好共进午餐并碰巧聊到这件事。这与白领工作完全不同。如果你很难把 AI 当作编辑来用,那并不是因为它们无所不知,而你只需要让它们找到那道灵光一现的闪电。另一种可能性是……什么样的类比才恰当呢?也许如果我们想想费马大定理,从费马提出这个问题的那一刻,到最终的解本身是什么样子——而这个解最终涉及数学中如此沉重的机器。这个问题的美妙之处在于,你可以把它表述得如此简单。你问的是 xn + yn = zn。当 n 大于三时,它是否有整数解?你可能会期望存在一种初等数论的方法来解决它,但据我们所知,就是没有。而实际的解,也许存在某种更简单的东西,但这可能就是它必须的样子。有如此复杂的一套思想,建立在数百年围绕椭圆曲线的工作之上。然后还有另一座思想的大山,围绕被称为模形式的东西。这两座大山都必须先被建造出来,你才能提出正确的问题将它们连接起来。如果黎曼猜想的解涉及建造一座新的大山,那是一种技能——提出正确的新想法的能力——这种技能与他们目前智能的特征感觉足够不同。严格来说,这并不是你从雇来的视频剪辑师身上所需要的东西。但如果它能够建造出正确的新理论的大山,将我们应该如何思考一个主题凝练出来,那就是如此高水平的智能,如果它不渗透到经济中除数学本身的大山建造之外的其他方面,那才会令人惊讶。Dwarkesh Patel 或者至少,即使它不能字面意义上做到白领人类能做的每一件事,它也会产生变革性的影响,就像在 IMO 中拿到金牌并没有对世界产生变革性影响一样。首先,我确实想指出,我在这里完全是在移动球门柱。当我两三年前采访 Dario 时,我问过这个问题:为什么他们一直无法利用其庞大的知识将想法连接起来,从而以那种方式做出新发现。这看起来就是那种情况:哪怕是一个智力中等的人,只要掌握了这么多信息,就能根据“这种药会导致偏头痛,而另一种东西有那种作用,也许同一种药能同时治好这两种病”这样的事实,做出一个医学诊断。从外行人的视角看,数学显然就是这样一个领域,而找到单位距离问题猜想的反例,就是这类事情的一个例子。所以这完全是不断挪动球门。但接着我们可以问,下一个基准是什么?既然 AI 已经能做到这件我们本应认为它们能做到的事,那么下一件会相当令人惊叹的事是什么?这里有几个候选想法。一个是首先提出有趣的问题,另一个是提出新的对象类别或概念化方式,从而创建或统一各个领域。关于第一点,现在我们之所以有这些千禧年大奖难题,是因为数学家们注意到了它们。黎曼提出了黎曼 zeta 函数这个概念,是因为他认为这个函数的零点会与素数密度存在某种联系。弄清楚我们最初为什么会认为这是一件值得研究的有趣事情,我们为什么要构建这个对象并试图回答关于它的问题——而且是回答关于它的这个特定问题——看起来就是那种会成为下一个基准的事情。Grant Sanderson 你在这里指出了两个相当不错的例子。对于任何对单位距离猜想感到好奇的人,有一个叫 Polylog 的数学频道做了一期非常好的视频,他们在里面讨论了这个问题。所有这些讨论都促使人们反思做数学的过程。他们会说:“哦,这东西能做这么令人惊叹的事。那对我们意味着什么?”那期视频里有个人强调了一句名言:“好的数学家证明定理,伟大的数学家提出猜想,而最伟大的数学家提出定义。”这或多或少正是你这里的框架。我们需要猜想生成器,然后是定义生成器。那才是顶级数学家。我不太明白你要怎么把它做成一个基准。通常,当我想到“基准”这个词时,我想到的是某种球门柱式的东西。球要么穿过球门,要么没有。你可以明确地说:“是的,这件事完成了。”一部分是为了能够做像 RLVR 这样的事情,但另一部分也只是为了知道你在回答时没有移动球门柱。OpenAI 可以把 disproving the unit distance conjecture 作为头条,因为这是一件清晰、明确的事情。它做到了。而想象一下,试图用 GPT-5.4 提出了一个非常好的猜想作为头条。“我们保证,所有人都认为这是一个好猜想。”这感觉就是不一样。但也许这并不能否定它正是应该被思考的方向这一事实。如果它最终呈现出基准的形式,也就是我们有一个分数说它通过了,因为我们可以量化一个猜想有多好,我会感到惊讶。它所需要的本质,很可能是你在与数学家交谈时,会感受到一种语气上的转变,关于与它合作有多么有用。你提到的这个系列,目前完全还没制作出来,可能还要几个月才会推出,形式是我们采访很多数学家。有趣的是,我们大约一年前就开始做这件事了,而看到他们在 2025 年中期和我们现在所处的 2026 年之间谈论 AI 的方式出现了一点语气转变,这很有趣。在现实世界中,这是非常短的一段时间。在 AI 世界里,这是极其漫长的时代。我们能够看到在这些漫长时代中的这种语气转变。我认为你衡量猜想生成能力的方式会更主观,基于这种语气转变。那将是数学家们说,他们不只是用它来解决自己的问题,而是当他们退后一步,决定自己的研究领域究竟应该是什么时,与某某模型的对话对此确实有帮助。我不认为它很可能会以那种头条新闻的形式出现,说什么又一个基准被攻克了。00:11:32 – 概念性突破的验证循环可能长达一个世纪
Dwarkesh Patel:这非常有意思。你无法为之制定基准测试的那些事情,至少在当前范式下,也恰恰是你无法轻易为之训练的那些事情。基准测试和训练环境之间其实并没有根本性的区别。你很容易构想出某种二分法——“这就是 AI 无法做某件事的深层原因”——然后事实证明,你只是思考方式错了,实际上它很快就能做到。但我要提出——Grant Sanderson:你还是要提出几个的。Dwarkesh Patel:很可能最终会发现,我们有一些方法可以在相对近期内训练 AI 去做这类事情。但这似乎必须不同于当前的 RLVR 训练。我好奇的事情——也是在我看来推动了数学以及整个科学领域许多重大进展的事情——是提出一种思考问题的新方式,或一种理解世界的新方式,它统一了不同的领域,催生出全新的领域,并解决了我们最初甚至没想解决的问题。爱因斯坦思考广义相对论的原因,并不是因为他想解释光为什么会弯曲,或者黑洞为什么存在。这些现象他本来甚至不需要被解释。在数学中,作为一个连自己在说什么都不懂的外行,似乎常常有一些证明特定问题的方法,能够激发一种新的概念化——它催生出一个全新的领域、一种全新的思维方式,极具生产力——而另一些方法则不能。我很想听你谈谈伽罗瓦提出群论,将他关于五次方程根式无解法的解法与之区分开来,以及阿贝尔在几年前提出了一个不同的证明,却没有提出群论。如果你想对群论是否是一个有趣的概念做一个验证回路——这里是否做出了有用的东西,或者为什么这个证明更好?——这个验证循环可能长达一百年。它涉及密码学的成熟、物理学的进展,以及群论中的思想与理解物理学中对称性产生关联。关于这个想法最初为何是一个富有成效的概念,存在一个长达一百年的验证循环。Grant Sanderson:你触动了一根神经,因为我在 2022 年本来要做一个关于 Galois 的项目,后来搁置了,但我花了生命中一年的时间大量思考他的工作。我有可能不小心在细节上讲得太久,你可以随时拉住我。这对你的论点来说是一个完美的例子,因为描述它为何是一个有价值的洞见,并不来自即时的实用性。当然,如果你考虑的是 RLVR 环境,这会非常难做。但有趣的是,即便有当时的人类验证者,也需要非常长的时间才认识到它有用。对于 Einstein 和广义相对论,人们能立刻感觉到这是一个好理论。Galois 理论之所以是这样一个有趣的例子,是因为你确实有这样一个长达一百年的片段,一个想法流经许多不同人的头脑,最终才沉淀为数学界公认的好东西。稍微往回退一点……你想听这个问题的背景吗?我们在学校里都学过二次方程求根公式。Dwarkesh Patel:我以为你要说我们在学校里都学过群论,但我错过了那节课。Grant Sanderson:我们在学校里都学过群论……不,是二次方程求根公式。这是已知的。某种意义上,希腊人能解二次方程,但他们并没有真正用代数来书写。真正写下那个公式的是阿拉伯人。有一个关于意大利数学家决斗的趣闻——不是真正的决斗,只是智力挑战——他们秘密地找到了三次方程的求根公式,然后紧接着又找到了四次多项式的求根公式。所以对数学家来说,一个自然的开放问题就是:你能找到一个解五次方程的公式吗?四次方程的求根公式是个庞然大物。把它完整写下来会非常疯狂。你通常不会把它完整写出来,而是把它拆解成一套程序化的步骤。你可能会相信这些东西具有这种指数级增长的复杂性。所以几百年来,没有人真正回答过这个问题。通常我们说,阿贝尔是第一个证明这一点的人。他是那位年轻早慧的挪威数学家。他证明了这根本不可能。并不是说你找不到五次方程的求根公式。他最初以为自己找到了一个,但他证明了这是不可能的。不过我认为真正的功劳,你得往回退一步,谈谈拉格朗日。他找到了就这个问题该提出的正确问题。我会用非常高的层次来讲。他在研究这个问题时认识到,能够求解这些多项式,与理解某些代数表达式的对称方式密切相关。如果我写下 a + b + c + d,只是把四个变量相加,然后对它们做置换,表达式的值不会改变。而如果我写 a + b * c + d,有些置换不会改变它,但有些会。他有一个非常漂亮的洞见:如果你能找到含有四个自由变量的表达式,但在所有置换下只取三个不同的值,这与能够把四次降为三次之间有着意想不到的关系。他开始探讨我们能否找到五次多项式的求根公式,方法是思考他能否扩展这一方法。要扩展这一方法,你就必须有一个含有五个自由变量的表达式,使得当你对它们进行全部五的阶乘种置换时,它只取四个或更少的值。你可以把这个放进一本谜题书里。你可以把它放进一道十二岁孩子就能参与的脑筋急转弯里。你并不难发现自己会觉得那是一项不可能完成的任务。拉格朗日就坐在那里说:“这里有一个解决寻找五次多项式求根公式这一问题的策略。它似乎可能是不可能的,至少从这个策略来看是如此。”但那是历史上第一次,人们本能地意识到,关于对称性的某种问题才是研究这些多项式的正确途径。在他心里,那只是一种方法。当时人们尚未发现,实际上存在着更紧密的联系。而且,也许与其寻找那个公式,我们不如反过来问:你能证明它是不可能的吗?他算是埋下了这颗种子。大约五十年后,Abel 肯定读过 Lagrange 的著作并受其影响。我们知道 Galois 在爱上数学的时候非常喜欢 Lagrange。很难想象这两位年轻天才围绕那个问题得出相当相似的洞见,不是源自 Lagrange。但就你关于能否验证这是一个好想法的问题而言,Lagrange 并没有得出任何结果。他没有解决这个问题,所以这并不是一个基于某个解而知道这是正确问题的情况。他只是提出了这个问题。它本身有某种内在的趣味。而且这在当时对数学也并不太重要。大多数人更感兴趣的是它在物理学中的应用。这几乎是一种附带的、消遣性的、业余爱好式的东西。Abel 开始研究五次方程相关的东西,但后来有人建议他把更多精力花在研究椭圆函数上,所以在他英年早逝之前,他的更多工作是在那方面。他二十六岁时死于肺结核。然后 Galois 把这两个想法都推向了正确的方向,他真正理解了抽象的本质。他在狱中写过一篇非常出色的文章。我们可以好好聊聊他的人生故事。那相当疯狂。但他这个十几岁的少年,身在狱中,他曾试图提交自己的数学论文,却被拒绝了。所以,再次想想可验证奖励,当时作为验证者函数的学术界拒绝了他写的东西。坦率地说,那并不太连贯。它不是一个完整的证明。他并没有清晰地表达出这个理论实际上是什么。他当时只是个初出茅庐的年轻数学家,还在摸索自己的方向。那里可验证的回报是:“不行。”但他有一种直觉,觉得那里确实有些东西。于是他写下了这篇慷慨激昂的论述,谈数学的本质是某种会随时间经历这些转变的东西。他谈到了代数本身的诞生,以及从仅仅用数字来思考,到对纯代数表达式拥有某种流畅的驾驭能力,在这种驾驭中你不再被束缚于对这些表达式的解释。他有一种直觉,觉得似乎还有另一层抽象是我们应该去做的,即与其思考公式本身,不如思考那些公式背后潜藏着怎样的对称性。但这仍然是一个相当不明确的理论。如果你想说的是,可验证的回报在于他解决了一个别人没能解决的问题,那么,Abel 已经证明了五次方程不可解。那么 Galois 在做什么呢?原则上,Galois 理论让你可以取一个特定的多项式,并给你规则来判断这个特定多项式是否有你能写下来的根。例如,对于 x5 - 1,你知道一个解是 1。或者 x5 - 2,你可以写下 2 的五次方根。所以并不是说每个五次多项式的解你都写不出来,而是你能不能找到一个特定的多项式,证明你无法用根式写出它的解?他甚至连这一点都没有精确地解决。他并没有针对一个具体的例子证明他做不到。甚至描述他到底解决了什么问题都非常棘手。然后他就死了。这是一个非常浪漫的故事,他经历了一场决斗。关于他据称在决斗前夜写下自己所有想法的传说有很多,但实际上,他之前已经尝试过五次让它们发表。Dwarkesh Patel 研究五次方程似乎对你的健康不利。Grant Sanderson 非常不利。如果你是个年轻的天才,别去碰五次方程。他请求他的兄弟和密友把他的笔记交给 Gauss,把这些笔记交给当时重要的数学家,因为他觉得那里有些东西。即便如此,它也并未真正被接受。他的兄弟和朋友试图把这些东西整理出来,但又过了二十年,Liouville 才看到这些笔记,看出其中或许有些东西,并试图把它们整理清楚,理解 Galois 到底想表达什么。即便到了那时,又过了大约二十年,Jordan 才真正构建出某种类似现代群论处理方式的东西,而他们将其归功于 Galois。你完全可以想象历史走向另一条路:这些思想从数学的其他节点浮现出来,而如果 Galois 不是一个如此张扬的人物,他可能早已被历史遗忘。但从 Lagrange 隐约意识到“根的对称性或许才是正确的方向”那一刻起,到这一切看起来像现代群论,中间横跨着漫长的岁月。很多时候,它甚至通不过人类审稿人那种已验证的奖励。它被放到某人的桌上,而他们说:“我不太确定这里面到底有没有东西。”你必须要有那么一个人认出它的价值。即便到了那时,它在那个阶段也并没有真正解决实际问题。你提到了密码学和物理学之类的东西。你必须进入二十世纪,才有 Gell-Mann 想到:也许理解某些群如何分解的本质,与粒子由什么构成之间存在关联。他基于一个纯粹的群论问题预见了夸克的存在。这是群论比较有趣的应用之一:连预测夸克的存在都是一个群论问题。那已经是 Lagrange 之后很久很久,才有这样的东西。所以你必须问:衡量进步的方式是什么——不是基于解决某个问题,而是以某种方式捕捉到 Galois 心中那个直觉,当他说“我觉得这里面有东西”的时候?Lagrange 心中那个直觉是什么,当他说“我觉得这才是思考它的正确方式”的时候?Liouville 心中那个直觉是什么,当他说“这个早已逝去的年轻人留下的这些零散笔记,也许自有其价值”的时候?这真的很难说清楚。我现在正在制作的另一个系列视频,讲的是整个"压缩即智能"的理念。虽然这并不是我真正采取的角度,但"更小、更具预测性的表达显得更智能"这个想法确实有几分道理。所以我想知道,你能在多大程度上围绕某种可验证的奖励来做文章——不只是关于你是否解决了问题、或者解决的是什么问题,而是关于解决问题所需概念的精简程度。回到黎曼猜想的解法,如果 AI 解决了它,那会是什么样子?我认为它可能发生的第三种方式就是它单纯更努力地工作。同样地,也许你可以有一个费马大定理的初等证明,只是铺陈在数千页中,读起来会毫无连贯性。但更清晰的视角是用椭圆曲线那一套来看。也许存在某个无人能从中真正获益的、长达千页的黎曼猜想证明,而你真正想要的是那些简洁、压缩版的想法,它们才能为人类所理解。也许你可以把柯尔莫哥洛夫复杂度引入到你量化"优雅"的尝试中。我不认为这很容易,但我确实认为,为了奖励那种伽罗瓦式的直觉,而不是仅仅奖励你是否解决了问题,这是你必须做的事情。Dwarkesh Patel:为科学制定启发式方法非常困难。但很明显,人类一直在以某种方式做到这一点,而且显然,AI 终将在某个时刻做到。Grant Sanderson:这不仅在可验证奖励方面是相关的,而且大概来说,最终目标是理解——人类的理解。即使你确实有某个数学东西的千页证明,或者某个宏大的新物理理论,目标也是理解。也许如果目标是预测性,你大可以让自动化工程师去造火箭飞船,我们完全不知道它们如何运作,但我们可以在星际之间穿梭。但会有很多人想要理解。你仍然会需要那种凝练功能,把这种复杂的思考方式提炼成正确的那一个,就像牛顿的万有引力定律那样。你仍然会想要训练 AI 能够做到这一点,并找到压缩后的表示。00:26:12 – 我们能理解 AI 对黎曼猜想的证明吗?
Dwarkesh Patel 人们尤其对数学有这样一种担忧:AI 会证明黎曼猜想,而我们对数学的理解并不会因此变得更好。对此我有几个问题。第一个问题是,这是否是你应该预期会发生的事。人类在解决一个大问题时之所以会提出通用的、自然的研究对象和子目标,难道不正是因为当你试图攻克一个复杂而重要的问题时,这样做本身就是有用的吗?从理论上讲,相比于仅仅提出与思考该问题相关的自然抽象概念,这甚至会不会是解决黎曼猜想的一种更简单的方式?第二个问题是,从经验上看,当如今的 AI 在问题上取得进展时,我们观察到的是这种情况吗?当 AI 提出那个关于单位距离猜想的反例时,你可以直接阅读它的思维链。我看不懂,因为我对数学一无所知,但对其他数学家来说,它似乎是可理解的。它利用了已知的数学概念,并证明了它们之间的关系,全程都用自然语言表达。因此,它加速了我们对这个对象与这个猜想之间联系的理解。从经验上看,这是我们应当担心的事吗?Grant Sanderson 我认为这取决于其性质……如果我们把解决黎曼猜想的三种可能方式拆解开来……今年另一个重要的例子是某个编号为 1196 的 Erdős 问题,关于所谓的本原集。它具有那种从看似不同的领域引入一个想法的特征。一旦你把基本想法呈现给一位数学家……你说:“如果我们尝试马尔可夫链过程,我们以自下而上的概率方式而非自上而下的方式证明这个东西,并使用 von Mangoldt 函数,会怎么样?”如果你对懂行的人这么说,他们就知道该如何推进。你有了这个非常小的想法,它的形式是一个领域的专业知识与另一个领域的专业知识的结合,在两者之间画出一道小小的闪电。这些都会非常容易被人类解析,因为你只需要展示那些连接关系的起点和终点。如果它的性质是构建一座山,你就必须投入更多时间去理解那座新建成的山,因为它是一条全新的线索,而不只是它们之间的一道闪电。而如果进展的本质只是纯粹的苦干——一条超长的推理链,没有任何新理论——那么你就会对整个过程的理解消化有所担忧。所以我不认为有一个明确的答案。这取决于解决方案会是什么样子。在构建山的那一侧,能看到它实际上会非常有意思。它是否默认就非常容易被人类理解,就像我们看到伟大数学家的新理论那样?还是说它是一座异质的、不同类型的山正在被构建,而我们不得不重新处理我们所使用的各种抽象概念?这里最接近的例子是对 abc 猜想的尝试性证明。我们也许不该深入讨论那个,但它很可能不是一个正确的证明。基本上,这是这位在日本原本声誉卓著的数学家想出来的一整套全新思维方式。数学家们花了很长时间才勉强解析他在说什么,但它给人一种异质数学的感觉,是理论构建,而不只是一条长长的推理链。他称之为宇宙际几何。最大的恐惧是 AI 做了那样的事,然后就像 abc 猜想一样,人们花了好几年去爬那座山,然后他们说:“该死。这根本不对。”如果它最终被证明是错的,但它看起来确实像是对的。即使它是对的,爬一座新山也要付出大量努力。Dwarkesh Patel 如果我们最终陷入那种局面,David Bessis 写过一篇非常棒的博文,叫《定理经济的衰落》。他谈到,从历史上看,正如你所说,数学就是提出这些定义和问题,然后围绕它们证明定理。定理证明那一块拿走了所有的功劳,但它其实是寄生在“想出定义”那一块之上的。从历史上看,这在功劳分配上一直不是问题,因为如果你提出了一个定义,你很可能就是那个提出定理的人。但现在我们面临的情况是,如果真正有价值的工作在于提出洞见,而 AI 自动化了后一部分……想象这样一个场景:AI 针对世界上若干重要猜想提出了类似阿贝尔式的直接论证,然后我们就有了这些证明。接下来就轮到人类或未来的 AI 去整合了。再说一次,我对这个论证本身没有任何对象层面的理解,但我确信如果你能接触到它,它会让你更容易思考到底发生了什么。是否存在某种更深层的方式,让我们能够理解这个证明为什么成立,从而更容易想出群论背后的那些想法?Grant Sanderson 我觉得那会极其有帮助。尝试发现新数学的过程,很大程度上就是在不断犯错。你在试图解决一个问题,感觉并不像是在稳步地沿着正确的台阶往山上走。大多数时候感觉像是一场随机的醉汉漫步,你做了一件事,然后发现错了,不断发现自己错了。如果至少你知道,试着消化你手头的东西最终会导向一个正确的解,那感觉就像是进步,仅仅因为你知道它通向一个解。在数学的近代史中,有很多例子让人感觉是伸手超过了所能触及的,事情在被理解之前很久就被证明了。我最喜欢的一篇论文开头——它甚至不是研究论文,更像是一篇阐述性的文章——出自一位名叫 Timothy Chow 的数学家,他当时试图理解一个叫做力迫(forcing)的概念。有一个叫做连续统假设的问题,它大致是在问:自然数有一个无穷的规模,实数有一个无穷的规模。它们之间是否存在某种东西?答案是既肯定又否定。这取决于你的公理体系。它超出了我们通常的公理体系范围,这是一个有趣的答案。但描述它的方法真的很难理解。就是所谓的力迫法(forcing)。在这篇论文的开头,他写道,每个人都知道未解决的研究问题的概念。我想提出一个未解决的阐述性问题的概念。当然,我们已经证明了它,但我们并不真正理解它为什么成立。然后他提出了对这个阐述性问题的部分解决方案。你可以想象我为什么喜欢这个框架,因为这就是我的全部人生。我不做研究数学。它完全关乎什么是最清晰的理解方式,即使它已经被证明了。证明和解释之间存在区别,我认为你正在触及这一区分的重要性。Dwarkesh Patel 是的。那将是主要的激励因素。或者说激励因素必须改变,不仅在数学领域,在其他科学领域也是如此,从证明关于世界的事情转向将证明整合为问题或更高层次的洞见。我们之前在午餐时讨论了你最近关于设计以及它如何帮助我们理解事物的演讲。在极限情况下,一个概念的概念化与概念本身之间真的有区别吗?如果你想想狭义相对论和时空图,以及闵可夫斯基时空,这是一种我们用来阐明为什么会有长度收缩和时间膨胀的方式。但那就是现实……所以,在这里,阐述在某种意义上似乎就是解释。Grant Sanderson 那里有几件有趣的事情。一是,提出真正新颖洞见的人与在沟通中表达相当清晰的人之间,似乎存在非常强的相关性。你可能会想象相反的情况,鉴于大学生的体验往往是,教他们的专家不一定是该主题最好的解释者,因为他们被自己的专业知识惯坏了。但至少在某些情况下,看起来确实如此:那些真正提出相当新颖想法的人——比如爱因斯坦或克劳德·香农这样的人——你去读他们的论文,会发现写得非常清晰透彻。不会让人觉得这是专为专家写的、你得拿砍刀劈开才能读懂。他们都是非常出色的阐述者。费曼也有这个特点,他是一位非常优秀的阐述者。也许大脑中在研究层面想出正确的新思维方式的那部分,同时也具备出色解释的能力。我认为这与 AI 有关。我以前认为 AI 会变成自动定理证明器,而数学家的角色将转向我这样的工作——解释这些东西。现在我开始怀疑,实际上 AI 在这方面也会相当擅长,可能比大多数人类更善于解释和提炼。所以,消化并解释正在发生的事情,可能实际上并不是留给数学家的东西,从这些事情的发展趋势来看就是如此。我们可以讨论这为什么可能不成立,但很可能,那个能想出解决某个新问题的绝佳新想法的东西,同时也擅长解释它。这就是我的信念发生改变的一个方面。Dwarkesh Patel 你觉得你最后在做的事情会是什么?你个人,以及人类数学共同体。Grant Sanderson 我可能会一直做我现在做的事,直到我死去。Dwarkesh Patel 如果末日论者是对的,也许会是同样的原因。Grant Sanderson 是的。你给一个人生一堆火,他暖和一夜。但你把一个人点着了,他暖和一辈子。这就是我对 AI 的态度。解释者或教师的部分功能,是让某个人好奇的事物变得清晰。这是一方面。但另一部分更多是关系性的,提供动力和一种策展感。我听过一个关于数学家最终会变成什么样的有趣观点,那就是实际上这更像艺术博物馆的策展人,而不是其他任何东西。AI 把问题解决了,所以艺术就存在了。它们甚至知道如何把这件事解释得非常清楚。但你仍然希望有人能帮你在这片近乎无限的、关于哪些想法值得投入的空间里导航。即便 AI 在某种意义上更擅长这件事,我认为我们始终还是会偏好一个与我们有过关系的人,因为我们被激发去对事物产生兴趣的方式,本质上是一种社会现象。如果你要构建的是某种特定的技术,那情况可能不同。但听这档播客的人,信任的是你对什么才算有趣话题的策展。他们来到这里,并不是因为无论你下一个话题是什么,那恰好就是他们此前就想弄明白的东西。他们信任的是你作为策展人的角色。所以我的角色,可以说其他数学家的角色,可能实际上只是微妙地转向那种策展方向——判断哪些想法值得追求。这正是我现在工作的一大部分。我认为人们很多时候以为,一个视频的大部分功夫都花在视觉呈现上。当然,确实如此。那并不是立刻就能完成的。但实际上,很大一部分工作只是决定一开始什么值得说、什么值得放进去。我想要参与这件事,而且我认为我和某些人之间存在信任,他们好奇我会选择推出什么,即便 AI 在这方面更强。这和人声音乐人始终会有一席之地是同样的道理:他们背后故事的那种社会功能,即便某个模型产出的 MP3 文件在客观质量上更好。这就是我所看到的、正在发生在我工作上的变化。00:38:08 – AI 能发现领域之间隐藏的桥梁吗?
Dwarkesh Patel:我想回到之前的一个问题。就在 AI 刚刚跨过这道门槛——也就是能够把已有想法连接起来、从而得出新发现或证明/证伪某个命题这一重要基准——我们就在想:“好,那下一件事是什么?”Grant Sanderson:顺便说一句,这件事上还有太多可做的。仅仅因为已经劈出了几道闪电……我认为未来几年会有一个真正把这些连接起来的繁荣前景。Dwarkesh Patel:对。所以从极限上说,你甚至可以说——我不知道这是否准确,但有可能——很多最重大的突破在某种程度上看起来都是这样的。就拿广义相对论来说,你不过是在把黎曼几何和狭义相对论连接起来。所以随着 AI 在这种“连接”能力上越来越强,也许很多重大突破在性质上其实并没有本质不同。我不知道你对此有没有看法。Grant Sanderson:很多讨论都集中在解题以及数学的那种性质上,比如把 Erdős 问题一个个勾掉之类的。但我要说,甚至不到多数的数学家会把自己的工作描述为真的以攻克下一个待勾掉的问题为目标。你熟悉 Langlands 纲领吗?Dwarkesh Patel:不熟悉。Grant Sanderson:它甚至算不上数学的一个领域,更像是一种研究精神气质。费马大定理就是其中一个端倪。你有两样看似毫不相干的东西,而它们之间的联系带来了一个解。Langlands 是一位数学家。他有一封著名的信,基本上阐明了为什么很可能存在更多这样的联系。他甚至对这类联系的性质讲得更具体了一些,以至于你可以想象这样一张巨大的地图,这边有一道山谷,那边有一座山,再那边是一片平原。有很多数学家会把自己的工作描述为试图理解这张地图上那些线索的一部分。那里的进展,甚至不是“这里有一个我们知道会被那种联系解决的具体问题”。更多的是,一次又一次地出现这样的情况:重大问题被找到联系所攻克,以至于几乎是在预先寻找那些联系。这其实非常有意思。每当你遇到一位数学家,问问他们,他们工作的性质更接近 Langlands 纲领,还是针对某一个特定问题。你会看到某种二分化的分野。AI 成为超强连接器的可能性,感觉上可能是这一追求中的一种放大工具。不过,这很难衡量。这就切入了我们之前所说的:你如何给“是的,你做到了”这件事打分?如果它攻克了一个问题,你就有明确的方式说:“是的,你做到了。”你可以写出标题。你可以作为 AI 公司做公关动作,说:“我们做到了。”而如果感觉上那是应该建立的那个正确联系,你就可以围绕它写定理。这就是那个领域论文的样子。但我认为,这将需要多得多的“人在回路”,来说:“我们想要的那种联系究竟是什么?”这是我对未来五年这些模型大多数有用进展会是什么样子的猜测。它真的就是在填补那片联系的图景——如果你是多个领域的专家,你就能建立那些联系。正如你所指出的,有点令人惊讶的是,我们竟然还没有做到这一点。我会很好奇,从技术层面上讲,是什么促成了那里的突破。一方面,你可以在脑子里勾勒出一种解释,说明为什么你可能是所有这些领域的专家,却没有建立那些联系。当推理的方法是这种自回归链式思维现象时……如果你想一想,自回归其实是一种非常奇怪的生成东西的方式。你是一个聪明人。想象一下,我把你锁在一个盒子里,你与世界互动的唯一方式是收到一张纸条,然后有人说:“你能预测接下来会发生什么吗?”你预测接下来会发生什么,然后你的记忆就被抹除了。你又拿到一张纸条。想象这个过程重复了很多很多次,然后最后出来的东西是——他们说:“看看你写的这篇文章。”你可能会看着它说:“这太糟糕了。这不是我会写出来的文章。”反复预测某件事的过程,和作为一个写作者去构思、去思考成文的过程,是相当不同的。尤其是,很可能发生的情况是,你成了你上下文的奴隶。你可能在回答某个特定领域的某个问题,所以你会调用围绕那个问题的一切上下文。但所有实质内容将要来自的那个连接,从本质上说,是一个非常不可能的连接。你可以做任何你想要的 RL 来试图以某种方式变得更好,但那个专门在加权和激励你去建立这些不太可能的连接的东西是什么——当这些连接中的绝大多数都不是那里会出现的可预测的下一个 token 时?所以情况可能是,你确实有这种智能锁在那个盒子里,但它是一种奇怪的与之互动的方式。我好奇的是:你有没有通过质疑 token 是如何生成的这一前提而获得过任何成果?我不认为这会像操纵 temperature 那么简单,但有没有什么事情是你可以做的,能够利用现有的智能水平,同时找到正确的方式来激发那些连接,从而解锁我们已经看到的这类东西?还是说你只是需要再多一点智能,以至于在预测的层面上,它就能预测出它应该向另一个领域打出那道闪电?Dwarkesh Patel 我认为,与其去推理架构甚至损失函数,不如去推理数据,这样更有成效。我们有能处理文本的扩散模型,而它们生成的东西在性质上并非完全不同。只是它们被探索得还不够多。我认为更关键的问题是:无论你采用什么架构或损失函数,它激励你产出的数据究竟是什么?看起来它们确实在变得更好。先不谈数学。我们确实有过几个这类例子,但如果你只看它们为什么在作为自主智能体方面越来越强……它们所处的环境是:它们自回归地生成这样一步——“让我们退一步,在整个代码库中做一次搜索”,然后“让我们退一步,评估一下我的错误”,而正是这种做法奏效。我猜想,在科学或数学取得进展的情形中,你面对的是前沿数学类的问题。数学家专门设计这些问题,是因为它们要求把两个不同领域连接起来。我猜有各种各样巧妙的、部分合成的方法来制造越来越难的这类问题,它们要求这种连接——例如,通过消除假设、同时仍然要求 AI 得出答案——这样一来,损失函数是什么其实就不太重要了。真正关键的是,你能否想出一个能激励这种能力的环境?Grant Sanderson 感觉你应该能做到。我当然说不出实现这一点、解锁这一切的正确方法,但那会相当令人意外。你不觉得吗——如果在接下来三年里,这类灵光乍现没有多得多的话,那会很令人意外。Dwarkesh Patel 我认为这是一件值得思考的重要事情。我们常常思考单个系统有多聪明。而我们不去想 AI 拥有的一些优势更多是源于关于它们的其他事实。所以在这个语境下,关于它们的关键事实是:我们可以直接并行化并任意扩展它们。无论它们的能力处于什么水平,都不只是数学史上某位特立独行的天才建立了一些联系然后死于一场决斗。而是把那条水位线普遍地应用到该能力水平所能触及的所有问题上。这是数字心智天生具备的众多优势之一,而我们对此思考得还不够。其他优势还包括:它们可以把所有知识融合在一起——或者至少会有技术让这成为可能——而且你可以复制出拥有完全相同知识水平的副本。这种并行化是一个相当重要的特性。我很想听听你的预测。即使它们不如人类数学家那么聪明,出于公关原因,AI 公司正把数十亿又数十亿美元砸向这件事,这意味着数量本身就有其质量。Grant Sanderson 这看起来方向是对的。如果我们拿 Montgomery 和 Dyson 在 IAS 的那次对话来说,它暗示了黎曼假设——或者说黎曼 zeta 函数零点——与随机矩阵之间的某种联系,那感觉就是你可以尝试自动化处理的那类事情。你有代表各个领域专业知识的智能体。我们都知道一个研究所比一个人更聪明。把人们聚集在同一个地理位置的 reason,就是希望那些偶然的对话能够发生。那么,在智能体之间设计出这种偶遇,会是什么样子?这很有意思,因为你指出你可以把所有知识汇聚起来,但我真的怀疑,其中一个优势是否恰恰在于你可以做相反的事。有时当 AI 失败时,是因为它陷入了一条糟糕的思维链,而且很难摆脱出来。于是你说:“我重新开始。”人类也是一样。有时你开始以某种方式思考问题,而所需要的只是退回来。有一些故事讲的是人们长期试图证明某个东西,然后到了某个时刻他们说:“等等。如果我试着去证明它不可能,或者去证明相反的一面呢?”把自己的上下文卸下来,用一种全新的头脑去处理……你可以想象把这套做法系统化,或者让多个不同的智能体刻意被赋予不同的上下文片段,然后在那里做比较和对照。我们对自己的上下文并没有同等程度的操控能力。在这个 AI 与数学系列中,我们要做的第一集将关于他们解决 IMO 的那次经历。我想聚焦于他们失败的一道具体 IMO 题目,那是一道很多非常聪明的学生都失败的题。Terry Tao 也在这道题上失败了。人们对这道题非常恼火,因为他们称它是一道钓鱼题。我几乎不想剧透,因为我想围绕着一个思路来构建这一集:引导某人进入,却不让他们知道这道题其实有一个简单的解法。你真的能共情一个学生解这道题时是什么感受。基本上,有一种非常优雅的思路,会让你觉得基于这是一道国际数学奥林匹克题目的上下文,这一定就是解法。这个解法的气质真的很诱人,但很难证明它是最好的。原因是,它并不是。存在一个几乎不用动脑的解法,那才是最好的。这件事与整个 AI 故事的相关性在于:对一个人来说,回答那个问题所需要的是逃离你的上下文。逃离身处 IMO 的上下文。逃离你被训练来解这类竞赛数学题的方式的上下文。如果你只是把它当作我在街上随便找个人扔过去的脑筋急转弯来处理,他们很可能会答得很好。在其他情境下的人类研究中,你有时也想要同样的东西,就是能够刷新自己的思维,以一种完全不同的方式来处理它。在数字心智拥有的所有优势中,这实际上可能就是其中之一:一种更系统化的刷新思维的方法。衍生出两个智能体,一个试图证明它,一个试图证伪它,一个用这种方式尝试,一个用另一种方式尝试。他们刻意拥有不同的上下文。我很好奇,如果三年后我们再进行这样的对话,那些登上头条的重大成果中,有多少具有这样的特征:基本上是抹除先前的上下文,尝试一堆不同的东西,而不是合并一堆不同智能体的结果。Dwarkesh Patel:这非常有意思,因为人们对 AI 的一个常见担忧就是这种熵坍缩——它们全都以相同的方式思考,因为它们是以相似的方式训练的。这就是它们不擅长写作的原因。它们沿着同一条路径前进,有着相似的说话模式等等。但也许 AI 的关键优势在于,你可以系统性地……听起来,单位距离问题猜想之所以花了那么久才被证伪,原因之一就是人们假定这个猜想实际上是真的,所以他们大多在试图找出证明它的方法。也许 AI 的关键优势之一,就是通过系统性地同时尝试对任何给定命题的否定和证明其肯定,或者能够系统性地给不同智能体赋予不同的偏见,来增加熵。在人类科学史上,一件重要的事似乎是:爱因斯坦深受这样一种偏见的驱动——事物在不同参考系中应该看起来是一样的。他还有多个其他类似的偏见,但那个偏见对他的思考极具塑造作用。你可以系统性地考察一堆启发式方法,看看哪些在某个给定问题上富有成效。Grant Sanderson:所以你会建议在提示词层面系统性地增加熵,尽管你在自回归层面不可避免地会有这种坍缩?爱因斯坦会是个有趣的例子,因为他有一种倾向于事物是相对的偏见。他还有一种倾向于“上帝不应掷骰子”的偏见。你要确保不会意外地让你所有的 LLM 都变成爱因斯坦,因为你可能会让量子力学的进展停滞。Dwarkesh Patel:这说明科学并不存在唯一正确的启发式方法。你需要的只是多个独立的研究项目,各自拥有自己的启发式方法。Grant Sanderson:这感觉像是老派软件。只要你能以某种方式把它描述出来。你有老派软件来放大这种熵。如果你能为你想要激发提示的不同思维方式建立一个清晰的本体论,你就能探索整个本体论,然后每一个个体各自去执行它该做的事。这里存在一个设计问题:你究竟如何描述这些不同的方法。简单的一种是:你是想证明它还是证伪它?更难的一种是:你能采取哪些所有策略来证明这一点,并确保你在探索它们时应用了足够的广度。00:53:48 – 为什么现实世界的任务不适合放进 RL 环境
Dwarkesh Patel:显然,AI 在数学领域的进展比其他一切领域都快得多,人们把该领域的可验证性视为这一现象的关键原因。我认为这是两个重要原因之一,但人们确实忽视了另一个。我身处实验室之外,所以不知道实际发生了什么。这完全是一个朴素的理论。与 AI 为何在数学上进展如此之大相关的一个旁支问题是:为什么它在计算机使用方面如此缓慢?计算机是非常可验证的。我的 Etsy 包裹到了吗?我的活动预订成功了吗?这些都是极其可验证的事情,可供考察。计算机使用所缺乏的是可 grind 性。因为网站有机器人检测器——而且运行并行 rollout 需要消耗巨量算力——你很难在 Amazon 上对同一个结账流程运行一千个并行 rollout。你会被 Andy Jassy 关停。Grant Sanderson:他亲自出手。他按下 Dwarkesh 按钮上的红色 X。Dwarkesh Patel:正是。你可以尝试为每一个网站构建克隆,但那非常耗费人力,而且会拖慢你的速度。你目前之所以需要如此多的并行 rollout 才能通过深度学习学会一项技能,是因为我们还没有解决样本效率问题。Grant Sanderson:就像 Karpathy 说的,用吸管吸监督信号?Dwarkesh Patel:正是。当然,人们正在研究许多不同的技术,但根本上,我们训练 AI 的方式存在这个巨大的约束。对于代码,你可以把某一给定水平的进展容器化到一个代码仓库中,然后衍生出数百个并行容器,说“试着实现这个功能”,而它完全是确定性的。因为它是确定性的,你就能解决信用分配问题,因为你知道,无论是什么导致这个 rollout 成功、那个 rollout 失败,那个 diff 就是起作用的东西。如果你面对的情况是从不同的起点出发,这个信用分配问题就会变得难解得多。现实世界中的大多数事情都很难用同样的方式容器化。编程和数学是这条规则的例外。但如果你想弄清楚如何打造一项成功的新业务,或者如何花一天时间在市场里交易赚钱,那么你必须与现实世界互动、而事情每天都在变化这一事实,意味着你无法一直反复重放、刷练、在模拟器里刷经验。数学当然是例外,我觉得这是这个领域以及编程领域进步的重要驱动力。这不仅仅是可验证性;它必须是可刷练的。人们指出 AI 正在快速进步的第三个理由是,他们非常关注 Lean 和形式化。再说一次,我完全不知道实验室里在发生什么。我觉得对于 AI 当前的进步水平来说,Lean 并没那么重要。为什么 AI 能够证伪关于单位距离问题的猜想?他们发布了思维链,或者至少是思维链的改写版本。里面完全没有 Lean。我认为 Lean 所提供的那种基于过程的监督——你知道每一步都是正确的——相比起拥有这种可刷练、可验证的结果,似乎没那么相关。Grant Sanderson 关于可刷练性更重要这一点很有意思。天真地想,你可能会以为 Lean 为数学提供了某种独特的东西,因为你能看出它能否证明。你有老式软件可以告诉你是或否,然后你把它当作你的 VR。能佐证你观点的是最初的尝试。再说一次,我会绕回 IMO。最初,DeepMind 基本上就是这么做的。一切都在 Lean 里,然后到了第二年,全都用自然语言了。所以正如你所说,它并不是必需的。我确实认为形式化领域还有一个尚未被探索的好处,那就是目前你仍然需要人类来审查那个单位距离猜想的反例,然后说“看起来不错”。这为事物能被无止境探索的程度设定了一定的上限。如果你想想 AlphaGo 或 AlphaZero 风格的系统,它们就像身处自己的宇宙里,不停地下围棋、自我探索,可能完全偏离了任何人类需要关注的东西,但它们仍然拥有这种自动可验证的奖励。不仅仅是你可以在那上面做 RL,还在于你基本上永远不需要去查看它,你可以直接把算力倾泻到它们身上,让它们去探索围棋的宇宙。有意思的地方在于——也许这最终不会成功,但这件事是否会产出任何成果,目前还不该有定论——有了 Lean,你可以想象拥有一个基本上永不停歇运行的程序,不断尝试扩展 Mathlib。Mathlib 是那个 GitHub 仓库,基本上就是用代码写成的全部数学。它离全部数学还差得很远,但他们希望它能成为全部数学。它是用代码写成的,你可以问:“这个证明正确吗?”写这些证明非常耗费人力。围绕它有一整个子社区。但你可以想象拥有一个 AI,你对它说:“就去试着扩展 Mathlib。”也许它是 Mathlib 的一个 fork,这样里面就不会有垃圾,因为人们对里面该有什么东西是有一定品味的。所以你有了自己的纯 AI Mathlib 的 fork,它就一直跑下去,不停歇。它不需要任何人来查看。它可以一直跑下去。它可能会提出自己的猜想。它可能会提出自己的理论和不同的定义。也许其中很多都是没用的,但它拥有这棵可以无限生长的树。这是数学拥有而其他任何东西都没有的非常独特之处:你可以按下开始键,直接把算力倾泻上去,转头十年不看,然后回来说:“你有什么成果?”总会有一些东西。然后问题就来了:它有用还是没用?你怎么弄清楚这一点?能够做到这件事本身就很有意思。如果这没有从中产出某种有趣的数学洞见,那会非常令人惊讶。在这个故事里,Lean 的重要性体现在两个不同的方面。第一个问题是,你怎么能做到放手不管、甚至都不去查看,进展依然会自己发生。用 Go 你可以做到这一点。我不认为用自然语言数学你能做到。Dwarkesh Patel:这非常有意思。你看到 Karpathy 的自动研究想法了吗?他写了一个 Python 文件来做基础的 LLM 训练,然后建了一个 repo,让 LLM 智能体尝试对这个文件做修改,如果修改加快了 speed run,修改就保留下来。Eric Jang,就是来讲解 AlphaGo 工作原理的那位,在他试图构建一个非常强的 Go bot 时也做了类似的事情。他有一些有趣的观察。它非常擅长跑实验并沿着那条路走下去,但它不擅长在死胡同上停下来,也不擅长做极度并行的事情。总之,这未来可能会改变。思考它在极限情况下是什么样子非常有意思。这从根本上就是人类数学研究这一制度的样子。它是一个以有趣且有用的方式不断扩展的库。这样一来你没有任何基于结果的监督。没有你想要激励的结果,但你有一个过程。你知道步骤是正确的,你只是不知道它是否在朝一个有趣的方向前进。Grant Sanderson:如果你在做这件事,你不会想完全脱轨,在逻辑空间里做随机游走。你大概会想要某种监督模型,试图提供关于它是否有用的启发式判断。你知道人们正在研究这个。这是那种“五年之后”的事情,我会很好奇让未来的我们来聊聊它。也许那条路走不通,但 Terry Tao 谈过一个研究项目,试图穷举搜索可能的代数空间。你可以想象对代数系统施加不同的公理。当我们提出群论时,有一套公理系统,除非你知道动机,否则它看起来就像随意的规则。如果你把它们全都试一遍呢?它们中有任何能产生有用的东西吗?其中绝大多数在某种意义上就是垃圾。这一切都会坍缩成没有有趣结果的状态。但偶尔会出现一座小岛,属于一种完全不同的公理系统,至少从它能推导出的定理数量来看,似乎内容很丰富。这正是你想象中自动证明器所擅长的事情——探索那个空间,看看其中哪一个最终能成为有价值的东西。也许其中一座小岛最终会被证明是你可以事后赋予动机的东西,说这就是它试图达到的那种结构。就像你可以想象看着群论的公理,不知道它关乎对称性,但你事后意识到这与研究对称性非常相关。你可以想象那种风格的结果,但它不只是探索可能的代数系统,而是在探索任何种类公理的所有可能逻辑推论。Dwarkesh Patel 关于是否可以在没有 Lean 的情况下提供基于过程的监督这一点,DeepSeek 有他们的 DeepSeek Math 模型。他们发表了一篇关于如何训练它的论文,非常有意思。自然语言证明的问题在于你不知道它是否正确。他们有一个验证器,而这个验证器是由一个元验证器训练出来的,元验证器确保对于他们训练这个模型去解决的所有问题——在解题艺术方面——验证器给出的反馈是好的。它有效。有趣的是,在已发表的文献中,带有某种元验证的自然语言验证到目前为止似乎是有效的。在我们正在使用的已发布产品中,它似乎也有效。如果你看编程智能体,它们在编写整洁代码和重构代码方面越来越好。我确信存在基于过程的“LLM-as-a-judge”系统在提供品味判断,说“这是写这个函数的整洁方式吗?有没有同类模块化形式的重复?”这在数学上也应该有效,对吧?Grant Sanderson:数学似乎比其他任何领域都更有可能做到这一点——即便你只用自然语言工作,你也有可能信任一个验证器。你和我之前聊过为什么它们不擅长写作。它们似乎是很好的评判者。如果我给它们两篇学生写的文章,它们能说出哪一篇更准确、更有洞见。那为什么不能直接让一个验证器来判断“这是一篇好文章还是不是?”也许最终的失败在于:即便它们擅长区分一篇 B 级文章和一篇 A 级文章,它们实际上并不擅长区分一篇 A 级文章和一篇你真正想读的东西——那种在 Substack 上让人读得下去、且有洞见的东西。它们最终实际上会偏好那些没有洞见的文章。在数学方面,仅仅判断一个证明是否正确,这一步就适合交给自动化验证器,即便是在自然语言中也是如此。你很可能仍然能取得大量进展。我仍然喜欢 Lean 中那棵逻辑树,就在于你真的可以完全脱离常规。对之前表述方式的既有约束并不存在。所有人都在谈论 AlphaGo 的第 37 手。是什么东西让它适合跳出先前的启发式规则?在这种探索中,与世界其余部分断开连接似乎是富有成效的,可以作为自然语言数学方向的一种互补性研究追求。Lean 的另一个相关性在于,假设你有纯自然语言的 RL 环境和一套纯自然语言的证明。人们说:“上吧,AI 数学家们”,然后它们每天生成十篇论文。如果这其中存在任何错误率……Alex Kontorovich 谈过这一点。作为一名数学家,这会变得令人难以忍受。每一次你看到其中一篇,你都不知道它是否值得你花时间。即便 100 篇里有 99 篇是对的,我也不知道它是否值得我花时间,因为找出那个错误到底是什么非常费工夫。把全部时间花在一篇垃圾论文上,真的让人非常沮丧。拥有一个能给你打上绿色对勾、告诉你“即便这东西理解起来很复杂,即便它会很麻烦,你至少知道它是正确的”的东西,其他任何领域都会不惜一切代价想要得到。数学就拥有这个。如果模型也能把它们的自然语言证明形式化,那似乎意义重大。每个领域都会渴望拥有这样的东西。所以我认为你说得对,就 Lean 作为推动数学整体进步的 VR 环境而言,它的重要性也许被高估了。但我绝对不会把它从叙事中抹去。Dwarkesh Patel 我也很喜欢把 Mathlib 的这种扩展当作一个隐喻,用来预示我们的文明不久将会发生什么。几千年来,人类构建了这一知识理解的语料库,而我们所拥有的一切如今都被蒸馏进了这些模型之中。到了某个时候,模型就会任意地扩展它。01:07:07 – 好的写作需要 AI 仍然缺乏的心智理论
Dwarkesh Patel:顺便说一句,在写作方面,我有一个理论来解释为什么写作的进展比其他这些领域更差。一个原因就是你所说的,它们不仅不擅长判断 A 与 B 的优劣,还会被 B* 完全带偏——B* 就是那种烂文章,却命中了 A 本应命中的各种花哨指标。奖励黑客的问题直接就失控了。但另一个重要原因是,写作不像代码和数学那样模块化。你可以用很多种方式写一个函数,它们做的事情是一样的。当然你希望它整洁,但归根结底,能跑就行。数学里的引理也是一样。你可以得到一个与产生它的方式不同的最终产物。代码是产生某个最终产物的东西,你要的是一个能用的最终产物。而在写作中,最终产物直接就是 AI 所产生的东西。每一个段落、句子和词都重要,因为那就是实质本身。它不是由写作产生出来的某个分离的东西。它不能像代码那样是垃圾,却仍然产生你想要的结果。Grant Sanderson:但你刚才指出,我们实际上在智能体写代码方面已经进步了很多,不只是写出能用的代码,还能写出整洁的代码。为什么同样的进步——让你从仅仅能用跨越到干净且可合并的 PR——不能也带来更清晰的写作呢?Dwarkesh Patel:这是个好观点。而且,难道它没有吗?我同意在很多方面它们都是糟糕的写作者。但对于我消费的很多写作内容,我发现直接把它复制粘贴到 LLM 里然后说“给我解释一下”会更好。解释会比人类产生的那东西更好。有意思的是,我们说这些是糟糕的写作者,但我的显示性偏好却是让 LLM 来解释它。即使我是在电话上实时与一位人类专家交谈,如果那是只有他们才拥有、并未编码在分布中的知识,我也希望他们给我解释。但如果为了理解那一点,我需要先理解一个更基础的概念,那我更希望社会能接受我直接说:“咱们先停一下。我就去问一下大语言模型这是怎么回事,然后再回到你那个专门的知识点上来。”Grant Sanderson 那就是蒸馏,一种解释。如果我评判你作为文章作者的水平——如果我给你一本书让你读,然后我想要一份读书报告——我可能会觉得大语言模型给我的读书报告更好。但人们说它不行的时候,真正想说的是:写作到底是什么?它不只是对已有想法的蒸馏。它不只是你如何清晰地解释,因为大语言模型确实很擅长解释。关键在于洞察是什么。这正是自回归作为一种生成方式非常古怪的地方。你在写作时,多少知道要想写得好,就必须有不可预测的元素。这不只是把你脑子里的温度调高。而是要精确地知道在哪个正确的点上你想做出一个不可预测的举动,而且那恰恰会是更有洞察力的地方。即便它更擅长解释一个已有的东西,最初生成你想蒸馏的那本书的,又是什么?那本书不是大语言模型生成的、而你恰好需要它。那是某位作者,通过对世界上各种想法的大量探索,决定了哪些方面有趣、以哪些呈现方式能形成一个连贯且有充分动机的叙事。他们以某种方式把这一切整合在一起。如果他们是好作者,你大概会倾向于读他们的书,而不是那份蒸馏。尽管如此,最初到底是什么让探索这件事值得去做、让人想要把它上传?人们说大语言模型不擅长写作时所援引的,正是它的那一面。正是那种不可预测的元素,那种刻意选择某种新颖之物的做法,与事物通常被生产出来的方式直接相矛盾。Dwarkesh Patel 这是个好观点。我认为它们同样非常不擅长构建关于人的、真正出色的心智模型,而这是写作中一项非常重要的技能。Andy Matuschak 和另一位合作者——我一时想不起名字了——做过一份很有意思的报告,他们试图教 LLM 写出好的间隔重复提示。我非常喜欢这个研究,因为尽管这看起来像是一项完全随机的技能……就像人们都在谈论一年内实现递归自我改进,而我们却没法让这些东西写出好的抽认卡。这到底是怎么回事?他们尝试了许多不同种类的技术,而且他们都是很老练的人。他们尝试对开源模型做 RL。他们尝试了各种方法,包括思维链,以及给最好的闭源模型发送一大段提示词。在我看来,关键的约束在于,写一张好的卡片关乎的是投射某个人三个月后的心智。他们会以什么方式联想到这个问题?他们在那一刻会想到什么样的答案?这种引出是否激发了你真正想从那段文字中带走的细节——而你正是想围绕那段文字做卡片?我认为写作与此类似。如果你在写东西,它之所以是一个如此令人心力交瘁、耗时如此之长的过程,是因为每写一个词或每一句话,你都必须思考:我的读者此刻脑海中正在发生什么?即使我把措辞调换一下,让结尾的短语挪到开头,让它在读者读到句子其余部分之前成为他们脑海中浮现的第一个意象……也许自回归在这方面表现不佳。这或许更像是一种扩散模型式的特性——考虑整体,而不是逐句推进。但我也认为这需要大量的心智化,而这些模型奇怪地在这方面很吃力。Grant Sanderson 这是个有趣的问题。它们在这方面吃力,这很奇怪吗?我可能会把这个讲砸。你知道那种情况吧,你引用一篇自己曾经读过的研究,也许那项研究根本不是真的?有一项非常令人难忘的研究。假设你想测试人们的情商。你展示一张某人面部表情的闪卡,然后让人试着描述那种情绪。网上有一些非常好的测试,给出一张脸,然后给出四种可能的情绪。要准确描述出正确的那种情绪,难得出奇,但你同时也会觉得,确实存在一个正确答案。如果你拿这个去测试你生活中的人,你会注意到,那些社交上很敏锐的人做得非常好,而那些偏左脑思维的人则不行。这是你可以做的一类测试。我隐约记得有一个类似效果的实验,他们找来刚打完肉毒杆菌的人,做了一次前测和一次后测。后测时,他们解读他人表情的能力差了很多。这感觉很奇怪。Dwarkesh Patel:等等,他们打了肉毒杆菌?Grant Sanderson:是接受测试的人。你做完测试,然后去打肉毒杆菌,你的脸全僵住了,现在你对所看到的表情的理解就变差了。背后的想法是,理解你所看到的表情,有一部分靠的是你自己去做那个表情。在面部层面,你在动你的面部肌肉。你看到那个表情,你模仿它,然后你在某种非常潜意识的层面上就想,“哦对,这是焦虑。”所以从这个意义上说,如果模型的心智理论确实很差,那当然,它们知道一切,因为它们读过所有人写的东西。但到了真正能设身处地理解你的层面——就像我的面部肌肉在模仿你的面部肌肉那样,正是这一点帮助我理解你的感受——那就一点也不奇怪了。它们没有面部肌肉。它们的大脑运作方式完全不同。这就像一个外星人试图共情。它怎么可能拥有心智理论?那会是一种非常涌现性的东西。而我们则可以直接把它接入我们自己的心智。我们有现成的硬件可以直接把它放进去。从这个视角看,这并不那么令人意外。01:16:02 – 为什么学习仍将依赖人类策展
Dwarkesh Patel:关于用 LLM 来学习,你有什么建议?正如我刚才描述的,对于很多众所周知的概念,我觉得它们非常有帮助。但往往再往下聊几条消息,我想弄懂某个东西时,它们自己就糊涂得把我给绕晕了。它们没有用正确的方式去解释。我知道跟对的人聊,三分钟就能解开我的困惑。我们越来越会想用这些东西来学习。人们经常谈论教育和表征之类的话题。你有没有注意到一些能更高效地用它们来理解概念的方法?Grant Sanderson:我很好奇你怎么看这个问题。我先说说我的看法。甚至在 LLM 出现之前,我就觉得学习方面一个相关的洞见是:认清“是谁”比“是什么”更重要。我给任何大学生选课的建议是:少在意一点你已有的兴趣,因为它们现在其实挺随意的;多在意一点讲课的人是不是一位好老师、是不是你能产生共鸣的人。在选书读的时候,作者是谁也许比它是不是你之前的兴趣更重要。如果有一本书你以前喜欢过,那就去读那位作者写的其他东西,而不是去读同一主题的另一本书。我这就说到 LLM 上了。从维基百科页面去学某个东西,和——如果是哲学话题——去读《斯坦福哲学百科全书》,或者如果是数学话题,去读《普林斯顿数学指南》,感觉是不一样的。区别在于,那些文章是刻意由某一个人写的,他会真正围绕它构建一套动机脉络。而在维基百科上,它达到的是某种局部最优,每一句话都必须正确。在一篇好的阐述里,你在过程中可以稍微不那么在意正确性。你可以刻意构建一些稍微有点错的东西,然后在过程中再纠正过来,而这些在众包环境里会被编辑掉。在我看来,目前 LLM 给出的解释很像维基百科,也就是说,非常棒。想象一下维基百科出现之前的世界,要找到并弄清所有事情得花多长时间。但尽管如此,维基百科页面最有用的部分是什么?往往只是底部的参考文献。你看那些关键参考文献,然后去找它们,去读它们。有时这样能带来好得多的概览。所以我经常喜欢直接问 LLM:“我应该读谁?”也许我甚至可以具体说明我想学习的方式。实际上,有一次我在试图学习半导体之类的东西时,被它忽悠了。我觉得这是一个非常视觉化的主题,但所有资源都是文本。我问:“有没有一个可视化做得很好的视频,能解释你提到的这些概念?”Claude 说:“有,这里有几个,”排在第一位的大概是:“这是 3Blue1Brown 的一个视频”。我心想:“我敢保证根本没有。”那确实是一个真实存在的视频、一个真实的链接,但它只是把别人的东西错误归因了。那个视频很好。我点过去观看并学习,比继续在那里追问问题获得了更好的体验。从这个意义上说,我基本上是在把它当作一个超级增强版的 Google 来用,以锁定正确的人类撰写的资源。你呢?你经常使用这些东西。使用它们的最佳方式是什么?Dwarkesh Patel,我觉得你说到点子上了。我最有成效的学习过程,是当有一个由人类制作的某种成果——无论是文章、书还是视频——以正确的方式组织了相关概念。它逐步建立起动机,说明为什么下一个想法会与解决你接下来遇到的问题相关,然后是再下一个想法,再下一个想法。然后你用 LLM 来围绕这本书已经识别出的这个分支做一点修剪。我实际上正在读——我想可能是你推荐的——Steven Strogatz 的那本教科书……Grant Sanderson,是讲混沌的那本吗?《Nonlinear Dynamics and Chaos》?我很喜欢那本书。Dwarkesh Patel:是的,我当时在读它,感觉非常享受。就像你的视频变成了书的形式,特别有意思。我学习的方式是,把他在大学的讲座放在屏幕三分之一处,教科书的那一部分放在另外三分之一,最后三分之一放一个 LLM。我当时真的在想,如果我回到大学时代,现场听这堂课,肯定会完全听不懂。这些孩子一定非常聪明,因为我是暂停、读教科书、跟 LLM 对话,然后再继续播放。但有了他来精心编排理解概念的正确顺序,以及激发理解这些概念的正确问题……这又是 LLM 非常不擅长的一件事。一个非常优秀的人类能做到的是,当你问一个问题时,人类可以说:“其实,你思考这个话题的方式不太对。你真正该问的问题,组织这些概念的正确方式,是 X。”而 LLM 就是做不到这一点。Grant Sanderson:它太过于安抚了。这归根结底就是那种谄媚行为,总是“哦,多么有洞察力的问题。”你想把这一层剥掉。这是个好观点,我觉得这稍微触及了心智理论,就是认识到提出某类问题揭示了学生的心理结构与讲解者的并不相同。有时候人们做这件事会做过头。一个真正好的老师,比如说你有一个初中数学课堂。如果一个学生问了一个问题,暗示他们用不同的方式在思考,实际上在当时很难认真对待这个问题,很难在说“别那样想,我们这样做”之前先问一句:“等一下,你能用那种方式得到正确答案吗?”真正优秀的老师能够借力打力,把学生思考问题的创造性方式融入进来。LLM 做不到这一点。它们不会重新框定你的问题。相反,它们有点跑偏了。至少,感觉这里有三个层次。大语言模型处于一个层次,优秀的讲解者处于另一个层次,但 A+ 级讲解者是那种能扭转你的思维方式并说“这正是它有用之处”的人。也许存在一个完整的循环,五年之后,大语言模型会做到这一点,而且做得更好。Dwarkesh Patel:对于那些肯定经常给你发邮件问这个问题的学生,你有什么建议:“我对数学很感兴趣,我真的很热爱这门学科,但看到 AI 取得的种种进展,我不知道把它作为职业是否还说得通。”这不仅与数学领域的人相关,也与任何注意到自己所在领域正从 AI 中获得生产力提升的人相关。编程与这一点非常接近。你对这些人有什么建议?Grant Sanderson:我不会信任我给出的任何建议。我会这样来限定它。但即便在 AI 出现之前,对于你要从事的任何工作来说,真正理解……如果我们谈的是一份工作——而不是做一位绅士科学家、与数学界打交道之类的——你就应该理解钱从哪里来、你实际在增加什么价值,以及这两者之间的联系。人们在这上面投入的思考少得惊人,尤其是学生。他们身处这样一种环境:他们想学数学,很可能是因为他们一直擅长数学。他们在人生中因为正确地穿过下一个圈而得到奖励。当他们觉得自己想成为数学家时,那是因为他们认为这是继续投入这件事的一种方式。他们想的是“人们在哪里能做这件事?”,而不是想“我在为他人增加什么价值,以及这在多大程度上是薪水流向我的原因?”实际上,不同情况下这一点相当不同。在某些情况下,是一位非常有声望的数学家,他们在大学里的存在赋予了某种品牌价值,这就是大学想要他们的原因。在某些情况下,NSF 拨款是因为我们对基础科学所抱有的公共利益信念。你周围有一套机构体系,还有一整套官僚机制,作为我们所认为的那种公共利益的代理,围绕如何让他们正确预测你的进展会符合那笔资助的精神,有一整套繁文缛节。有时候它就是纯粹的教学。人们喜欢把孩子送到有专家授课的研究机构。你作为专家提供品牌价值,作为教师提供直接价值。无论 AI 是否在证明定理,无论我们谈的是 2016 年还是 2026 年,这都是那些想着“我想成为数学家”的学生考虑得不够多的事情。我认为这值得思考。对我而言,我当初并没有 necessarily 在想这件事,我误打误撞走上了一条可以把数学探索作为娱乐来变现的职业道路。我误打误撞走进了这条路,我非常感激自己做到了,但那是个意外。它不是刻意为之的。如果我当时批判性地思考过这件事,我本可以避免依赖机缘巧合,更多地靠设计来做到这一点。回到你的问题——如果我们有了近乎自动化的定理证明,而且假设它们同时也是非常出色的讲解者,以至于你甚至能获得人类的理解——我认为数学家所承担的大量社会角色实际上并不会改变太多。作为公众,我们仍然觉得基础科学有价值,我们信任数学家的判断来决定他们的时间最好花在哪里。声望来自那个社群内部。是其他成员说一个结果真的很棒,而不是资助申请书的撰写者真正理解代数数论从而明白那是个好结果。关于什么构成有价值的贡献,会存在一种内部文化。也许它会从定理证明转向好的定义撰写。也许就是那个博物馆策展人的想法。但只要整个社会仍然看重基础科学这一前提,你就会拥有同样的社群。而如果我们处在 AI 带来的富足世界里,从某种意义上说,朝那个方向的资助大概会更多。在声望偏向于以讲师是谁来评判的机构这一边,我其实认为教学是后 AGI 时代最稳定的工作之一,因为它太依赖人与人的关系了。如果家长拥有充裕的财富,他们愿意把钱花在这里:花在好的教学和好的教育上。这远远超出了讲解本身。即便大语言模型很擅长讲解,教师所做的事情本质上是一种社交性、教练式、导师式的工作,所以这很可能是未来五十年里最稳定的职业之一。就许多数学家的角色与这一点有所重叠而言,作为即将入行的准学生,你可以往这个方向靠拢。我其实认为,更多的学生应该认真考虑并重视成为一名数学教育者这一想法,以及这能为下一代带来的价值。我还是要再次说明,我不认为我是那个该说“来,年轻的准数学家,你应该这样思考未来”的人,因为我只是个 YouTuber。我并不在他们考虑进入的那个机构里,所以我是以一个局外人的视角在观察。但总体而言,这似乎是放之四海而皆准的好建议:搞清楚钱从哪里来,搞清楚你在哪里接入其中。而如果你已经在问这些问题,你其实已经比所有其他刚起步的准数学家领先了好几步。Dwarkesh Patel 事实上,想想那个疯狂的世界:在五年或十年内,AI 不仅会给出千禧年大奖难题的解答,还会从一开始就提出全新的待解问题、全新的数学领域和对象等等。正是在那个世界里,首先,会有大量的富足。其次,AI 心智走得最远、超越我们视野最远的地方,将是数学。届时会有巨大的需求:“AI 看到了什么?你能给我们解释一下吗?”在那个世界里,如果还有什么工作存在的话,把 AI 所学到的东西提炼出来, surely 必然是其中之一。Grant Sanderson:而且这很有意思,因为这一切都预设了它是无用的。我们并没有在谈论所进行的数学研究实际有什么应用。只要它有任何经济效用,你就能想象,那些理解它、并且能够判断它应该指向何方的人,作为策展人做出这种判断、把这头新数学的巨兽引向有用的方向,实际上会拥有大得多的经济价值。突然间,这相比以前就成了一步杠杆效应大得多的棋。Dwarkesh Patel:我能就这一点问问你吗?显然,对于 AI 做数学来说,一个问题不仅是它能不能做,还有它做得好不好?或者说它有什么用?你刚才描述了在群论方面,我们试图弄清楚关于不同种类函数根的种种随机事实,而现在有这么多跨越许多不同领域的实际应用。你有没有某种感觉,如果我们真的完全到达了人类数学领域被加速 10 倍或 100 倍、发生一些疯狂事情的地步,还是说我们只会被其他领域卡住脖子?Grant Sanderson:我觉得有些领域很可能会。它是非常参差不齐的。随着代数数论的进展,感觉它不太可能就此解锁什么东西。但我记得和一位做更多动力学和偏微分方程求解之类研究的数学家聊过。他提到他的团队有一些想法。让我看看我有没有总结对。就像波音制造飞机的方式是,他们会造出来,做一堆测试,然后不得不根据这些测试把它拆开再重新组装。他的团队本质上对如何在仿真中做更多事情有一些洞见,这样你就不必拆解再重建。这为波音省了数十亿美元还是什么的,然后他们就开始资助那个团队了。那明显更贴近应用,因为偏微分方程本来就是这样。你会想象,那个领域的进展确实能解锁一些东西。我不知道是否就是这些阶跃式的变化,但也许更多是在发动机设计这一侧,变得更灵活一些,或者想出正确的机翼形状,而不是跑一大堆复杂的 CFD。也许你能够加速你的 CFD 模拟,因为某些纯数学的洞见让这些模拟更高效。我敢打赌,你会在那里看到大量很棒的渐进式改进。数学上的重大突破立刻转化为这种巨大的经济突破,比如你解决了 Navier-Stokes 问题,然后这就解锁了模拟更多东西的能力——这似乎不太可能。但你很可能会在那些边缘地带看到,一些有意义的溢出,从纯数学的洞见流向其他东西。有大量的人在从事 AI 工程、物理工程和材料科学之类的工作。你必须想象,他们会处于一个有利的位置,能够审视 AI 的数学洞见,并判断它们是否在某种方式上相关。这又是那种我不会坐在这里插旗立誓、预测一定会有的事情之一。但如果未来五年内,没有出现可以直接归因于 AI 在数学上进展的、具有经济价值的改进,那会有点令人失望,也有点令人意外。如果只是解决一大堆 Erdős 问题,而其中没有一个在做真正直接触及物理世界的数学,那就会令人失望。Dwarkesh Patel 关于你提到的,数学史上有很多都是在积累这些概念和联系的堆栈。有时这些堆栈会彼此连接,或者你在别处发现了某个应用。至少,你只是积累起了这个巨大的堆栈。然后,随着奇点期间社会更广泛的进步发生,当我们到达奇点的工业化部分时,你就拥有了所有这些不同的想法,希望它们在世界其他地方也有用。Grant Sanderson:正如我所说,当前正在发生的事情有一个有趣之处,就是它促使人们退后一步去问:“数学到底是什么?”也许其中一个令人尴尬的结论会是揭示出它已经完全变得毫无用处。人们所提出的那类问题已经变得与任何具有实际应用性的东西如此脱节,以至于这是数学家们不得不接受的事情之一。所有人都会看着说:“等一下,你们这些人不是本该……如果那边有 10 倍的进展,为什么我们在这边看不到?”然后数学家们就会想:“唉。”每一次我们写那些经费申请,说“相信我们,椭圆曲线方面的进展会帮助密码学”,这都揭示出一个事实:也许它并不会。所以这是一种可能性。 Dwarkesh Patel:Grant,这真是太有趣了。非常感谢你来做这期节目。 Grant Sanderson:当然。是我的荣幸。
来源:Dwarkesh Patel:Podcast & Blog(RSS) · dwarkesh.com