跳到正文
北京时间
原文
Dwarkesh Patel:Podcast & Blog(RSS)· Dwarkesh Patel·· 2025-12-31精选

Adam Marblestone — AI 缺失了关于大脑的根本认知

Adam Marblestone — AI is missing something fundamental about the brain

AI 导读

Adam Marblestone 指出,当前人工智能研究忽略了大脑运作的核心机制。与业界普遍关注神经网络架构不同,大脑的真正优势在于其奖励函数而非结构本身。这一观点挑战了主流 AI 研究范式,暗示未来突破可能来自对大脑激励系统的深入理解,而非单纯的架构模仿。该论断为人工智能发展提供了新的思考维度。

推荐理由

AI研发或应转向奖励函数设计,而非一味堆叠架构复杂度

正文 · AI 翻译

亚当·马布尔斯通是Convergent Research的首席执行官。他有着非常有趣的过往经历:他曾是谷歌DeepMind神经科学团队的研究科学家,研究领域涵盖从脑机接口到量子计算、纳米技术,甚至形式化数学等方方面面。

在本期节目中,我们讨论了大脑如何从极少的信息中学习如此之多,人工智能领域可以从神经科学中学到什么,以及伊利亚问题的答案:基因组是如何编码抽象奖励函数的?事实证明,这些其实都是同一个问题。

在YouTube上观看;在Apple Podcasts或Spotify上收听。

赞助商

延伸阅读

  • 类脑AGI安全导论 - 史蒂文·伯恩斯关于学习与操控子系统的理论;本期节目中多次提及。

  • 《智能简史》 - 马克斯·贝内特关于神经科学与人工智能之间联系的佳作。

  • 亚当的博客,以及Convergent Research关于关键技术的博客。

  • 杨立昆的《基于能量的学习教程》

  • 《理解神经网络意味着什么?》 - 科丁与利利克拉普

  • E11 Bio及其大脑连接组学方法

  • 萨姆·格什曼关于多巴胺在大脑中作用的研究

  • 格温关于利用大脑隐藏状态训练模型的提议

相关节目:伊利亚·苏茨克弗、理查德·萨顿、安德烈·卡帕西

时间戳

(00:00:00) – 大脑的秘密武器是奖励函数,而非架构

(00:22:20) – 摊销推理与基因组实际存储的内容

(00:42:42) – 大脑中基于模型与无模型的强化学习

(00:50:31) – 生物硬件是限制还是优势?

(01:03:59) – 为什么人脑图谱很重要

(01:23:28) – 数学自动化将带来什么价值?

(01:38:18) – 大脑的架构

00:00:00 – 大脑的秘密武器是奖励函数,而非架构

德瓦克什·帕特尔

我有一个价值百万美元的大问题,我一直在试图通过所有这些对AI研究人员的采访来找到答案:大脑是如何做到的?我们向这些大语言模型投入了多得多的数据,但它们的能力总和仍然只占人类的一小部分。那么,这到底是怎么回事?

亚当·马布尔斯通

这或许是个价值千万亿的问题,甚至更甚。你可以论证这是科学界最重要的问题。我不敢说自己知道答案。我也不认为答案必然来自众多聪明人殚精竭虑的思考。我总体的元层面看法是,我们必须赋能神经科学领域,让神经科学在技术及其他方面成为一个更强大的领域,从而真正有能力破解这样的问题。

或许我们现在借助现代 AI、神经网络、深度学习来思考这个问题的方式是,其中存在某些关键组成部分。有架构。有关于层数或架构属性的超参数。还有学习算法本身。你是如何训练它的?反向传播、梯度下降,还是其他方法?它是如何初始化的?如果我们考虑系统的学习部分,它可能仍然需要对权重进行某种初始化。此外还有代价函数。它被训练去做什么?奖励信号是什么?损失函数、监督信号是什么?

在这个框架内,我个人的直觉是,该领域忽视了这些非常具体的损失函数、非常具体的代价函数的作用。机器学习倾向于喜欢数学上简单的损失函数。预测下一个 token、交叉熵,这些简单的计算机科学家式的损失函数。我认为进化实际上可能在损失函数中构建了大量复杂性,针对不同区域、在发育的不同阶段开启许多不同的损失函数。基本上就是大量的 Python 代码,为大脑不同部分需要学习的内容生成特定的课程。

因为进化已经无数次见证了什么是成功、什么是不成功,进化可以将学习课程的知识编码进去。在机器学习的框架下,我们或许可以回过头来讨论:大脑的损失函数从何而来?不同的损失函数能否导致不同的学习效率?

Dwarkesh Patel

人们常说大脑皮层拥有人类通用的学习算法,那是人类独有的秘诀。这到底是怎么回事?

亚当·马布尔斯通

这是一个巨大的问题,我们目前还不知道答案。我见过一些模型,其中大脑皮层……大脑皮层通常具有这种六层结构,这里的“层”与神经网络中的“层”含义略有不同。皮层上的任何一个位置,当你沿着这片组织逐层深入时,都有六层物理组织。而这些区域之间相互连接,这更像网络中的层。

我见过一些版本的解释,试图说明的是:“它如何近似反向传播?”以及“其代价函数是什么?”如果你试图说它类似于反向传播,那么这个网络被要求做什么?它是在做下一个 token 预测的反向传播,还是在做图像分类的反向传播,或者是在做别的什么?没有人知道。但关于这一点,有一种想法,一种可能性是,它只是一个极其通用的预测引擎。因此,皮层的任何一个区域都只是在试图预测……基本上,它能否学会用它所看到的所有变量中的任意子集来预测任意其他子集?这是一种全向推理,或者说全向预测。

而大语言模型只是看到上下文窗口中的所有内容,然后计算一个非常特定的条件概率,即:“给定过去数千个 token,下一个 token 的概率是多少。”但如果一个大语言模型只是进行前向预测,让它说“敏捷的棕色狐狸空白空白懒惰的狗”并填充中间部分,而不是预测下一个 token,那会显得很奇怪。它可以在上下文窗口等层面,通过涌现能力学会如何做这类事情,但其原生能力只是预测下一个 token。

如果大脑皮层天生就被设计成,它的任何区域都能在给定任意缺失子集的情况下,预测其任何输入中的任意模式,那会怎样?这听起来更像“概率性 AI”。顺便说一句,我讲的很多内容与 Yann LeCun 的观点极为相似。他对基于能量的模型这类东西非常感兴趣,这就像是所有变量的联合分布。任意变量组合出现的可能性或不可能性究竟是多少?

如果我固定住其中一些变量,明确设定这些变量处于这些状态,那么我就可以通过概率采样等方式——在设定这些变量处于此状态的条件下,而它们可以是模型中任意变量子集——来预测任何其他子集将会如何表现,并在固定此子集的情况下从任何其他子集中进行采样。而且我可以选择一个完全不同的子集,并从中采样。这就是全向推理。

因此,大脑皮层中可能存在某些部分,比如皮层的联合区,能够从听觉预测视觉。也可能存在一些区域,负责预测大脑中更本能的部分将要做什么。因为请记住,这一切都建立在所谓的蜥蜴脑和蜥蜴身体之上。而那个部分本身也是值得预测的。你预测的不仅仅是“我是否看到了这个”或“我是否看到了那个”。还包括:这块肌肉是否即将紧张?我是否即将产生大笑的反射?我的心率是否即将加快?我是否即将激活这种本能行为?

Dwarkesh Patel

基于我更高层次的理解……比如,我可以将别人告诉我的“你背上有一只蜘蛛”这句话,与如果我确实看到面前有一只蜘蛛时会激活的那个蜥蜴脑部分联系起来。你学会了将这两者关联起来,以至于仅仅从别人那里听到“你背上有一只蜘蛛”这句话时……

Adam Marblestone

好,我们回到这个话题。这在一定程度上与史蒂夫·伯恩斯的理论有关,我最近对此非常着迷。但在你和伊利亚的播客中,他说:“你看,我不知道有什么好的理论能解释进化如何编码高层次欲望或意图。”我认为这与大脑会使用的损失函数和成本函数这些问题密切相关。而这确实是一个极其深刻的问题,对吧?

假设我在你的播客上说错了话而感到尴尬,因为我正想象着扬·勒昆在听,然后他说:“那不是我的理论。你把基于能量的模型描述得非常糟糕。”这就会激发我天生的尴尬和羞耻感,我会想躲起来之类的。这会激活这些先天反射。这很重要,因为否则我可能会被扬·勒昆率领的掠夺大军干掉……

德瓦克什·帕特尔

法国的AI研究人员要来抓你了,亚当。

亚当·马布尔斯通

所以,拥有这种本能反应很重要。但当然,进化从未见过扬·勒昆,也不知道基于能量的模型,更不知道什么是重要的科学家或播客。大脑必须以某种非常稳健的方式编码这种“不想惹恼部落里非常重要的人”之类的欲望,而无需事先知道大脑的学习子系统——也就是学习皮层和其他部分——将要学习的所有东西。皮层会学习这个世界模型,其中会包括像扬·勒昆和播客这样的概念。进化必须确保那些神经元——无论是什么“扬·勒昆对我不满”的神经元——能够正确地连接到羞耻反应或奖励函数的这一部分。而这很重要,对吧?

因为如果我们想要在部落中寻求地位,或者向有知识的人学习,正如你所说,或者进行类似的活动,与朋友而非敌人交流知识和技能……我们必须学习所有这些内容。它必须能够将这些习得的世界特征、习得的世界模型部分,稳健地连接到这些先天奖励函数上,然后实际利用这些来进一步学习。因为下次如果 Yann LeCun 发邮件说我搞错了,我可不会再去惹恼他。我们会基于此进行进一步的学习。

在构建奖励函数时,它必须利用习得的信息。但进化过程,它当时并不知道 Yann LeCun,又如何能做到这一点呢?Steve Byrnes 提出的基本想法是,大脑皮层的一部分,或者像杏仁核这样具有学习能力的其他区域,它们所做的是对“导向子系统”进行建模。导向子系统是拥有更多先天程序化反应以及一系列先天编程的奖励函数、成本函数、自举函数的部分。

例如,杏仁核的某些部分能够监控这些部分的行为,并预测它们会做什么。如何找到对社会地位至关重要的神经元呢?嗯,你有一些关于社会地位的先天启发式规则,或者关于友善的先天启发式规则,导向子系统可以利用这些规则。而且导向子系统实际上有自己的感觉系统,这很不可思议。我们认为视觉是大脑皮层负责的功能。但导向子系统也有一个皮层下的视觉系统,叫做上丘,它天生就能检测人脸或威胁等。

因此,存在一个具有先天启发式机制的视觉系统,而引导子系统也有其自身的反应。杏仁核或大脑皮层的某些部分会学习预测这些反应。在大脑皮层中,对于社会地位或友谊而言,哪些神经元是重要的?正是那些能够预测关于友谊的先天启发式机制的神经元。你在皮层中训练一个预测器,然后问:“哪些神经元属于这个预测器?”这些就是你成功将其连接起来的神经元。

德瓦克什·帕特尔

这太迷人了。我觉得我还是没完全理解……我理解大脑皮层如何学习大脑中这个原始部分会对什么做出反应……显然它带有这些标签,“这里确实是一张蜘蛛的图片,这是不好的,要害怕它。”大脑皮层通过先天部分告诉它这是不好的,从而学会了这一点。但它还必须泛化到,“好吧,蜘蛛在我背上。有人告诉我蜘蛛在你背上。那也是不好的。”

亚当·马布尔史东

是的。

德瓦克什·帕特尔

但它从未得到过这方面的监督信号。那么它是如何做到的呢……?

亚当·马布尔史东

嗯,这是因为学习子系统是一个强大的学习算法,它具备泛化能力,能够进行泛化。而引导子系统,这些是先天反应。你的引导子系统中会内置一些反应,这些来自较低级的大脑区域:下丘脑、脑干等。同样,它们也有自己原始的感官系统。

所以可能存在一种先天反应。如果我看到某个东西快速朝我的身体移动,而我之前没注意到它在那里,并且它又小又黑、对比度高,那可能是一只昆虫窜到我身上。我会猛地一缩。这些就是先天反应。比如说,在下丘脑中会有一组神经元,它们就是“我正在畏缩”或“我刚畏缩了”的神经元。

当你退缩时,首先,这对奖励函数是一个负面贡献。你或许不希望这种情况发生。但这是一个没有任何泛化能力的奖励函数。我会避开那个东西朝我疾冲过来的确切情境。也许我会避开一些导致那个东西疾冲的行为。这是一种你可以获得的泛化,也就是 Steve 所说的奖励函数的下游。我会避开蜘蛛朝我疾冲过来的情境,但你也会做其他事情。

比如说,你杏仁核的某个部分会说:“好吧,在几毫秒、几百毫秒或几秒之前,我能否预测到那个退缩反应?”这将是一组神经元,本质上是一个分类器,判断“我是否即将退缩?”对于进化需要处理的每一个重要的导向子系统变量,我都会拥有针对它的分类器。我是否即将退缩?我是否在和朋友说话?我现在应该笑吗?这个朋友地位高吗?无论下丘脑、脑干包含什么变量……我是否即将尝到咸味?

它会拥有所有这些变量,并且针对每一个变量,它都会有一个预测器。它会训练那个预测器。现在,它训练出的这个预测器,可以具备一定的泛化能力。它能具备一定泛化能力的原因,是因为它拥有完全不同的输入。它的输入数据可能是像“蜘蛛”这样的词,但“蜘蛛”这个词可以在各种情境下被激活,这些情境会导致“蜘蛛”这个词在你的世界模型中激活。如果你有一个具有极其复杂特征的复杂世界模型,这本身就赋予了你一定的泛化能力。不仅仅是那个东西朝我疾冲过来,甚至是“蜘蛛”这个词或“蜘蛛”这个概念也会触发它。这个预测器可以学会这一点。无论我世界模型中的蜘蛛神经元是什么,它甚至可能是一本关于蜘蛛的书,或者某个地方、一个有蜘蛛的房间,或者诸如此类的东西……

Dwarkesh Patel

这场对话在听众中引发的毛骨悚然之感……

Adam Marblestone

现在我在激活你的引导子系统,你的引导子系统中的蜘蛛下丘脑神经元亚群——那些爬行昆虫的神经元——正在基于对话中这些非常抽象的概念被激活。

德瓦克什·帕特尔

如果你继续这样下去,我就要加一个触发警告了。

亚当·马布尔斯通

那是因为你学会了这一点。大脑皮层天生具有泛化能力,因为它只是基于这些非常抽象的变量以及它所拥有的所有整合信息进行预测。而引导子系统只能利用上丘和少数其他传感器所能输出的信息。

德瓦克什·帕特尔

顺便说一句,值得注意的是,将神经科学不同部分联系起来的人——史蒂夫·伯恩斯——是一位前物理学家。过去几年里,他一直在尝试综合——

亚当·马布尔斯通

他是一位 AI 安全研究员。他只是在做综合工作。这又回到了学术激励的问题上。我认为这有点难以说清。确切的下一个实验是什么?我要如何就此发表一篇论文?我要如何训练我的研究生来做这个?这非常具有推测性。但神经科学文献中有很多内容,而史蒂夫能够将这些整合起来。而且我认为史蒂夫基本上回答了伊利亚的问题,那就是:大脑最终如何编码这些更高层次的欲望,并将它们与更原始的奖励联系起来?

德瓦克什·帕特尔

一个非常天真的问题,但我们为什么不能通过训练模型不仅从 token 映射到下一个 token,而是移除训练中的掩码使其将每个 token 映射到每个 token,或者在视频、音频和文本之间生成更多标签,迫使模型将每个模态映射到另一个模态,从而实现这种全向推理呢?

亚当·马布尔斯通

我的意思是,那可能是一种方法。但对我来说并不明确。有些人认为存在一种不同的方式进行概率推理,或者一种不同于反向传播的学习算法。可能还有其他学习方式,比如基于能量的模型或其他类似的东西,你可以想象这些方式参与了这种能力的实现,而大脑拥有这些方式。

但我认为存在这样一种版本:大脑所做的,是通过粗糙版的反向传播来学习通过少数几层进行预测,这有点像多模态基础模型。大语言模型或许只是在预测下一个 token。而视觉模型可能是在学习填空,或者重构不同的片段或组合。但我认为它是以一种极其灵活的方式来完成这些的。

如果你训练一个模型仅仅去填充中心位置的空白,那没问题。但如果你没有训练它去填充左边另一个空白,那它就不会做这件事。这不在它分摊到网络中的预测能力范围内。而借助一个真正强大的推理系统,你可以在测试时选择:需要推断哪些变量子集,以及哪些变量是固定的?

Dwarkesh Patel

好的,两个子问题。第一,这让人不禁思考:人工神经网络所欠缺的,或许更少在于奖励函数,而更多在于编码器或嵌入向量……问题可能在于,你没有将视频、音频和文本以正确的潜在抽象方式表示出来,以至于它们无法相互融合或产生冲突。

这或许也解释了为什么大语言模型似乎不擅长在不同想法之间建立联系。这些想法是否被表示在了一个足够通用的层次上,以至于你能注意到不同的联系?

Adam Marblestone

嗯,问题在于这些问题全都交织在一起。如果我们不知道它是否在进行类似反向传播的学习,也不知道它是否在使用基于能量的模型,甚至不知道这些区域最初是如何连接的,那就很难真正触及这个问题的真相。但没错,这是有可能的。

我认为人们已经做了一些工作。我的朋友乔尔·达佩洛几年前确实做过一些事,他把一个模型——我记得是 V1 区域的模型,具体来说是早期视觉皮层如何表征图像——作为卷积网络的输入,这确实改善了一些方面。可能存在差异。视网膜也在进行运动检测,某些信息会被过滤掉。感官数据可能经过了一些预处理。不同模态之间可能存在某种巧妙的组合方式,比如用哪种模态预测哪种模态,从而带来更好的表征。可能还有比这更巧妙的方法。

确实有人认为,架构中内置了归纳偏置,这些偏置会以不同方式塑造表征,或者说你可以做一些巧妙的事情。Astera——也就是雇佣史蒂夫·伯恩斯的同一家机构——刚刚基于多丽丝·曹的工作启动了一个神经科学项目。她有一些关于如何构建视觉系统的想法,这些系统基本上需要更少的训练。他们在架构设计的假设中内置了这样的理念:物体由表面界定,表面具有特定类型的形状,以及它们如何相互遮挡等关系。有可能在网络中内置更多假设。进化也可能带来了一些架构上的变化。我只是觉得,成本函数等可能也是它做的关键事情。

00:22:20 – 摊销推理与基因组实际存储的内容

德瓦克什·帕特尔

我想谈谈你刚才提到的那个概念——摊销推理。也许我应该先试着解释一下我认为它是什么意思,因为我的理解很可能是错的,这样你就能帮我纠正。

亚当·马布尔斯通

对我来说,这也过去好几年了。

德瓦克什·帕特尔

目前,模型的工作方式是:你有一个输入,它将其映射到一个输出,这实际上是对一个真实过程——我们认为这就是智能——进行摊销。这个真实过程是:你对世界可能的状态有一个先验认知,即是什么原因导致了世界呈现出它现在的样子。然后,当你观察到某些现象时,你应该会想:“好吧,世界可能的状态有这些。这个原因最能解释当前发生的情况。”

现在,对所有可能的原因进行这种计算在计算上是不可行的。因此,你只能进行采样,比如:“哦,这里有一个潜在原因。它能解释这个观察结果吗?不能,那就放弃。我们继续采样。”最终你会找到那个原因,然后这个原因解释了观察结果,这就成为了你的后验认知。

亚当·马布尔史东

这其实相当不错。贝叶斯推理本质上就是这种非常棘手的计算。我们用来进行贝叶斯推理的算法往往需要采集大量样本,比如蒙特卡洛方法,就需要采集大量样本。而采集样本需要时间。这就像最初的玻尔兹曼机之类的模型。它们使用的就是这类技术,并且在概率编程和其他类型的方法中也经常用到。贝叶斯推理问题,基本上就是感知问题:给定一个关于世界的模型和某些数据,我应该如何更新我的……我内部模型中缺失的变量是什么?

德瓦克什·帕特尔

我想,其理念是希望神经网络能够……显然,从机制上讲,神经网络并不是从“这是我的世界模型,我要尝试解释这些数据”开始的。但希望在于,它并非从“嘿,这个原因能解释这个观察结果吗?不能。那这个原因能解释这个观察结果吗?能。”开始。你所做的只是观察……

亚当·马布尔史东

神经网络认为的最佳原因是什么?

德瓦克什·帕特尔

从观察到原因。所以前馈过程是从观察到原因,再到输出……

亚当·马布尔史东

你不需要评估所有这些能量值之类的,然后通过采样让它们变高或变低。你只需要说,大致上这个过程会导致这个成为最优的那个,或者类似的意思。

德瓦克什·帕特尔

没错。一种思考方式可能是,测试时计算、推理时计算实际上是在重新进行这种采样。你确实读到了它的思维链。它实际上正在执行我们讨论的这个简单示例,比如:“哦,我能通过做X来解决这个问题吗?不行,我需要换个方法。”这就引出了一个问题。我的意思是,随着时间的推移,那些需要推理时计算才能激发的能力,确实会被蒸馏到模型本身中。所以,你是在摊销之前需要做这些展开、这些蒙特卡洛展开才能弄清楚的事情。

总的来说,或许存在这样一个原则:可以被复制的数字智能,与无法被复制的生物智能相比,有着不同的、相关的权衡取舍。因此,总的来说,摊销更多东西应该是合理的,因为你确实可以复制摊销的结果,或者说复制你已经内建好的东西。

这是一个可能值得推测的旁支问题。在未来,随着这些东西变得更加智能,并且我们训练它们的方式在经济上变得更加合理,那么,将什么东西摊销到这些智能体中才是合理的呢?而这些东西,进化可能认为不值得摊销到生物智能体中。因为每次你都得重新训练。

亚当·马布尔斯通

首先,我认为概率派 AI 研究者会认为,当然需要测试时计算,因为推理问题本身非常困难,而我们已知的解决方式都涉及大量测试时计算。否则,那只是一个永远无法……的糟糕近似,你必须用无限数据之类的东西才能实现。我认为一些概率派人士会说:“不,这本质上是概率性的,用这种方式进行摊销根本没有意义。”他们可能还会指向大脑说:“好吧,大脑中的神经元是随机的,它们在采样,在做各种事情。所以,也许大脑实际上更像是在进行非摊销推理,即真正的推理。”

但感知能在短短几毫秒内完成,这也很奇怪。它似乎并没有用到那么多采样。所以,显然它也在将一些东西烘焙到近似前向传播或类似的过程中来实现这一点。未来,我不知道。人们过去不得不使用测试时计算来处理的事情,现在正被用来反向训练基础模型,这在一定程度上已经成为一种趋势了吗?现在它可以通过一次前向传播就完成。

也许进化做到了,也许没有。我认为进化仍然必须通过基因组传递所有信息来构建网络,而人类生活的环境非常动态。所以,如果我们相信这是真的,那么根据 Steve Byrnes 的说法,存在一个学习子系统和一个引导子系统,学习子系统并没有大量的预初始化或预训练。它有一个特定的架构,但在生命周期内它会进行学习。那么,进化实际上并没有将那么多东西摊销到那个网络中。相反,它将其摊销到了一组先天行为、一组自举成本函数或构建非常特定的奖励信号的方式中。

Dwarkesh Patel

这个框架有助于解释人们指出的一个谜团——我也曾就此问过几位嘉宾——即:如果你想将进化类比为预训练,那么如何解释基因组传递的信息如此之少这一事实?整个人类基因组的大小是 3 GB。显然,其中只有一小部分与大脑的编码相关。

以前人们做过这样的类比:实际上,进化找到了模型的超参数——那些告诉你应该有多少层、架构如何、以及各部分应如何连接的数字。但如果故事的一个重要部分在于,更高的样本效率有助于学习,通常能让系统性能更优,而奖励函数、损失函数——如果进化找到了那些有助于学习的损失函数——那么,用如此之少的信息就能构建出智能,就说得通了。因为奖励函数,在 Python 中,奖励函数实际上就是一行代码。所以,你只需要一千行这样的代码,这并不会占用太多空间。

亚当·马布尔斯通

是的。它还能利用我之前提到的那个泛化特性,就是我们讨论蜘蛛时说的那种情况——蜘蛛仅仅学会“蜘蛛”这个词,就能触发蜘蛛反射或类似机制。它也能利用这一点。它能够构建一个奖励函数,这个函数仅通过指定那些天生的蜘蛛相关事物,以及史蒂夫所称的负责学习的“思想评估器”,就包含了大量的泛化能力。

这也可能是构建你所需的那些更复杂奖励函数的一种非常紧凑的方案。它不需要预判奖励函数未来的一切。它只需要预判哪些变量是相关的,以及找到这些变量的启发式方法是什么。然后,它必须为学习算法和学习子系统的基本架构提供一个非常紧凑的规范。接着,它还必须指定所有关于蜘蛛、关于朋友、关于你母亲、关于交配、关于社会群体以及关于共同注视的 Python 代码。所有这些内容都必须被指定。

那么,这真的成立吗?我认为有一些证据支持这一点。陈飞(Fei Chen)和埃文·马科斯科(Evan Macosko)以及其他一些研究人员一直在进行这些单细胞图谱的研究。通过“大脑计划”(BRAIN Initiative)这个大型神经科学资助项目,扩展神经科学技术——这再次成为我痴迷的事情——所做的事情之一,就是他们基本上已经遍历了不同区域,尤其是小鼠大脑的不同区域,并绘制了不同细胞类型所在的位置。大脑皮层不同区域有多少种不同类型的细胞?它们在不同区域是否相同?然后你再看看这些皮层下区域,它们更像是“操控子系统”或奖励函数生成区域。它们有多少种不同类型的细胞?它们拥有哪些神经元类型?

我们不知道它们是如何全部连接在一起的,也不知道它们具体做什么、电路是什么或者它们意味着什么,但你可以通过测序 RNA 来量化有多少种不同类型的细胞。基本上,在“操控子系统”中,奇怪、多样且特化的细胞类型比“学习子系统”中要多得多。比如皮层细胞类型,似乎足以在那里构建一个学习算法并指定一些超参数。而在“操控子系统”中,有成千上万种非常奇怪的细胞,它们可能就像是负责“蜘蛛闪避反射”的细胞,以及负责“我即将尝到盐味”的细胞。

德瓦克什·帕特尔(Dwarkesh Patel)

为什么每种奖励函数都需要不同的细胞类型?

亚当·马布尔斯通

嗯,这就是你获得先天布线回路的地方。在学习算法部分,也就是学习子系统中,你指定了初始架构,指定了一个学习算法。所有的精髓都通过突触的可塑性、通过那个庞大网络内突触的变化来实现。但它的初始化架构是一种相对重复的结构。就像制作一个八层 Transformer 所需的 Python 代码量与制作一个三层 Transformer 所需的代码量相差不大一样。你只是在复制。

而相比之下,用于奖励函数的所有这些 Python 代码——比如如果上丘看到有东西在快速移动,而你感到皮肤起鸡皮疙瘩之类的,那么就触发蜘蛛反射——这只是一堆特制的、物种特异性的、情境特异性的东西。大脑皮层不知道蜘蛛是什么,它只知道层。

德瓦克什·帕特尔

但你的意思是,编写这个奖励函数的唯一方法就是拥有一种特殊的细胞类型?

亚当·马布尔斯通

是的,嗯,我是这么认为的。我认为你要么必须有特殊的细胞类型,要么就必须以某种其他方式获得特殊的布线规则,让进化能够规定这个神经元需要连接到那个神经元,而无需任何学习。我认为最可能发生这种情况的方式是,这些细胞表达不同的受体和蛋白质,这些受体和蛋白质会指示:“好了,当这个细胞与那个细胞接触时,让我们形成一个突触。”所以这是基因布线,而这需要细胞类型来完成。

德瓦克什·帕特尔

我确信如果我懂一点神经科学入门知识,这会更容易理解,但看起来在导向子系统中仍然存在很多复杂性,或者更确切地说是通用性。所以,如果导向子系统拥有自己独立于视觉皮层的视觉系统,那么不同的特征仍然需要接入那个视觉系统。所以蜘蛛相关的东西需要接入它,爱情相关的东西也需要接入它,等等,等等。所以这看起来很复杂。

亚当·马布尔斯通

这仍然很复杂。正因如此,基因组上大量的“基因空间”,以及在不同细胞类型等方面的投入,才会用于构建和预连接“操控子系统”。

德瓦克什·帕特尔

我们能否判断基因组中有多少部分是在明确地工作?我想,你可以判断出有多少基因与在大脑不同细胞类型中表达的RNA或表观遗传学特征相关,对吧?

亚当·马布尔斯通

是的。这正是细胞类型分析能帮你解决的问题。我不认为能精确地说“哦,基因组的这个百分比在做这个”,但你可以说:“好吧,在所有这些操控子系统亚型中,有多少不同的基因参与了区分它们各自的身份以及它们如何连接?这些基因占用的基因空间,与那些指定视觉皮层或听觉皮层的基因相比又如何?” 你只是在重复使用相同的基因来做同样的事情。而蜘蛛的反射钩连接……是的,你说得对。它们必须构建一个视觉系统,还必须构建一些听觉系统、触觉系统和导航类系统。

甚至包括输入到海马体等结构的信息,那里有头部方向细胞。就连果蝇的大脑也有先天回路,用来判断自身朝向并帮助它在世界中导航。它利用视觉,计算飞行时的光流,以及飞行与风向的关系。它拥有所有这些先天性的功能,我认为在哺乳动物的大脑中,我们都会把这些归入“操控子系统”。这工作量很大。所以,所有用于指定果蝇必须完成的各种功能的基因,我们也会有类似的东西,只是全部集中在操控子系统里。

德瓦克什·帕特尔

但我们有没有一个大概的估计,比如“这需要多少个核苷酸,需要多少兆碱基来——”

亚当·马布尔斯通

我不知道。我是说,我觉得你或许可以跟生物学家聊聊这个。从基因角度来看,我们跟酵母有很多共同点。酵母至今仍被用作生物学中部分药物研发等工作的模型。而且基因组中很大一部分都是为了让你能拥有一个细胞——它能回收废物、获取能量、进行复制。

那么,我们跟老鼠又有什么共同点呢?我们确实在某种程度上知道,我们与黑猩猩之类的差异——包括社会本能、以及大脑皮层等方面更高级的差异——其实只涉及极少数基因,这些基因投入到了额外的“构建八层Transformer架构而非六层Transformer架构”或“调整那个奖励函数”上。

德瓦克什·帕特尔

这或许有助于解释为什么人科动物的大脑体积增长得如此之快。请告诉我这个说法是否正确——按照这个叙事,社会性学习或其他某种因素提高了从环境中学习的能力。它提高了我们的样本效率。你不再需要亲自去猎杀野猪并摸索如何做到,而只需说:“长辈告诉我,矛是这样做的。”这就增加了拥有更大皮层(能够学习这些知识)的动机。

亚当·马布尔史东

是的,而且这可以通过相对较少的基因来实现,因为它实际上是在复制老鼠已有的东西,并制造更多。从基因组的角度来看,可能不完全相同,也可能有一些调整,但你不需要重新发明所有这些东西。

德瓦克什·帕特尔

那么,在大脑的进化史上,大脑皮层可以追溯到多久以前?这个观点是不是说,大脑皮层一直以来都解决了这种全向推理的问题,这已经是一个长期被解决的问题?而灵长类动物的重大突破在于我们获得了奖励函数,这提高了进行全向推理的回报?

亚当·马布尔史东

这是个好问题。

德瓦克什·帕特尔

还是说,全向推理本身也是需要一段时间才能解锁的?

亚当·马布尔史东

我不确定这方面是否存在共识。我认为可能在语言方面存在一些特定问题。是否存在一些调整——无论是通过听觉和记忆,还是听觉与记忆区域的某种组合?可能还存在宏观层面的连接,比如需要将听觉区域连接到记忆区域或类似结构,再连接到某些社会本能,才能实现语言功能。但这可能也只需要少量基因变化,就能实现类似“我只需要从这里——颞叶区域——连接到听觉皮层”这样的功能。

有一些关于布罗卡区和韦尼克区的证据。这些区域与海马体、前额叶皮层等相连。因此,可能只需要少量基因就能让人类真正掌握语言。这可能是关键因素。但问题是:是大脑皮层发生了某种变化,才使得这些功能成为可能?还是说这种潜力早已存在,只是缺乏动力去扩展这种能力并加以利用,将其连接到社会本能并更充分地使用?我倾向于后者。我认为小鼠的大脑皮层与人类有很多相似之处。

德瓦克什·帕特尔

不过,苏珊娜·赫库拉诺-霍泽尔的研究表明,灵长类大脑中神经元数量随脑重的增长比例优于啮齿类大脑。这是否意味着大脑皮层在可扩展性方面确实有所改进?

亚当·马布尔斯通

也许吧,也许吧。我对这方面研究不深。可能架构上、折叠方式上、神经元特性等方面发生了一些变化,从而略微调整了这一点。但无论如何,扩展性依然存在。

德瓦克什·帕特尔

没错。

亚当·马布尔斯通

所以我并不是说人类在学习子系统的架构上没有任何特殊之处。但确实,普遍认为这一部分得到了扩展。那么问题就变成了:“好吧,这又如何与操控子系统的变化、以及那些利用并有效引导你启动这一功能的本能相契合呢?”

不过再补充几点:就连果蝇的大脑也具备一定程度的(学习能力),甚至追溯到非常古老的生物……我是说,我觉得你读过那本很棒的书《智能简史》,对吧?我认为这确实是一本好书。很多AI研究者似乎都觉得这本书写得很好。

凡是拥有大脑的生物,其学习能力都可以追溯到很远的源头。基本上,至少从脊椎动物开始,就已经存在类似原始强化学习的机制了。想象一下斑马鱼。然后还有其他的分支。鸟类可能重新演化出了类似大脑皮层的东西。它没有那六层结构,但确实有某种类似皮层的组织。所以在爬行动物之后,鸟类和哺乳动物在某种意义上都演化出了类似皮层的结构,但组织方式不同。

但即使是果蝇的大脑,也有联想学习中心,它们做的事情可能有点像Byrnes提出的"思想评估器"概念——果蝇的蘑菇体中,会有一个特定的多巴胺信号来训练特定的神经元亚群,让它们将不同的感官信息与"我现在要得到食物了吗?"或"我现在要受伤了吗?"关联起来。

Dwarkesh Patel

稍微岔开一下话题。我记得在Beren Millidge写的一篇博客文章中读到过,大脑皮层中与听觉和视觉相关的部分,在灵长类动物和人类之间出现了不成比例的扩张,而与嗅觉相关的部分则没有。我记得他说过类似这样的话:这是因为那种类型的数据具有更差的规模定律特性。也许他是这个意思,但我认为对实际情况的另一种解读是,这些内置于"引导子系统"中的社会奖励函数,需要更多地利用观察长辈、观察视觉线索以及倾听他们说话的能力。为了理解这些引导学习的线索,你需要更多地激活视觉和听觉,而不是嗅觉。

Adam Marblestone

我的意思是,这类东西有很多。我觉得其实你之前的节目里也提到过。但比如说人类眼睛的设计,有瞳孔、眼白等等,我们天生就具备通过共同眼神接触来建立关系的能力。也许这在萨顿那期节目里提到过,我记不清了。但没错,我们必须通过逐步引导,达到能够察觉眼神接触、能够通过语言交流的程度。这基本上就是生命最初几年要做的事情。

00:42:42 – 大脑中的基于模型与无模型强化学习

德瓦克什·帕特尔

好的,我想问你关于强化学习的问题。目前,这些大语言模型的训练方式是,如果它们通过了单元测试或解决了一个数学问题,那么整个轨迹,即该轨迹中的每一个模型 token,都会被赋予更高的权重。人类的情况是怎样的?大脑的不同区域是否在进行不同类型的基于模型和无模型的强化学习?

亚当·马布尔史东

是的,这又是另一类问题。再说一遍,我对这些问题的所有回答,任何具体说法,都只是表明我们可以朝这个方向进行探索。我觉得这很有趣,也许我认为文献在非常宽泛的层面上指向了这些方向。我真正想做的是去绘制整个小鼠大脑图谱,全面搞清楚这个问题,让神经科学成为一门基于真实情况的科学。所以,基本上我也不确定。

但首先,我认为伊利亚在播客里说过:“你们不使用价值函数,这很奇怪,对吧?”你们基本上用的是最原始的强化学习形式。当然,这些人极其聪明,他们正在针对如何在 GPU 上实现这一点进行优化,取得的成就也确实令人惊叹。但从概念上讲,这是一种非常原始的强化学习形式,甚至比不上十年前的做法。就连当年玩雅达利游戏的程序都在使用 Q 学习,这本质上是一种时序差分学习。时序差分学习的基本意思是,你拥有某种价值函数,它不仅能告诉我当前选择的动作会立即产生什么结果,还能告诉我这个动作对我预期的总回报等长期后果意味着什么。

所以,你本应有价值函数……但在大语言模型中完全没有价值函数,这简直不可思议。既然伊利亚说过这话,我想我也可以说。我对 AI 的了解只有他的百分之一,但这种方法居然能奏效,实在有点疯狂。

不过,就大脑而言,我认为有些脑区被认为在执行与无模型强化学习非常相似的功能,比如纹状体和基底神经节的部分区域。人们认为它们拥有一个相对有限的、较小的动作空间。它们能采取的动作类型,首先可能是像“告诉脑干和脊髓执行这个运动动作?是或否”这样的指令。或者也可能是更复杂的认知类动作,比如“告诉丘脑,允许大脑皮层的这一部分与另一部分通信”,或者“释放海马体中的记忆,并开始一段新记忆之类的”。但基底神经节输出的动作是有限的,这本质上就是一种非常简单的强化学习。

因此,其他大脑和我们自己大脑的某些部分,可能只是在执行非常简单的、类似朴素强化学习的算法。在此基础上叠加的一层是,神经科学中的一些重要工作,比如 Peter Dayan 的研究,以及一系列相关工作——我认为这也是 DeepMind 最初开展时序差分学习研究的部分原因。他们对神经科学非常感兴趣。大量神经科学证据表明,多巴胺传递的是这种奖励预测误差信号,而不仅仅是“是或否,未来无数时间步之后”的奖励信号。这是一种预测误差,并且这与学习这些价值函数是一致的。

所以有这一层,然后可能还有更高阶的东西。我们的大脑皮层构建了这个世界模型。嗯,皮层世界模型所能包含的内容之一,就是一个关于你何时会获得奖励、何时不会获得奖励的模型。同样,它是在预测“导向子系统”会做什么。它可能是在预测基底神经节会做什么。你的大脑皮层中有一个模型,它拥有更强的泛化能力、更多的概念以及所有这些特性,它会说:“好的,这些类型的计划、这些类型的行动,在这些类型的情境下会带来奖励。”所以,我拥有一个关于我自身奖励的模型。

有些人也认为,你可以反过来思考。这是推理图景的一部分。有一种观点是将强化学习视为推理。你可以说:“嗯,假设我获得了高奖励,那么采样一个我本应采取才能达到那个结果的计划。”这就是从奖励部分推理出计划部分。我将奖励固定为高值,然后推断计划,从可能导向该结果的计划中进行采样。所以,如果你拥有这个非常通用的皮层系统,它就能做到这一点。如果你拥有这个非常通用的、基于模型的系统,并且该模型(除其他外)包含了计划和奖励,那么你基本上就能自然而然地得到这个结果。

Dwarkesh Patel

那么,用神经网络的术语来说,有一个价值头与正在发生的全向推理相关联——

Adam Marblestone

是的,或者说有一个价值输入。

Dwarkesh Patel

哦,好的。有意思。

Adam Marblestone

是的,它可以预测。它能预测的、近乎感官变量之一,就是它将会获得什么样的奖励。

Dwarkesh Patel

顺便说一句,谈到分摊成本,显然价值就像是奖励查找的分摊展开。

亚当·马布尔斯通

对,类似这样。这就像是它的一个统计平均值或预测。

德瓦克什·帕特尔

一个题外想法。乔·亨里奇等人提出过一个观点,关于人类社会是如何学会做某些事情的,比如,你怎么知道这种豆子——它几乎总是让你中毒——如果你按照一个极其复杂的十步流程来操作,其中任何一步失败豆子仍然有毒,它却可以食用?你怎么知道要用特定的武器、在一年中特定的时间、以特定的方式捕猎这种海豹?除了世世代代不断尝试,别无他法。这让我觉得,这实际上非常像在文明层面发生的无模型强化学习。不,也不完全一样。

亚当·马布尔斯通

从某种意义上说,进化是最简单的算法。如果我们相信这一切都源于进化,那么外部循环可以是非常缺乏远见的。

德瓦克什·帕特尔

对,这很有趣。只是层级结构……进化:无模型……

亚当·马布尔斯通

那么这说明了什么?也许简单的算法,只要你做得足够多,就能得到任何东西。

德瓦克什·帕特尔

对。

亚当·马布尔斯通

是啊,我也不知道。

德瓦克什·帕特尔

所以,进化:无模型。基底神经节:无模型。大脑皮层:基于模型。文化:可能是无模型的。我的意思是,你会听从长辈的意见之类的。

亚当·马布尔斯通

也许存在群体选择之类的机制,这些东西更像是无模型的。但现在我认为,文化,嗯,它存储了一部分模型。

00:50:31 – 生物硬件是限制还是优势?

德瓦克什·帕特尔

退一步看,与现有计算机相比,人类使用生物硬件究竟是劣势还是优势?我问这个问题的意思是,如果存在“那个算法”,那么当它被刻写在当今的硬件上时,其性能在质量上是会差得多还是好得多?认为它可能……我是这样想的。显然,大脑必须做出许多与计算硬件无关的权衡。它必须具有高得多的能效。也许正因如此,它必须以更慢的速度运行,以便电压差可以更小。所以大脑以 200 赫兹运行,功耗只有 20 瓦。另一方面,在机器人技术中,我们显然已经体会到,手指的灵巧程度远超我们目前能制造出的电机。所以也许大脑中存在某种相当于认知灵巧性的东西,这或许是因为我们能够实现非结构化稀疏性。我们可以将存储和计算放在同一位置。

德瓦克什·帕特尔

是的。

德瓦克什·帕特尔

这一切最终会如何?你是觉得,“靠,如果我们不用应付这些大脑,我们会聪明得多。” 还是说——

亚当·马布尔史东

我认为最终我们会在某种程度上两全其美。大脑一个明显的缺点是它无法被复制。你无法从外部对每个神经元和突触进行读写访问,而计算机则可以。原则上,我可以用 Python 或其他方式直接编辑权重矩阵中的某个值,然后加载并复制它。所以,它无法被复制和随机访问这一点非常麻烦。但除此之外,它可能有很多优点。这也告诉我们,你需要以某种方式对算法进行协同设计。这甚至可能不会改变我们讨论过的太多内容,但你确实需要以某种方式进行这种协同设计。

所以,是的,如何用速度极慢、电压极低的开关来实现这一点?这对能耗来说将非常重要。将存储和计算放在同一位置。我认为硬件公司很可能会尝试将存储和计算放在同一位置。他们会尝试使用更低的电压,并允许一些随机性。

有些人认为,我们刚才讨论的所有这些概率性内容——“哦,它实际上是基于能量的模型,等等”——是在进行大量采样。它并非只是将一切摊销化。神经元本身也非常适合这一点,因为它们天生具有随机性。所以你基本上不需要在大量 Python 代码中通过随机数生成器来生成样本。神经元本身就能生成样本,并且它可以调整不同概率的值,并学习这些调整方式。因此,它很可能与某种推理方法或其他机制是高度协同设计的。

德瓦克什·帕特尔

那可就太有意思了……我的意思是,我从这次访谈中得到的启示是,那些在推特上被人嘲笑的人,比如扬·勒昆和贝夫·杰佐斯之类的,嗯,说不定他们才是对的。

亚当·马布尔史东

这确实是其中一种解读。诚然,自从大语言模型兴起以来,我就没怎么真正从事过人工智能方面的工作,所以我已经跟不上形势了。但我对规模扩展的运作方式以及一切进展感到惊讶,并且认为这非常了不起。不过,是的,我认为扬·勒昆和贝夫·杰佐斯关于概率模型的观点确实有些道理,或者至少有可能。事实上,在 2021 年之前,所有神经科学家和所有人工智能研究者都是这么想的。

德瓦克什·帕特尔

没错。所以大脑中发生着大量细胞层面的活动,这些活动不仅仅是神经元之间的突触连接。其中有多少在功能上比突触本身做了更多的工作,又有多少只是为了维持突触功能而不得不进行的一系列粗糙修补?对于数字思维来说,你可以极其轻松地调整突触,抱歉,是调整参数。但对于一个细胞来说,要根据梯度信号来调节突触,就需要动用所有这些复杂的机制。那么,它实际上是否比用极少量代码就能完成的工作做得更多呢?

亚当·马布尔史东

我不知道,但我并不相信那种激进的观点,比如“哦,实际上记忆主要不是由突触构成的”或者“学习主要是基因层面的变化”之类的。我认为更合理的解释,就像你刚才说的第二种情况那样。假设你想对某个神经元所有传出或传入的权重进行权重归一化。那么,你可能需要以某种方式将这一信息告知细胞核,然后由细胞核将指令传回各个突触或其他结构。这就会涉及大量的细胞层面的变化。再比如,假设你刚刚经历了大量的可塑性变化,并且参与了这段记忆的形成。现在这段记忆已经被巩固到了大脑皮层或其他区域。那么,我们想要重新利用你,让你成为一个能够再次学习的新单元。

这其中会涉及大量的细胞层面的变化,所以细胞内会发生很多事情。但从算法层面来看,它并没有在这些算法之外增加什么新东西。它只是在实现一些在数字计算机中对我们来说非常容易做到的事情——找到权重并修改它们。而在细胞中,它必须完全依靠分子机器自身来完成这一切,没有任何中央控制器。这真是不可思议。

我认为,细胞所做的有些事情似乎更有说服力。小脑需要完成的任务之一就是随时间进行预测。时间延迟是多少?假设我看到一道闪光,然后在若干毫秒后,我的眼睑会感受到一股气流。小脑非常擅长预测闪光与气流之间的时间间隔,这样你的眼睛就会自动闭上。小脑就参与这类反射,即习得性反射。

小脑中有一些细胞,其细胞体似乎参与了存储时间常数、改变延迟时间常数的过程,而不是完全通过“我让突触链变长来延长延迟”这种方式来实现。不,细胞体本身就会为你存储那个时间延迟。所以确实存在一些这样的例子,但我并非从一开始就相信这种理论——即认为神经元之间连接的变化就是主要发生的算法过程。我认为,仍有充分理由相信,主要机制是突触连接的变化,而非某些奇特的细胞层面机制。

德瓦克什·帕特尔

回到这个整体视角:我们的智能并非仅仅是一种构建世界模型的全向推理过程,而实际上是一个教导我们该关注什么、哪些是值得学习的重要显著因素等的系统。我想看看我们能否从中获得一些直觉,来理解不同类型智能可能是什么样的。因此,似乎通用人工智能或超人类智能仍然应该具备学习相当通用的世界模型的能力,但它可能会被激励去关注与后奇点时代的现代环境相关的不同事物。我们应该预期不同智能之间的差异有多大?

亚当·马布尔斯通

我认为思考这个问题的一种方式是:是否真的有可能制造出“回形针最大化器”之类的东西?如果你试图制造一个回形针最大化器,它最终会不会因为唯一的奖励函数就是制造回形针,而变得不够智能?我的问题是:你能做到吗?我不知道。如果让我更多地引用史蒂夫·伯恩斯的观点,我认为他非常担心的是,要让某个东西变得智能,其“引导子系统”所需的最小可行组件,远少于让它拥有人类般的社交本能和伦理等所需的最小可行组件集合。

因此,关于“操控子系统”,你最想了解的大部分内容,实际上就是如何实现对齐的具体细节,或者说,哪些是人类行为和社会本能,而哪些仅仅是能力所需。我们以一种略有不同的方式讨论过这个问题,因为我们大致是在说:“嗯,为了让人类进行社会性学习,他们需要眼神交流并向他人学习。”但我们从大语言模型中已经知道,取决于你的起点,没有这些东西也能学习语言。所以我认为,很可能可以制造出极其强大的、基于模型的强化学习优化系统之类的玩意儿,它们不具备人类大脑奖励函数中的大部分内容,因此可能会想要最大化回形针的数量。这是一个令人担忧的问题。

德瓦克什·帕特尔

但你指出,为了制造一个称职的“回形针最大化器”——那种能够建造宇宙飞船、学习物理学等等的东西——它需要具备一些能激发学习的驱动力,比如好奇心和探索欲。

亚当·马布尔史东

是的,好奇心、对他人的兴趣、对社会互动的兴趣。但我认为这已经是最低限度的了。这对人类来说是这样,但对于像大语言模型这样已经预训练好的东西来说,可能就不那么必要了。所以,我们想知道“操控子系统”的大部分原因,如果让我揣摩史蒂夫的想法,我认为是为了对齐。

德瓦克什·帕特尔

我们有多大把握,自己甚至拥有正确的算法概念词汇,来思考大脑正在做什么?我的意思是,神经科学对人工智能有一项重大贡献,那就是 20 世纪 50 年代提出的神经元概念,这仅仅是最初的贡献。但此后我们学到的关于大脑正在执行的顶层算法的很多东西——从反向传播,到大脑中是否发生类似反向传播的过程,再到“哦,V1 区是不是在做类似卷积神经网络的事情”,再到时序差分学习和贝尔曼方程、演员-评论家算法等等——似乎都受到这样一种动态的启发:我们先想出一个想法,也许我们可以让 AI 神经网络以这种方式工作,然后我们注意到大脑中的某些东西也是以这种方式工作的。那么,为什么不能认为还有更多类似的情况呢?

亚当·马布尔斯通

也许有。我认为我们可能有所发现的原因在于,基于这些想法构建的 AI 运行得出奇地好。此外还有一堆纯粹的经验性证据。卷积神经网络及其变体。我不确定最新的绝对情况是什么,但与计算神经科学中关于视觉系统运作方式的其他模型相比,它们的预测能力更强。你甚至可以打分,即便是在猫的图片等数据上预训练的卷积神经网络,它们对于任意其他图像的表征相似性,与通过不同方式测量到的大脑激活相比如何?吉姆·迪卡洛的实验室有大脑评分,而 AI 模型实际上……似乎存在某种相关性。神经科学未必有比这更好的东西。

所以,是的,这只是在复述你所说的:我们拥有的最好的计算神经科学理论,似乎很大程度上是源于 AI 模型以及发现那些有效的方法。比如发现反向传播有效,然后说:“我们能否用皮层回路来近似反向传播?”或者类似的事情。确实有过这样的尝试。

现在,有些人完全不同意这种观点。神经科学家 György Buzsáki 著有《由内而外的大脑》一书,他在书中基本上认为,我们所有的心理学概念、AI 概念,所有这些都只是人为编造的东西。我们实际要做的是弄清楚大脑真正使用的原始基元是什么。而我们的词汇量不足以描述这些。我们必须从大脑出发,创造新的词汇,而不是先有反向传播,再试图将其应用于大脑或其他类似的东西。他研究的是大脑中的大量振荡等现象,而不是单个神经元及其功能。

我不知道。我认为这种观点有其道理。从研究方案设计的角度来看,我们应该尝试做的一件事就是模拟一条微小的蠕虫或一条微小的斑马鱼,尽可能接近生物物理或自下而上的方式。比如获取连接组、分子、活动,然后将其作为一个物理动力系统来研究,观察它的行为。

但我不知道,我只是觉得 AI 是计算神经科学的绝佳素材。那些模型可能确实是相当不错的模型。我们应该关注这一点。我既认为研究组合中应该有一部分是完全自下而上的,不试图将我们从 AI 中学到的词汇应用于这些系统;同时也应该有另一大部分工作,是试图利用这些词汇或其变体来对这些系统进行逆向工程。我们应该双管齐下。我的猜测是,逆向工程这条路实际上可能会取得一定成效。比如我们确实看到了时序差分学习这类东西,这也是 Sutton 独立发明的。

Dwarkesh Patel

那一定是一种疯狂的感觉,就像——

Adam Marblestone

是啊,那太疯狂了。

Dwarkesh Patel

我写下的这个方程,它就在大脑里。

Adam Marblestone

01:03:59 – 为什么人类大脑图谱很重要

Dwarkesh Patel

那么让我问问你这个。你们正在资助不同的团队,试图弄清楚大脑内部的运作机制。如果我们拥有一个完美的大脑表征——无论你如何定义它——为什么认为它真的能让我们找到这些问题的答案呢?我们拥有可解释性高得多的神经网络,这不仅是因为我们理解权重矩阵里有什么,更是因为存在权重矩阵。这些盒子里装着数字。即便如此,我们也只能判断非常基础的东西。我们大致能看到一些用于非常基础的模式匹配(比如用一个 token 跟随另一个 token)的电路。我觉得,我们并没有仅仅因为大语言模型是可解释的,就真正拥有了它们为何具备智能的解释。

亚当·马布尔斯通

我想我对此有些不同意见。我们对大语言模型在根本上做什么有了一些描述。它做的事情是:我有一个架构,我有一个学习规则,我有超参数,我有初始化,我还有训练数据。

德瓦克什·帕特尔

但这些都是因为我们构建了它们而得知的,而不是因为我们通过观察权重来解释出来的。与连接组类似的东西就是观察权重。

亚当·马布尔斯通

我认为我们应该做的,是用架构、学习规则、初始化这类语言来描述大脑,而不是试图找到“金门大桥回路”并精确说明这个神经元实际上如何……那将是一些极其复杂的习得模式。Konrad Kording 和 Tim Lillicrap 在不久之前(大概五年前)发表过一篇论文,题为《理解神经网络意味着什么?》。他们的大意是,你可以想象训练一个神经网络来计算圆周率的数字之类的。那就像某种疯狂的规律。你也可以训练同一个网络去预测你能找到的最复杂的东西,比如预测股票价格,基本上就是预测真正复杂的系统、计算完备的系统。我可以训练一个神经网络来执行元胞自动机或任何疯狂的事情。我认为,我们永远无法通过可解释性完全捕捉到这一点。它内部就是在进行极其复杂的计算。

但我们仍然可以说,它之所以变成这样,是因为它有一个架构,我们给了它这些训练数据,并且它有这样的损失函数。所以我想用同样的方式来描述大脑。我认为我一直在阐述的这个框架就是,我们需要理解大脑皮层以及它如何体现一种学习算法。我不需要理解它如何计算“金门大桥”。

Dwarkesh Patel

但如果你能看到所有的神经元,如果你拥有连接组,那为什么能告诉你学习算法是什么?

Adam Marblestone

嗯,我想对此有几种不同的看法。这取决于这个组合中的不同部分。在完全自下而上、我们必须模拟一切的那个组合中,它基本上不能告诉你。你必须制作一个斑马鱼大脑的模拟之类的东西,然后观察其中涌现的动态,并提出新的名称和概念等等。这是最极端的自下而上的神经科学观点。但即便如此,连接组对于进行那种生物物理或自下而上的模拟仍然非常重要。

但另一方面,你也可以说:“好吧,如果我们真的能把人工智能的一些理念应用过来呢?”我们基本上需要弄清楚,它是基于能量的模型,还是摊销式 VAE 类型的模型?它是在进行反向传播,还是在做别的事情?学习规则是局部的还是全局的?如果我们对这个问题有一些可能的想法储备,那么就把连接组视为大量额外的约束条件,这些条件将有助于精炼,最终形成一个一致的图景。

对于“引导子系统”的相关问题,我也在思考一些非常基础的东西。有多少种不同类型的多巴胺信号,或者引导子系统信号,或者思维评估器信号等等……大致可以分为多少种不同的类别?就连下丘脑的细胞类型比大脑皮层多这种非常基础的信息,也是关于不同区域结构复杂程度的新信息。有多少种不同的多巴胺神经元?前额叶皮层和听觉皮层之间的连接,与前额叶皮层和视觉皮层之间的连接是一样的吗?这些最基本的问题,我们都不知道。问题在于,通过一系列定制化的实验来了解哪怕是最基本的东西,也需要极其漫长的时间。而通过获取连接组来一次性了解所有这些信息,效率要高得多。

德瓦克什·帕特尔

这个研究的时间线是怎样的?大概的想法是,首先,要为人工智能的发展提供信息。你希望能够弄清楚,如何让人工智能在意其他人对其内部思维模式的看法。但可解释性研究人员仅仅通过检查普通的神经网络,就在这个问题上取得了进展。一定存在某些特征……

亚当·马布尔斯通

你可以对现有的大语言模型进行可解释性研究。但你无法对一个假设性的、像大脑那样基于模型的强化学习算法(我们最终实现通用人工智能时可能会收敛到这种算法)进行可解释性研究。

德瓦克什·帕特尔

有道理。但要让这项研究具有实用性和相关性,你对人工智能的发展时间线有什么预期?

亚当·马布尔斯通

我认为可以这么说,如果你身处 AI 2027 的场景中,它并不是非常实用和相关的。因此,我现在所做的科学工作并不会影响十年后的科学。因为真正影响十年后科学的,是 AI 2027 场景的结果。即使我拥有连接组,可能也只是略微调整某些事情,大概没那么重要。

但我认为有很多理由相信,我们或许会从这个范式中收获颇丰。然而,真正具有变革性、足以改变整个未来或类似性质的那个单一事件,仍然在五年或更久之后。

Dwarkesh Patel

这是因为我们还没有捕捉到全向推理,还没有找到让一个智能体以合理方式关注事物的正确方法吗?

Adam Marblestone

我的意思是,我会把你整个播客系列中与所有人的对话,视为这些事物分布情况的展示。我不知道。Karpathy 的时间线是怎样的?Demis 的时间线呢?所以并不是每个人都认为时间线是三年。

Dwarkesh Patel

但原因各有不同,我很好奇你的原因是什么。

Adam Marblestone

我的原因是什么?我不知道,我只是在看你的播客。我试图理解这个分布。我并没有一个非常强烈的观点说大语言模型做不到。

Dwarkesh Patel

但关键问题是数据效率,还是……?

Adam Marblestone

我认为部分原因只是它奇怪地与所有这些大脑相关的东西不同。所以直觉上,它奇怪地与所有这些大脑相关的东西不同,我有点在等待那个开始更像大脑相关的东西出现。我认为,如果 AlphaZero、基于模型的强化学习以及十年前正在研究的所有其他东西,已经给了我们 GPT-5 级别的能力,那么我会说:“哦,哇,我们既处于正确的范式中,又先验地看到了结果。所以我的先验和我的数据是一致的。”而现在的情况是:“我不知道我的数据到底是什么。看起来相当不错,但我的先验有点奇怪,所以我对此没有非常强烈的看法。”

所以我认为,有一种可能性是,几乎所有其他正在进行的科学研究都会在某种程度上变得多余。但我对此并不抱很高的概率。我估计我的时间线可能更接近十年左右的范围。如果是这样,我认为在一种世界里,我们硬盘上存有连接组,并且我们理解了操控子系统架构,这与另一种世界之间可能存在差异。我们已经比较了老鼠、鼩鼱和小型灵长类动物等在奖励函数、成本函数、架构等方面哪怕是最基本的特性。

德瓦克什·帕特尔

这在十年内可行吗?

亚当·马布尔斯通

我认为这必须是一次非常大规模的推动。

德瓦克什·帕特尔

需要多少资金?与我们现在的情况相比如何?

亚当·马布尔斯通

我认为,这需要以非常协同的方式投入数十亿美元级别的资金。

德瓦克什·帕特尔

目前在这方面投入了多少?

亚当·马布尔斯通

那么,如果我只谈我们在连接组学方面正在进行的一些具体工作……E11 Bio 是我们连接组学方面的主要项目。他们正试图将连接组脑图谱绘制技术的成本降低几个数量级。威康信托基金在一两年前发布了一份报告,称要获得一个老鼠大脑,第一个老鼠大脑连接组将是一个耗资数十亿美元的项目。E11 的技术,以及该领域的一系列努力,正试图将单个老鼠连接组的成本降低到数千万美元。

那是一个哺乳动物的大脑。人类大脑大约要大 1000 倍。如果对于老鼠大脑,你可以通过技术将成本降到 1000 万、2000 万或 3000 万美元,那么如果只是简单地按比例放大,现在仅绘制一个人脑仍然需要数十亿美元。你能超越这个限制吗?你能以低于 10 亿美元的成本绘制一个人脑吗?但我不确定你是否需要人类大脑中的每一个神经元。

例如,我们想要完整绘制一只小鼠的大脑、人类的大脑控制子系统,以及几种具有不同社会本能的哺乳动物的完整大脑。因此,通过一系列技术推动和大量协同努力,如果集中力量攻关,在数亿到数十亿美元量级的投入下,确实能取得重大进展。

德瓦克什·帕特尔

连接组(connectome)的定义是什么?想必它不是一个自下而上的生物物理学模型。那么,它是否只是能够估算大脑的输入输出?其抽象层次是怎样的?

亚当·马布尔斯通

你可以给出不同的定义,而其中一个很酷的地方在于……连接组学的标准方法是使用电子显微镜和极薄的大脑组织切片。这基本上是一种标记技术。细胞膜会显现出来,大量散射电子,而其他物质则散射较少。但你无法看到分子层面的许多细节,比如突触的类型,以及不同分子组合和特性所形成的不同突触。

E11 以及该领域的其他一些研究已经转向了光学显微镜范式。使用光学方法,光子不会损伤组织,因此你可以冲洗样本并观察脆弱、精细的分子。因此,通过 E11 的方法,你可以获得一个“分子注释的连接组”。这不仅仅是知道谁通过什么突触与谁相连,还包括突触处存在哪些分子?那是什么类型的细胞?

分子注释的连接组,这并不完全等同于拥有突触权重。这也不完全等同于能够模拟神经元,并说出拥有这些分子和连接会产生什么功能后果。但你也可以进行一定程度的活性映射,并尝试将结构与功能关联起来。基本上就是训练一个机器学习模型,根据连接组来预测活性。

德瓦克什·帕特尔

从人类基因组计划中我们可以汲取哪些教训?一种看法是,这是一个错误,你不应该花费数十亿美元来绘制一个基因组。相反,你应该只投资于那些如今已让我们能够以数百美元成本绘制基因组的技术。

亚当·马布尔斯通

嗯,乔治·丘奇是我的博士导师,他曾指出,第一个基因组测序耗资约30亿美元,大约每碱基对1美元。后来,美国国家人类基因组研究所基本上正确地构建了资助流程。他们让多家公司相互竞争以降低成本。接着,成本在10年内下降了约一百万倍,因为他们将范式从宏观化学技术转变为这些单个DNA分子——这些分子会在显微镜下形成一小簇DNA分子,而相机的每个像素每次只能看到几个DNA分子。这让你能够以并行方式,同时观察不同的DNA片段。因此,他们将测序过程并行化了数百万倍。这就是成本降低数百万倍的原因。

从电子显微镜转向光学连接组学,甚至未来可能出现的其他类型连接组学技术,我们认为应该会出现类似的模式。这就是为什么E11,即焦点研究组织,从技术开发入手,而不是一开始就说我们要做人类大脑之类的东西,然后蛮力推进。我们说的是,用新技术来降低成本。但这仍然是一件大事。即使有了新的下一代技术,你仍然需要花费数亿美元用于数据收集。

德瓦克什·帕特尔

这将由慈善机构、政府还是投资者资助?

亚当·马布尔斯通

这在很大程度上尚未确定,并且在某种意义上,随着我们讨论的进行,情况也在不断变化。我听到一些传言,说可能有与连接组学相关的公司正在组建。到目前为止,E11一直由慈善机构资助。美国国家科学基金会刚刚发布了Tech Labs的征集令,这在一定程度上受到FRO的启发或与之相关。你可以建立一个技术实验室,与我们一起去绘制小鼠大脑图谱,这将在非营利、开源框架下,由慈善机构和政府共同资助。但公司能加速这一进程吗?你能在公司背景下,将连接组学与AI可信地联系起来,并为此获得投资吗?这是有可能的。

德瓦克什·帕特尔

我的意思是,训练这些 AI 的成本正在急剧上升。如果你能讲一个故事,不仅是我们会解决某些安全问题,而且一旦我们做到了,我们还能告诉你 AI 是如何运作的……你应该去这些 AI 实验室,直接说:“把你们 2030 年预算的百分之一给我。”

Adam Marblestone

七八年前我其实尝试过一点,但当时没什么人感兴趣。也许现在会有兴趣了。但我们一直在讨论的所有这些,聊起来确实很有趣,但归根结底只是推测。比如,大脑能量效率高的真正原因是什么?它是在做真正的推理,还是摊销推理,或是其他什么?这些问题神经科学都能回答。虽然会很困难,但确实是可回答的。所以,如果只需要花几十亿美元就能真正全面地解决这个问题,在我看来,在 GPU 等投入高达数万亿美元的宏大背景下,做这笔投资其实是合理的。

Dwarkesh Patel

此外,过去一年里成立了许多实验室,它们以数十亿美元的估值融资,做的事情相当可信,但并不是那种“我们下个季度的年化经常性收入会是多少多少”的模式。而是说,我们要去发现新材料,并且——

Adam Marblestone

是的,登月型初创公司,或者亿万富翁支持的初创公司。我认为登月型初创公司与 FRO 是一脉相承的。FRO 是一种引导慈善支持、并确保其开源公益性的方式,此外还可能具备特定 FRO 的其他属性。但没错,亿万富翁支持的初创公司,如果它们能瞄准正确的科学方向,完全正确的科学方向。

我认为有很多方式可以创办登月式的神经科学公司,但这些方式永远无法让你获得连接组。比如,“哦,我们要上传大脑”之类的,但实际上永远得不到小鼠连接组这类东西。这些是你需要获得科学真相的基础性东西。有很多方式会让一家登月式公司走偏,不去做真正的科学。但也可能有方式让公司或大型企业实验室参与进来,并真正正确地做到这一点。

德瓦克什·帕特尔

这让我想起你五年前在一次讲座中提出的一个想法。你想解释一下行为克隆吗?

亚当·马布尔斯通

实际上这很有趣,因为我第一次看到这个想法,可能是在格温的一篇博客文章里。总会有格温的博客文章。现在已经有学术研究方面的努力,以及一些新兴的公司层面的尝试,试图去做这件事。

通常,假设我在训练一个图像分类器之类的。我给它看猫和狗的图片,它们带有“猫”或“狗”的标签。我有一个神经网络,它应该预测“猫”或“狗”这样的标签。每个标签你放入的信息量是有限的,只是“猫”或“狗”而已。

如果我还要求它“预测当我看到一只猫或一只狗以及其他所有东西时,我的神经活动模式是什么样的”,那会怎样?如果你把它作为一个辅助损失函数或辅助预测任务加进去,这会不会塑造这个网络,让它了解人类关于猫和狗的知识,并以一种与大脑表征方式以及大脑表征事物的表征维度或几何结构相一致的方式来表征这些信息,而不仅仅是拥有这些标签?这会不会让它泛化得更好?这会不会让它拥有更丰富的标签?

这听起来当然极具挑战性。生成大量带标签的猫图片非常容易,Scale AI 之类的公司就能做到。但要生成大量与你想训练 AI 执行的任务相对应的大脑活动模式,就要困难得多。但话说回来,这仅仅是神经科学在技术上的局限性。如果每一部 iPhone 同时也是大脑扫描仪,你就不会有这个问题,我们就能用大脑信号来训练 AI 了。只是技术发展的顺序是,我们先有了 GPU,然后才出现了便携式大脑扫描仪。

德瓦克什·帕特尔

这里的机器学习类比是什么?你具体在做什么?因为当你进行知识蒸馏时,你仍然是在观察所有层级的最终 log probs——

亚当·马布尔斯通

如果你将一个模型蒸馏到另一个模型中,那是特定的一回事。你只是试图将一个模型复制到另一个模型中。我认为我们并没有一个完美的方案来蒸馏大脑。要蒸馏大脑,你需要一个复杂得多的脑机接口。也许你也能做到这一点。你可以构建替代模型。安德烈亚斯·托利亚斯等人正在利用大脑活动数据做一些神经网络替代模型的工作。与其让你的视觉皮层进行计算,不如直接使用替代模型。所以你在某种程度上是在将你的视觉皮层蒸馏到一个神经网络中。这是一种蒸馏。

这里做的事情略有不同。这基本上就是说,我增加了一个辅助……我认为这是一种正则化,或者说我认为这是增加了一个辅助损失函数,它平滑了预测任务,使其始终与大脑的表征方式保持一致。这可能有助于你处理对抗性样本之类的问题。

德瓦克什·帕特尔

但你具体在预测什么?你在预测大脑的内部状态吗?

亚当·马布尔斯通

是的。所以除了预测标签之外——比如一个标签向量,是猫,不是狗,是,不是船,一个 one-hot 向量或者类似的东西,表示“是,这是猫”,而不是其他成千上万的类别,我们在这个简单例子里这么说——你还要预测一个向量,这个向量包含了所有这些大脑信号的测量值。

所以格温,他很久以前写过一篇博客文章,大意是:“哦,这是一个中间阶段。我们讨论全脑仿真,讨论AGI,讨论脑机接口。我们还应该讨论这种基于大脑数据增强的东西,它基于你所有的行为进行训练,同时也训练来预测你的一些神经模式。”

德瓦克什·帕特尔

你的意思是,学习系统已经在通过操控系统做这件事了?

亚当·马布尔斯通

是的,我们的大脑,我们的学习系统也必须将预测操控子系统作为一个辅助任务。这有助于操控子系统。现在,操控子系统可以访问那个预测器,并利用它构建一个很棒的奖励函数。

01:23:28 – 数学自动化会带来什么价值?

德瓦克什·帕特尔

另外,你是Lean的董事会成员,Lean是数学家用来证明定理等的形式化数学语言。显然,现在有很多关于AI自动化数学的讨论。你怎么看?

亚当·马布尔斯通

嗯,我认为数学的某些部分似乎已经很有望实现自动化。首先,Lean在微软和其他地方已经开发了好几年。它已经成为汇聚型重点研究组织之一,旨在推动更多的工程投入和关注。

所以Lean是一种编程语言,你不需要用纸笔来表达你的数学证明,而是用这种编程语言Lean来表达。然后到最后,如果你这样做,它是一种可验证的语言,你可以点击“验证”,Lean会告诉你,你的证明结论是否完全正确地遵循了你的证明假设。所以它能自动检查证明是否正确。

仅凭这一点,对数学家之间的协作等情况就很有用。如果我是一个业余数学家,想为某个证明添砖加瓦,陶哲轩不会轻易相信我的结果。但如果 Lean 说它正确,那它就是正确的。所以这既让协作变得容易,也让证明的正确性能够成为强化学习中的奖励信号,非常符合基于验证的强化学习(RLVR)。形式化的数学证明——所谓形式化,就是用 Lean 这类语言表达且可验证——现在可以机械地验证了。这就成了一个完美的 RLVR 任务。

我认为这条路会一直走下去,似乎已经有一家估值十亿美元的公司 Harmonic 以此为基础。AlphaProof 也是基于此。还有几家正在崛起、非常有趣的公司。我认为,用 RLVR 疯狂攻克数学证明这个问题是行得通的,我们将能够拥有搜索并找到证明的系统,就像我们有 AlphaGo 之类能搜索围棋下法的系统一样。有了那个可验证的信号,它就能奏效。

那么这能解决数学问题吗?还有一部分涉及提出有趣的新猜想。数学中关于“什么是有趣的”这一概念组织仍然存在。你最初是如何提出新的定理表述的?甚至包括在非常高的层面上分解你用来证明的策略。我认为这将转移负担,让人类不必再处理数学中大量的机械性部分。验证引理和证明,检查这篇论文中的陈述是否与那篇论文完全一致,诸如此类的事情,都会自动完成。

如果你真的认为我们会得到我们一直在谈论的所有这些东西,那么真正的通用人工智能(AGI)也应该能够提出猜想。Bengio 有一篇论文,更像是一篇理论性论文。可能还有大量其他关于此的论文正在涌现。是否存在一个针对好的解释或好的猜想的损失函数?这是一个相当深刻的问题。

一个真正有趣的数学证明或命题,可能在于它能压缩大量信息,并对许多其他定理产生深远影响。否则,你就得通过冗长复杂的被动推理来证明那些定理。而在这里,如果你有了这个定理,且该定理正确,你就能通过简短的被动推理推导出所有其他定理。它是一个简短紧凑的陈述,就像一个强大的解释,能解释其余所有数学内容。数学的一部分工作,正是制造这些能解释其他事物的紧凑之物。

德瓦克什·帕特尔

这有点像该命题的柯尔莫哥洛夫复杂度之类的概念。

亚当·马布尔斯通

没错,就是给定你知道这个命题后,生成所有其他命题的复杂度,或者类似的东西。或者,如果你加入这个命题,它会如何影响其余证明网络的复杂度?所以,你能设计一个损失函数,加上“哦,我希望这个证明是一个影响力极强的证明”这样的条件吗?我认为有些人正在尝试研究这个。也许你可以把创造力部分自动化。

如果你拥有真正的通用人工智能,它能做人类能做的一切事情。所以它也能做创造性数学家所做的事。但除此之外,我认为仅仅对证明大量使用强化学习验证推理(RLVR),对数学家来说将是一个非常实用的工具。它会极大地加速数学发展并改变其面貌,但不一定立刻改变数学的一切。

我们能否得到黎曼猜想的机械化证明,或者类似的东西?也许吧,我不知道。我不清楚搜索这些问题的难度细节,而且我不确定有谁能完全预测这一点,就像我们无法精确预测围棋何时会被解决一样。

我认为它将拥有大量非常酷的实际应用。所以,你想要做的一件事就是拥有可证明稳定、安全、不可破解的软件。你可以为软件编写数学证明,并说:“这段代码,它不仅通过了这些单元测试,而且我可以从数学上证明,它无法以这些方式被破解,或者无法篡改内存”,或者黑客利用的这类东西,或者它具备这些属性。你可以使用同样的 Lean 和同样的证明来做形式化验证的软件。

我认为这将成为网络安全领域一个非常强大的工具,与所有其他涉及 AI 破解世界之类的事情都相关。而且,如果你能证明黎曼猜想,你也就能够证明关于极其复杂软件的极其复杂的事情。然后你就可以让大语言模型说:“给我合成一个我可以证明其正确性的软件。”

德瓦克什·帕特尔

为什么可证明编程语言没有因为大语言模型而流行起来?

亚当·马布尔斯通

我认为它正在开始流行。一个挑战——我们实际上正在为此孵化一个潜在的重点研究组织——是规范问题。数学家们知道他们想要形式化哪些有趣的定理。假设我有一些参与运行电网或类似东西的代码,并且它有一些安全属性,那么这些属性的形式化规范是什么?电网工程师只是做出了这个东西,但他们不一定知道如何从中提取出形式化规范。而且,想出一个你想要的代码规范并不一定容易。人们不习惯提出形式化规范,并且也没有很多工具来做这件事。

所以,你还面临这个用户界面加 AI 的问题:我应该指定哪些安全规范?这是不是我想要的规范?所以存在一个规范问题,而且它一直非常复杂和困难。但仅仅在最近很短的时间内,大语言模型才能够生成对数学家有用的、可验证的证明,并且开始能够在软件验证、硬件验证方面做到一定程度。

但我认为,如果你对未来几年的趋势进行推演,情况很可能会发生逆转。形式化方法——整个形式化方法或形式化验证、可证明软件这个领域——它几乎是编程语言等更理论化领域中的一个古怪的冷门分支,通常带有浓厚的学术色彩。尽管DARPA曾有一个项目,制造出了可证明安全的四轴直升机之类的东西。

德瓦克什·帕特尔

针对什么……被精确证明的性质是什么?不单指那个特定项目,而是泛指。因为显然,软件/硬件会因各种原因出现故障。

亚当·马布尔史东

你可以说,内存这一部分(应该是用户可访问的部分)发生的事情,无论如何都不会影响内存另一部分发生的事情,诸如此类。

德瓦克什·帕特尔

所以有两个问题。一是这有多大用处?二是,作为一名数学家,这能带来多大的满足感?如果这种应用——证明软件或硬件具有某些性质——能够成功,那显然会非常有用。但从纯粹的角度看……我们是否真的能搞懂数学?我的感觉是,是否存在这样一种情况:发现某个构造与另一个不同领域的构造交叉映射,或者发现“哦,这个引理,如果你重新定义这个术语,它仍然满足我对这个术语的原本意图。但之前推翻它的反例不再适用了。”这种数学中发生的辩证性过程。

亚当·马布尔史东

软件会取代这个过程吗?

德瓦克什·帕特尔

是的。这种纯粹数学的价值,有多少实际上来自于提出全新的思考问题的方式,并将其映射到一个完全不同的表征上?我们有这样的例子吗?

亚当·马布尔史东

我不知道。我有点觉得这就像当年每个人都得写汇编代码那样。那时能诞生的有趣酷炫初创公司数量要少得多。能从事的人更少,进展更艰难、更缓慢、更孤独。你会遇到更多虚假的失败——不是因为你的核心概念对不对,而是因为你对汇编代码的某个地方没搞懂。协作也更困难,诸如此类。所以我认为这会是件大好事。

有人担心,如果不学习证明中的机械性部分,你就无法产生那些支撑更具概念性、创造性部分的直觉。

德瓦克什·帕特尔

汇编语言也是同样道理。

亚当·马布尔斯通

没错。那么这在什么时候适用呢?对于氛围编程,人们是不是没有在学习计算机科学?还是说他们一边氛围编程,一边同时看着大语言模型向他们解释这些抽象的计算机科学概念,而这一切都在更快地发生?他们的反馈循环更快了,而且因为氛围编程,他们学到了更多抽象的计算机科学和算法知识。我不知道,这并不明显。这可能与用户界面及其周围的人类基础设施有关。

但我想,有人担心人们不学习机制,因此无法建立扎实的直觉。不过我的直觉是,这极其积极。确切地说,净效果会有多大用处,或者我们关心的数学突破——甚至数学突破——会在多大程度上发生?我不知道。

另一件我觉得很酷的事是普及性的问题。好吧,这听起来有点老套。没错,更多人能做数学了,但谁在乎呢?但我认为有很多人可能拥有有趣的想法。比如量子引力理论之类的。是的,我们中的某个人可能会提出量子引力理论,而不是一个科班出身的物理学家。就像史蒂夫·伯恩斯那样,他正在阅读神经科学文献,而他本人并没有在神经科学实验室待过太多时间。但他能够综合梳理神经科学文献,然后提出:“哦,学习子系统、调控子系统。这说得通吗?”从某种意义上说,他是个局外神经科学家。那么,能否出现局外弦理论家呢?因为数学计算都由计算机替他们完成了。这是否会为弦理论带来更多创新?也许会的。

德瓦克什·帕特尔

有意思。好吧,如果这种方法奏效,并且你关于大语言模型并非最终范式的判断是正确的,假设在那个世界里,至少需要 10 年才能达到最终范式。那么就有这样一个有趣的科幻前提……陶哲轩今天发了一条推文,大意是:“这些模型就像自动化的机灵,但不是自动化的智能。”你可以对这里的定义吹毛求疵。但如果你拥有自动化的机灵,并且有某种筛选方法——如果你能形式化并证明大语言模型所说的内容,你是可以做到的——那么你就可能进入这样一种局面:量变本身就能产生质变。

那么,世界上哪些领域可以被纳入这种可证明的符号化表示中呢?在一个通用人工智能(AGI)极其遥远的未来世界里,也许将大语言模型所做的一切,或者几乎一切,都转化为超级可证明的陈述,是合理的。这样一来,大语言模型就能真正地相互叠加构建,因为它们所做的一切都是超级可证明的。

也许这只是因为未来会有数十亿个智能体四处活动。即使它们都超级智能,未来 AGI 文明彼此协作的唯一方式,就是能够证明每一步操作。它们只是在暴力地批量产出……这就是“木星大脑”正在做的事情。

亚当·马布尔斯通

它是一种通用语言,是可证明的。从“你是在试图利用我,还是给我发送一条试图有效入侵我大脑的信息?”这个角度来看,它也是可证明的。你是在试图对我施加社会影响吗?还是你实际上只是向我发送我需要的信息,并且仅此而已?

所以,davidad,他现在是英国 ARIA 的项目主管,他设计了一整套 ARPA 风格的项目,一种严重依赖可证明安全属性的受保护 AI。你能将证明应用于……你能拥有一个世界模型吗?但这个世界模型实际上并非由神经元激活来定义,而是由方程式来定义。这些方程式可能非常复杂,但如果你能凭借巧思和自动化的智慧,变得极其擅长自动证明这些东西……你能拥有明确可解释的世界模型,而不是神经网络世界模型,并基本上回归到符号方法吗?仅仅因为你拥有了极其强大的证明能力?是的,我认为这是一个有趣的愿景。我不知道在未来 10 年内这个愿景是否会实现,但我认为思考这个问题真的很有意思。

即使在数学领域,我的意思是,陶哲轩正在做一些工作,其重点不在于能否证明单个定理。而是说,让我们批量证明所有定理,然后研究已证明定理的集合整体的性质。哪些被证明了,哪些没有被证明?好吧,这就是所有定理的全景图,而不是一次只看一个定理。

01:38:18 – 大脑的架构

德瓦克什·帕特尔

说到符号表征,我本来想问您的一个问题是,大脑是如何表示世界模型的?显然最终是通过神经元来实现,但我指的不是非常功能性的层面。我指的是概念层面,它是类似于神经网络隐藏状态的东西,还是更接近某种符号语言?

亚当·马布尔斯通

我们不知道。对此有一定程度的研究。有一些像面部补丁神经元这样的东西,它们以有趣的方式几何组合,表征面部的某些部分。那是关于几何和视觉的。对于其他更抽象的事物也是如此吗?有一种认知地图的概念。啮齿动物海马体需要学习的很多东西是位置细胞,以及啮齿动物下一步要去哪里,在那里是否能得到奖励?这非常几何化。我们是否用空间地图的抽象版本来组织概念?

有一些问题是关于我们能否进行真正的符号运算。我能否在大脑中有一个寄存器,无论该变量的内容是什么,都能将一个变量复制到另一个寄存器?这就是变量绑定问题。基本上,我不知道我们是否拥有那种机制,还是说它更像是成本函数和架构,使得其中一些功能近似地涌现出来,但也许它也会在神经网络中涌现?有很多有趣的神经科学研究试图研究这个问题,即表征是什么样的。

德瓦克什·帕特尔

但您的直觉是什么?

亚当·马布尔斯通

嗯,我的直觉是那会是一团巨大的乱麻,我们应该关注架构、损失函数和学习规则。我不指望里面会是很整洁的。

德瓦克什·帕特尔

也就是说它不是那种符号语言类型的东西?

亚当·马布尔斯通

是的,可能没那么符号化。但其他人有非常不同的看法。

德瓦克什·帕特尔

另一个随机问题,说到绑定,感觉存在一种体验是怎么回事?你大脑的所有部分,它们在建模非常不同的事物,有不同的驱动力,并且至少大概感觉此刻正有一种体验在发生。同时,在时间维度上,你感觉……

亚当·马布尔斯通

嗯,这个问题我基本也毫无头绪。我不知道。最近 Max Hodak 一直在做关于这个的演讲。他是另一位非常硬核的神经科学、神经技术领域的人。我之前提到的与 Doris 相关的事情,听起来可能也与这个问题有些关联。但说实话,我认为没人知道答案。这甚至可能涉及新的物理学。

Dwarkesh Patel

这里还有另一个可能尚无答案的问题。持续学习,它是否是某种极其基础的东西的产物,甚至是在学习算法层面?你可以说:“你看,至少我们在神经网络中做反向传播的方式是,你冻结权重,有一个训练期,然后你冻结权重。所以你需要这种主动推理或其他学习规则才能实现持续学习。” 或者你认为这更多是架构问题,以及记忆究竟是如何存储的,你基本上拥有哪种联想记忆?

Adam Marblestone

所以持续学习……我不知道。在架构层面,海马体可能在做一些有趣的事情。人们长期以来一直这么认为。它存储了哪些类型的序列?它是如何组织、表征这些序列的?它是如何回放这些序列的?它回放的是什么?记忆巩固究竟是如何运作的?它是否利用来自海马体的回放或记忆来训练大脑皮层?可能包含一些这方面的机制。

可能存在多种时间尺度的可塑性或巧妙的学习规则,可以同时存储短期信息并对其进行反向传播。神经元可能同时在做几件事:一些快速的权重可塑性和一些较慢的可塑性,或者突触具有多种状态。我的意思是,我不知道。从神经科学的角度来看,我不确定自己是否见过能非常清晰地解释持续学习成因的东西,也许除了那个海马体巩固大脑皮层的系统巩固理论。有些人认为这是其中的重要一环,但我们仍未完全理解其中的细节。

Dwarkesh Patel

说到快速权重,大脑中是否存在某种类似于我们在神经网络中看到的参数与激活值之间的区分?具体到 Transformer 架构,我们有一个概念:部分激活值就是之前 token 的键向量和值向量,这些向量会随时间累积。

所谓的快速权重是指,每当出现一个新 token 时,你会用这些激活值去查询它们,但显然你无法用这些激活值去查询网络中其他属于内置权重的参数。大脑中是否存在某种类似的区分?

Adam Marblestone

我不知道。我的意思是,我们确实有权重和激活值。但能否以这些巧妙的方式使用激活值,比如不同形式的实际注意力,就像大脑中的注意力……这是基于“我正在努力集中注意力”吗……我认为大脑中可能有好几种不同的实际注意力。我想关注视觉皮层的这个区域。我想关注其他区域中由这个区域内容触发的内容。还有仅仅基于反射之类的注意力。

所以我不确定。大脑不仅有皮层,还有丘脑。丘脑也以某种方式参与信息的传递或门控。存在皮层-皮层连接。皮层区域之间也有一些连接会经过丘脑。有没有可能这个系统在进行某种匹配、约束满足,或者在这里的键与那里的值之间进行匹配?它有没有可能做类似的事情?也许吧。我不知道。这都是皮层-丘脑系统架构的一部分。我不清楚它有多像 Transformer,或者是否存在与那种注意力类似的东西。如果能搞清楚,那会很有趣。

Dwarkesh Patel

我们得给你十亿美元,这样你就能再来上播客,告诉我大脑到底是怎么工作的了。

Adam Marblestone

我主要只是做数据收集。这是真正无偏的数据收集,这样其他所有人就能去解答这些问题了。

Dwarkesh Patel

也许最后一个问题是,你从“差距地图”中学到的最有趣的东西是什么?或许你想先解释一下什么是“差距地图”。

亚当·马布尔斯通

在孵化并构思这些“聚焦研究组织”——这些我们一直争取慈善家、如今也包括政府机构资助的非营利性初创式登月计划——的过程中,我们与许多科学家进行了交流。有些科学家的想法是:“这是我研究生接下来要做的事。这是我觉得有趣的方向。探索这些真正有趣的假设空间,以及我们一直在讨论的各种各样的事情。”

另一些科学家则说:“这里存在一个差距。我需要这样一块基础设施。在我的实验室里,无论是我带的研究生组合,还是我通过传统资助与其他实验室进行松散合作,都无法得到它。我需要一个组织有序的工程团队,来建造一个微型版的哈勃太空望远镜。如果我能造出那个哈勃太空望远镜,那么我就能为所在领域的其他所有研究人员扫清障碍,或者为某条技术进步路径铺平道路,就像哈勃太空望远镜提升了所有天文学家的研究水平、改善了他们的工作一样。”但这本身并非一项天文学发现。它只是意味着,你必须把那个巨大的镜子和CCD相机送入太空,并组织起所有的人员和工程工作来完成这件事。我们与科学家讨论的一些事情,就属于这种类型。

“差距地图”就是这些事项的一个列表,我们称之为“差距地图”。我认为它实际上更像是一张“基础能力地图”。所有这些“迷你哈勃太空望远镜”式的东西是什么?然后我们将其组织成不同的“差距”,以帮助人们理解或搜索这些内容。

德瓦克什·帕特尔

你发现的最令人惊讶的事情是什么?

亚当·马布尔斯通

我想我以前谈到过这一点,但其中一个方面就是它的整体规模或形态之类的东西。它涉及几百项基础能力。如果每一项都相当于一个深度科技初创公司规模的项目,那也就只需要几十亿美元左右。如果每一项都只是一轮A轮融资,那也就……填补这些空白并不需要万亿美元级别的资金,比那要少。所以这是其中一点。也许我们当时做了这样的假设,结果也确实如此。这并非真正全面,它其实只是对我们与科学家们多次讨论内容的一种总结方式。

我确实认为,在整体进程中,像Lean这样的东西实际上令人惊讶,因为我最初是从神经科学和生物学出发的,很明显存在这些“组学”。我们需要基因组学,但也需要连接组学。我们可以改造大肠杆菌,但也需要改造其他细胞。生物基础设施中有一些相对明显的部分。我并没有意识到数学证明基础设施也是一回事,而这是从尝试做这件事的过程中涌现出来的。

所以我期待看到其他领域,在那里解决这个问题实际上并不是那么困难的智力挑战。它可能稍微类似于AI研究人员只需要GPU之类的东西、专注力以及真正优秀的PyTorch代码就能开始做这件事。哪些领域需要或不需要这些?那些已经获得巨额投资的领域,它们是否仍然需要其中一些?它们是否仍然存在某些空白,还是说只有那些更被忽视的领域才有?我们甚至在真正的天文学、尚未被探索过的望远镜领域发现了一些有趣的空白。也许是因为,如果你要做一个超过临界规模的项目,那么你就必须做一个真正的大型项目,而这在联邦机构中会是一个更官僚化的流程。

德瓦克什·帕特尔

我想如今你在科学的每一个领域都需要规模。

亚当·马布尔斯通

是的,我认为在科学的许多领域都需要规模。但这并不意味着小规模的工作不重要。也不意味着创造力、偶然发现以及大学里每个学生各自探索完全不同的方向或论文就不关键。但我认为,在几乎每一个科学领域——甚至包括数学,这听起来很疯狂——都缺少一定规模的可扩展基础设施。因为我原以为数学家只需要白板,但实际上他们需要 Lean。他们需要可验证的编程语言之类的东西。我之前并不知道这一点。

德瓦克什·帕特尔

太棒了。亚当,这非常有趣。感谢你来做客。

亚当·马布尔斯通

非常感谢你。这是我的荣幸。

德瓦克什·帕特尔

人们在哪里可以找到你的内容?

亚当·马布尔斯通

荣幸之至。现在最简单的方式……我的 adammarblestone.org 网站目前似乎宕机了。但 convergentresearch.org 可以链接到我们一直在做的很多内容。

德瓦克什·帕特尔

而且你还有一个很棒的博客,Longitudinal Science。

亚当·马布尔斯通

是的,Longitudinal Science,在 WordPress 上。

德瓦克什·帕特尔

太棒了。

亚当·马布尔斯通

非常感谢你。这是我的荣幸。

来源:Dwarkesh Patel:Podcast & Blog(RSS) · dwarkesh.com