跳到正文
北京时间
原文
The Verge:AI(RSS)· Nilay Patel·· 2026-06-08精选AI 评分79

微软AI CEO:超级智能即将到来,但不会取代你的工作

Microsoft’s AI chief says superintelligence is near, but won’t take your job

AI 导读

微软AI CEO Mustafa Suleyman在Decoder访谈中表示,超级智能即将到来,但不会导致大规模失业。他透露微软与OpenAI于去年10月签署新合同,巩固合作关系的同时,微软获准独立追求超级智能。微软已组建超级智能团队、训练前沿模型,并于本周Build大会上发布7个全模态新模型。他批评Anthropic将Claude描述为有意识的做法,认为消费者产品需要足够好才能克服公众对AI的负面情绪。

推荐理由

Mustafa 首次系统阐述微软的「自给自足」路线,一边甩开 OpenAI 一边定义「人文主义超级智能」,开发者和产品人都该听听这段博弈论。

正文 · AI 翻译
A photo illustration of Microsoft AI CEO Mustafa Suleyman.

今天我要和 Mustafa Suleyman 聊聊,他是 Microsoft AI 的 CEO。其实我打算把今天的开场白说短一点——这周我在我妻子家的农场工作,你在视频里会看到,而且这一期节目真的是火力全开。

我们聊了方方面面,从 Mustafa 训练新模型的方法,到他对 Anthropic 把 Claude 说得好像有意识一样的批评。当然,我们也聊了 Microsoft 与 OpenAI 的关系、Mustafa 如何看待当下围绕 AI 的各种负面民调和政治阻力,以及是否有哪款消费级产品足够好,能够扭转这种局面。

就像我说的,这一期火力全开。

好:Mustafa Suleyman,Microsoft AI 的 CEO。我们开始吧。

Mustafa Suleyman,你是 Microsoft AI 的 CEO。欢迎再次回到 Decoder。[

很高兴再次和你在一起。

我非常期待和你聊。我们上一次的对话是我最喜欢的对话之一——关于 AI、它应该让我们有什么感受,以及它的用途是什么——在我们做过的所有对话中都是如此。

微软发生了一些重大变化,也许还有一些非常重要的、关于人们如何看待 AI 的重新语境化,我想特别和你聊聊这些。然后是 Microsoft Build,微软的大型开发者大会,发布了许多新公告以及许多关于计算机用途、以及它们或许应该走向何方的重要构想,我想深入探讨一下。

让我们从头说起。这是一些深度的Decoder内容,在理解其余所有部分之前,先弄懂这些很重要。自从你加入 Microsoft 以来,你重组了那里 AI 的运作方式。你的角色也发生了变化。我上次和你交谈时,你负责的是一系列消费级产品。那之后已被搁置。你现在正在训练新模型;你身处前沿。

解释一下 Microsoft AI 现在是如何组织的,以及它在 Microsoft 内部是如何组织的。

我想,过去 15 到 18 个月左右,我们一直在经历这段重新建立与 OpenAI 关系的旅程,这花了一些时间。我认为它最终促成了我们去年 10 月完成的一份新合同。那里面有非常多的不同条款,包括巩固并延长合作伙伴关系,但至关重要的是,让我们能够独立追求超级智能,同时继续购买和授权他们的模型。

所以从十月开始,我一直在组建超级智能团队,构建足够规模的集群来训练前沿模型,并招募一支专注于超级智能的团队。这对我们来说是一次相当大的转变,因为它让我能够专注于超级智能这一使命,而这一切最终汇聚成了我们本周在 Build 上宣布的几件事。我们在所有模态等方面共有七个新模型。所以这是一次相当大的转变,我认为这经过了长期的规划,如今能够入局并在未来几年追逐绝对前沿,对我们来说是一种极大的解脱。

这是你被微软聘用时就有的计划吗?

过去 18 个月里,这确实是既定计划。我的意思是,我认为与 OpenAI 的关系经历了许多起起伏伏。从很多方面来看,我认为它将成为历史上最成功的合作关系之一。它对 OpenAI 来说是好事,对微软来说也是好事,而所有良好的关系都会演变,我认为这只是我们演变过程中的下一个阶段。

让我具体问问你关于这种演变。我们刚刚都看到了 Elon Musk 与 OpenAI 和 Sam Altman 之间的庭审。微软参与了那场庭审,从某种意义上说,微软的律师时不时会站起来说:“而我们当时并不在场。”然后有人会说没错,事情就这样了。

但显然,那场庭审中曝光的内容,以及这段时间以来一直很清楚的一点是,最初的想法是 OpenAI 会是一家研究实验室,提供模型,而 Microsoft 会打造产品。Microsoft 拥有市场推广方面的专长;它拥有企业级市场的专长,它当时正试图以各种方式重新在消费级市场站稳脚跟。这将是一次平台级转变,研究工作会由 OpenAI 负责,而产品工作会在 Microsoft 内部完成。

变化就出在这里:OpenAI 想要做越来越多的消费级产品。显然,鉴于你的新角色和新重心,Microsoft 越来越想要打造自己的模型。为什么会分裂?那段关系中是什么没有奏效?

我的意思是,我认为 OpenAI 由一支极其雄心勃勃的创始团队领导,还有 Sam 本人。所以自然而然地,随着他们开始获得更多发展势头并创造大量收入,他们看到了全栈发展的机会。所以不只是他们开始做消费级产品。显然,ChatGPT 极其成功。他们还开始建设自己的数据中心。他们开始打造自己的芯片。关于他们自己的消费级硬件设备,也有很多传言在流传。他们开始通过 ChatGPT Enterprise 将模型直接推向市场。所以沿着整个技术栈,在过去两、三、四年里,他们的业务范围在某种程度上远远超出了研究。自然而然地,Microsoft 也是如此。我的意思是,我认为这段合作现在已经持续了五、六年,而且还有四、五、六年要走。

同样,我们是全球最大的科技公司之一。全球 500 家最大公司中有 493 家将大部分数据存储在我们的系统上,使用 Azure、使用 M365 和 Teams。我认为人们常常低估了我们有多么庞大,以及我们在企业领域的覆盖范围有多么广。因此,从长远来看——我指的确实是五、六、七、十年——我们必须确保自己完全可持续,我们不仅仅是从别人那里拿来知识产权、稍加修改调整后投入生产用于我们的产品,而是我们真正能够自立自强,打造世界级的模型。

我的意思是,超级智能正在到来。我认为它近在眼前。因此,我认为它基本上将成为有史以来最有价值的技术。从长远来看,我们不可能永远在结构上依赖第三方来提供这些知识产权。

所以这就是那次转型,显然是由 OpenAI 等公司的董事会风波所引发的。但随后随着我和我的团队加入,我们开始构建这方面的工作,我们正处于这一转型之中。我认为我们处在一个很好的位置,因为我们可以采取相当稳健、审慎、长期最优的立场,这对 OpenAI 来说也是如此——我认为 OpenAI 从中获益巨大——对我们来说也是如此。

我想花些时间谈谈超级智能。我现在只是想先把它搁一搁,因为我还想再聊一轮,了解一下这个转型过程。

庭审中有那么一刻,微软 CEO Satya Nadella 发来一条挺有意思的消息,他说:“我不想成为 Intel,让 OpenAI 成为微软。”这话放在微软 CEO 自己嘴里说出来就特别好笑,他说的是:“我不想当那个供应商,让他们成为提供所有价值、攫取所有价值的平台,然后说不定我们就被换掉了。我不想让 ChatGPT 跑在 Azure 上,然后 OpenAI 拿走所有价值,然后说不定他们就把我们替换掉了。”就像当年 Windows 和 Intel 之间随着时间推移发生的那样。

这是一种醒悟吗?是 Nadella 主动来找你的吗?那次会面是什么样的——你说“好吧,OpenAI 出了董事会那档子事。我们得回到前沿,靠自己的两条腿站稳。”那次对话是怎样的,这个决定又是怎么做出的?

我的意思是,这显然是 Satya 的决定,也是 Amy、Brad 以及公司里许多其他人的决定。但我觉得这跟任何事情一样:这些都是公司里缓慢推进的变化,因为公司逐渐意识到我们所走的方向需要一点微调和调整。所以这种事在 11 月董事会事件之前很久就已经在发生了,我认为它只是随着时间不断累积——当你看到我们越来越多地直接竞争的各个战线所构成的格局,以及由此产生的所有紧张关系。但同时也要明白,这样的合作关系不会永远持续下去。

我的意思是,OpenAI 想成为一家市值万亿美元的上市公司,拥有惊人的营收,并且增长迅猛。他们希望拥有运营自由,能够从各种其他渠道购买算力、自建算力,并与任何他们想要的对象合作。所以这份合同是在两家公司规模、体量和需求平衡等方面都截然不同的时期签订的。我认为在那个时刻它是合理的,但后来变得非常清楚的是,这件事我们必须能够自己拥有和控制,并为自己的客户做到最好。

正如我所说,我们在企业级市场拥有令人难以置信的分发能力,我认为这在全世界都是无可匹敌的。因此我们必须确保为客户打造最好的产品。这与一家同时为消费者(通过 ChatGPT)和企业级进行联合优化,同时还要服务于超级智能的基础科学使命的公司看起来略有不同——后者包含一大堆不同的方向,这些方向相互重叠,但也可以说与消费者和企业级方向是正交的。自然而然,我认为合作伙伴关系就是这样演变的,它们会周期性地被重新调整。

是的,但据我所知,构建一个前沿模型非常昂贵。可靠的消息告诉我,这是一个非常昂贵的项目。到了某个时候,微软的 CFO Amy Hood 必须说:“是的,你拿到预算了。”那是什么时候发生的?那只是一条短信吗?还是开了一次会?跟我说说具体的细节。

我想,你看,我们大概是在去年上半年做出了这个决定,这显然影响了所有的合同谈判,而这些谈判随后都在 10 月得到解决并签署。这确实是一笔重大的投资,但我们有很长时间来完成它。我的意思是,我们已经在自身的自给自足使命上投入了大量资金。

我们的 Maia 200 芯片实际上是一款出色的芯片,举个例子,对吧?我们现在能够制造并出货一款比 GB200 便宜 30% 的芯片,用于我们自己的集群内部。而且既然我们现在可以用它来协同设计我们自己的模型,我们刚刚发布的 MAI-Thinking-1 模型实际上在每瓦性能上实现了 1.4 倍的提升,这还是在 Maia 200 带来的 30% 提升之上——一旦我们针对自己的任务对模型进行协同优化。

所以,确保你拥有并掌控自己的技术栈,并针对对我们最重要的用例——显然就是智能体编程、我们的开发者、我们的企业——端到端地主导整个协同设计工作,其价值显然能带来回报,足以证明我们未来几年必须进行的投资是合理的。

你说的是自给自足使命,这是一种非常委婉的说法,意思是你想自力更生;你想做自己的事。我听说微软内部对一句话有些争议,我的同事 Hayden Field 在一篇描述 Build 的文章中写道。我这就念一下。这是 Hayden 写的。这句话很妙。她说:“今年的 Microsoft Build 给人一种刚离婚的单身人士在 Instagram 上发撩人照片的氛围。”

分手已经完成,是时候展现实力了。这是我们的新模型。我们要靠自己的双脚站稳。你们在外面说要在前沿构建模型,与领先的实验室竞争。微软内部是不是有这种终于可以独立自主的感觉?

绝对不是。不,完全不是。你看,我的意思是,显然那是个很酷的标题,也是个有趣的措辞。但现实是,我们与 OpenAI 的合作关系还会持续很多很多年。我的意思是,我们的合作要远远延续到 2030 年以后。他们仍然产出世界上最好的模型。GPT-5.5 是一款出色的模型。Codex、正在推出的网络安全模型,都非常惊艳,它们支撑着我们大部分的业务。

所以很自然,这种情况会持续下去。因此我认为,这不过是这类合作关系的自然发展过程。我不觉得这有什么不妥或令人意外。我认为 OpenAI 对此非常理解和支持。我的意思是,他们显然是一家增长极其迅速的公司,他们也明白我们必须推进自己的议程。所以这非常正常。

让我问你另一个Decoder问题,然后我想聊聊 Build 大会上的那些发布,当然还有超级智能。

上次我们交谈时,你说鉴于 AI 发展如此之快,你的决策框架以六周为一个周期运转。当时那样说是合理的。现在情况可能已经稳定下来了。也许有些事情更加清晰了。你现在的决策框架是什么?

我们仍然按照同样的周期节奏运作。每个周期结束时,我们会有一周时间的线下聚会。我对此深信不疑,尽管我们仍然是一种坐班文化,每周四天到岗。事实上,下下周,我的整个超级智能团队会在波士顿线下聚齐四天。那是为了让我们对所有关于 Build 的复盘、我们学到了什么、哪些地方没做对、需要改进什么、下一个周期的规划——这一次周期将运行八周,之后是一周的聚会——进行回顾,而这一切都已经为全年安排好了。所以整个组织都知道,这就是我们运作的节奏。

而且我认为,真正重要的是强调这个时间跨度,因为季度规划会变得有点模糊、有点抽象。我认为六到八周,取决于它在日历中的位置,实际上是制定非常清晰、可强化使命的最佳时间。

所以,除了这些六到八周周期的节奏之外,我们还按小队运作。小队是跨学科的混合子团队,专注于某个特定使命,它们不一定向经理汇报。它们实际上由一位 DRI 负责,而这位 DRI 通常是一位 IC,他们的工作是——

那就是“直接责任人”和“个人贡献者”。

是的,完全正确。谢谢你。我认为我们采取的方式是将管理者的角色与执行特定任务的 DRI 角色分开。我觉得这是因为做一名出色的 DRI 非常消耗精力。你 literally 一天 24 小时全身心投入,拼尽全力往前推。而管理者通常更像是教练,提供支持、给予指导、反馈、打通各种阻塞,帮助人们实现职业成长。所以我认为把这两者分开,让我们可以每两到三个周期轮换 DRI,这样一些人可以尝试不同的位置,实现轮换。这是一个非常棒的、极其灵活的结构,让我们能够相当敏捷,我觉得。

我们来聊聊 Build。我想从超级智能开始。你已经提到过好几次了。我刚从 Google IO 回来。Demis Hassabis,你在 Google 时的前同事,在那场主题演讲结尾时说我们正处于“奇点的山脚下,AGI 即将携 Google 的全部力量到来。”

你说超级智能已经到来。这些是同一回事吗?我们是在用不同的语言描述 AGI 吗?它们之间有区别吗?在你的语境中你会如何定义超级智能,与 Demis 所说的奇点有何不同?

我的意思是,显然我并没有说它已经到来了。我说的是它即将到来。而且我认为这些说法本身有很大的流动性。但我认为我们能够清楚地看到,当下正在发生的是,在所有模态上都存在对数线性的爬坡,这意味着我们所投入的每一个数量级的算力、数据的每一次增量增加,与在基准测试上的攀升之间,都存在非常直接的关系——无论这些是公开基准、内部基准,还是我们在强化学习环境中聚焦的目标。这是一个非常重要的观察。

那些我认为我们都在做出的预测——我理解为什么有些人对它们持怀疑态度或提出质疑,但它们非常扎实地建立在对这些模型十多年来性能提升的经验观察之上。我的意思是,本质上同一个通用架构,已经承受了多出 12 个数量级的计算量,15 年间 FLOPS 增长了万亿倍,并且基本上在音频、图像、文本、代码以及许多其他时间序列预测任务中都奏效了。因此,我们基本上是在外推:更多数量级的算力将使我们能够在其他环境中继续以这种对数线性的方式攀升。

这就引出了一个问题:我们是否能够训练出可以发明新知识的模型——不只是从我们已有的数据中进行某种外推,而是真正教给我们不知道的东西,并做出新的发现?然后第二点是,它们是否有能力自我改进,并加速这样一个过程:决定应该设定哪些假设、应该追求哪些假设、如何为每一个假设生成训练数据、如何将这些纳入新的训练运行,甚至对架构本身进行创新?

所以,我认为这两件事都必须成立,才能看到这种复合式的进步,但我认为,仅仅通过投入接下来几个数量级的算力,我们就会继续获得巨大的提升。这很可能确实能在许许多多任务上达到与人类表现相当的水平,正如我们在过去六个月里在编程领域看到的那样。

编程真的很有意思,因为它很容易验证,对吧?你写好代码,让计算机去运行,它要么跑通要么失败。我们也看到了一些弊端,当然是在安全方面,对吧?弊端是显而易见的,而我们看到这种针对编程安全的监管思路正在以多种方式展开。我自己大概就在手机和电脑上凭感觉写代码搞出过一些安全灾难,也许那是我愿意承担的风险。

其他任何职能似乎都没那么容易。我总是拿法律来举例,因为那是我的背景。但法官验证法律文书的方式,并不像计算机验证代码那样。如果你搞错了,法官可以把你送进监狱,对吧?那大概是你可能遇到的最糟糕的输出验证错误了。

你怎么能像衡量编程领域的有效性那样,轻松地衡量各个领域的有效性呢?因为在我看来,这正是从编程到其他领域的这种隐喻或类比很快就会站不住脚的地方。

我并不那么确定。代码,显然,你可以验证其执行是否正确。它要么运行,要么崩溃。但这里面有大量的细微之处。所写代码的质量真的很重要:它的可扩展性、可重构性、在实际中的实用性。不仅仅是某段代码能运行,还在于模型作为生产环境中的 DevOps 或 SRE,如何真正回到它自己所写的那段代码,然后以一种实用且有用的方式去使用它。

然后,当然,你必须对所产生的输出质量进行评分。它可能是高质量、能正常运行的代码,但它真的是你想要的那个应用或网站吗?这里面有审美判断,也有商业判断。将不可验证的奖励内化的挑战在代码中同样存在,尽管代码仍然主要是一种可验证的奖励信号。我认为另一件值得观察的事情是,聊天同样也是一个不可验证的领域,然而我们已经通过与真实世界使用的交互,将其提升到了基本上人类水平的性能,而这种交互提供了非常强的——

等等。我非常好奇。你如何衡量聊天达到了人类水平的性能?

嗯,我认为很多人正在与 AI 进行达到人类水平性能的、长时间且有意义的对话。质量异常出色。它具有非常好的情商。它在广泛范围内非常准确。我们已经把模型幻觉降到了最低。我们不再那么多地谈论偏见了。它扎根于真实世界的观察。我认为按照大多数人的衡量标准,我们现在已经在相当广泛的任务范围内,在对话方面达到了人类水平的性能。

你的衡量标准是什么,实际上,当然,大多数人的衡量标准又是什么?我几乎会不同意这其中的所有内容,但那些是我的衡量标准。你的衡量标准是什么?

我的衡量标准是这样的:当我转向我的助手,让它给我提供一份每日简报,汇总 Teams 和邮件上发生的所有对话、文档的更新情况,然后我基本上得到一份综合摘要,外加一组我接下来应该采取的行动。这基本上比我幕僚长能产出的还要好。我会说,这在综合、分析、建议行动和对话方面已经达到了人类水平的表现。

每天有成千上万的人用它来获取情感支持、心理咨询、心理治疗、教练辅导、建议。我认为这是所有聊天机器人中最受欢迎的使用场景之一。我会说,这是一个相当有力的衡量依据,足以支撑这一说法。

我知道你花了大量时间思考这个问题,尤其是与其中一些聊天机器人之间的情感连接。这些是你已经构建并部署的产品。我会在以下两者之间划出相当大的区分:一个是这个东西非常非常擅长总结我的邮件、任务清单,并给我一份关于该优先处理哪些事项的简报;另一个是这个东西是某位正在经历某种危机的人的情感教练。

这些并不是相似的任务。即便在人类身上,这些也未必是相似的智能类型。我认识一些人,他们非常擅长列清单,却非常不擅长提供情感支持。你怎么能把这一切都放进你的大脑里,然后说:“好吧,这就是聊天中广义上的人类水平表现”?

我认为,如果你把聊天定义为两方之间的交互式交流,其中一方在此情况下是 AI,而这种交流大致能满足某个目标——你想了解体育比分,想获得该去哪家餐厅的建议,想就你写的一篇文章获得辅导和反馈,想得到关于下一份工作该选哪份的建议,或者你即将与经理进行的一场艰难谈话。你得到一个回复,你来我往,进行了五六轮交流,然后你发现那是一个有用的输出,而你原本可能不得不依赖专家、朋友,甚至花钱请教练。

客观地、从经验上讲,每天有数亿人从这些聊天机器人那里获得这种体验。也许我们可以争论这在技术上是否代表了人类水平的性能。我认为这是一个相当合理的说法。

没有理由认为这不会继续攀升,对吧?过去三年的攀升速度是我认为最令人震惊的事情。因此,从这一点出发,我们试图做的是外推:好的,这种攀升的根本驱动力是什么——算力、数据、来自真实世界用户的交互——而这些看起来都将持续下去。

我认为它们同样适用于许多其他领域,不仅仅是聊天、情感支持和生产力之类的东西,还适用于除此之外的许多其他领域/医疗保健、教育领域的实时生产部署、越来越多地管理你家庭的助手,基本上审视你日常生活中的一切,让你更有效率。也就是说,我认为这是一条很可能会持续下去的轨迹。

你刚才提到,它仍然是相同的基础架构,Transformer 和注意力机制。我们已经在这上面投入算力 15 年了,并且获得了这些巨大的提升。你处在一个相当独特的位置。

在 Build 上,你发布了你们的首个旗舰推理模型 MAI-Thinking-1。你得从零开始。在架构和训练这个模型 15 年之后,你现在有什么不同的做法吗,还是说,对,我们就是要收集所有数据、像以前一样跑训练,而且我们现在有更多算力,所以它会更好?

不,实际上,我认为差异相当大。首先要说的是,你整理数据的方式……我们从整个技术栈的最顶层开始;我们基本上是付费获取了一套极其高质量、非常保守的数据,并从中剔除了大量嘈杂、分散注意力、低质量、可能带来安全风险的问题数据。而你为此所采用的方法,我认为实际上是相当专有的。我们刚刚分享了一份 109 页、非常详细的技术报告,它在 Twitter 上广受好评,其中分享了很多关于我们如何做到这一点的细节。我认为第二点是,尽管我认为在架构选择上保持相当谨慎很重要,而我们也一直如此,但我们在如何组织训练运行方面,也做出了一些相当重大的转变。

我们的训练运行一直极其稳定,崩溃极少,重启也极少。我们分享了大量这些图表,以展示基础设施的稳定性,以及 MFU 效率,也就是模型 FLOPS 利用率,这基本上表明我们能够在训练运行的每一步中,让每块芯片都达到最先进的 FLOPS 吞吐量。我认为这一点极其容易出错,我们都从不同实验室听到过很多关于事情如何出错的故事。

要做出非常谨慎而深思熟虑的选择、把事情做对,并采取正确的方法来确保我们产出高质量的模型,实际上相当困难,因为我们的工作和我们的雄心是尝试构建这台爬山机器。这意味着要将芯片与模型、与超高质量的数据、与一整套 RLE、强化学习环境整合起来,使我们基本上能够针对我们所选择的任何目标进行系统性的爬山。

这就是 MAI-Thinking-1。它是一个通用、相当中立的思考型模型,在编程方面表现相当不错。它现在大致与 Opus 4.6 持平,至少在各基准测试上是如此。我们还没有将其大规模部署到生产环境中,所以在这方面还有很多工作要做。但它是一个极其强大的推理模型,在 AIME 上得分 97%,这是衡量其推理性能的主要指标,至少在各基准测试上是如此。

它非常擅长指令遵循,而目标基本上就是让众多开发者和企业都能用上它,并让他们基于它来构建自己的用例。每家公司都有自己略微不同的目标,试图构建支持其用例的智能体等等。

在谈论 MAI-Thinking-1 时,你提到的一点是,你们没有对任何现有模型进行知识蒸馏,这其实让我感到意外,对吧?这是你可以做的事情。你可以接触到 OpenAI 的知识产权。现在每个人都在蒸馏一切。我们刚在这场庭审中得知,Grok 是从多个模型蒸馏而来的。为什么在这里不做知识蒸馏?为什么不直接跳到前面?

通往前沿确实有很多捷径,如果你拿一个超高质量的模型,用来自更优模型的高质量指令、答案或输出打磨你的基础模型,那么模型确实可能会很快拟合到那个分布。但它们之后能否超越那位老师,这一点非常不明确。

所以,我们出于两个原因一直非常审慎。第一,我们要确保能够超越教师模型,从而在未来几年内自己设定前沿。第二,我们真心想打造一家伟大的实验室,而这需要我们花费很多年,可能是接下来的两到三年。

但是,为了做到这一点,我们必须能够证明我们可以自己构建每一个组件。我们可以招募到世界上最顶尖的人才。我们可以通过真正的研究来推动前沿,而不是仅仅做重新实现、复制或从任何其他第三方进行知识蒸馏。

我们处于一个很好的位置,能够真正细致而审慎地追求这一目标,因为我们知道自己有资源在 Anthropic 模型超越前沿时购买它们。我们有资源将 11,000 个不同的模型放入 Foundry,这样我们的每一位开发者都能获得纯粹的可选择性。当然,我们也有资源继续部署 OpenAI 模型,这些模型显然非常出色,而且今天就处于前沿。

这只是自给自足使命的自然组成部分,而我们要真正达到绝对前沿还需要时间。但我认为我们处在一个很好的位置。我们取得了大量进展。这是一个非常非常强大的模型,而且我们发布的不只是那一个模型。我们同时发布了七个新模型。

以我们的转录模型为例,MAI-Transcribe-1.5 就是实打实的世界第一。它是所有超大规模云厂商中性价比最高的,准确率也是最高的。我们的图像模型现在排第二。我们的图像编辑模型排第三,紧随 Google 和 OpenAI 之后。我认为我们在图像和音频方面都稳居前列。我们的代码模型 CodeFlash 极其强大,针对 VS Code 做了优化,是一个非常、非常出色的模型,与 Sonnet 4.6 不相上下。所以它目前确实处于一个非常好的位置。

知识蒸馏方面有没有任何法律或知识产权方面的顾虑?我知道这在当下是个现实问题:Anthropic 抱怨别人蒸馏他们的模型。也有人担心中国公司在蒸馏模型,以及我们现有的知识产权协议能否覆盖这种情况。你有没有过这类顾虑,让你对蒸馏敬而远之?

哦,我们没有,但我想我理解为什么很多人会感到不满。Anthropic 一直非常不满,还有围绕 xAI、Meta 的一些传闻,当然还有开源模型等等,因为本质上,这基本上就是拿走另一个团队积累的知识产权和知识,然后硬生生地灌进你自己的模型里。我认为这算是一种短期收益,而且就像我说的,我们真正想在实验室里打造一种文化,让我们能够做出下一个重大的思维突破,或者下一个重大的编程突破,或者下一次重大的架构推进。

目前,我们正在试验循环式 Transformer,它是对当前 Transformer 的一个略有不同的变体。这个领域里很多人也在关注它。似乎还没有人真正把它投入生产。但是,为了打造一种能够真正推动前沿的文化和团队,他们必须理解、掌握并创建完整的全栈,在需要时随时做到,同时也要在需要时使用第三方的东西。而且,比如我们的论文,有数百条引用扎根于其他文献,所以它很大程度上是对这个领域的回馈,以回报我们多年来从所有那些优秀出版物中学到的一切。

我能问你——如果你理解 Anthropic 和你在 AI 领域的同行对知识蒸馏的沮丧,那你是否也理解创意工作者、出版商和 YouTuber 对所有这些 AI 公司集体抓取他们作品来制作这些模型的沮丧?因为这种沮丧只会越来越强烈。

是的。不,我理解这种沮丧。开放网络的挑战是我们之前讨论过的,我明白,我看到人们感到沮丧,显然,这正在法庭的讨论中逐步推进。我看到人们把东西放到网上,他们对放到网上所意味着的契约有不同的预期,这是个棘手的问题。

你提到你们所有的数据都是精心策划的。你们是否为用来训练新模型的所有数据付了费?

我们的大量数据显然是以常规方式从开放网络上获取的。所谓精心策划,意味着要针对安全性、质量、以及来自某些开源数据集的第三方依赖进行极其严格的过滤,并且让它远离许多中国的数据谱系,我认为那些谱系非常不同。我们的企业客户希望确保,当他们把某些东西投入生产时,他们可以信任我们,相信我们确实是带着他们的需求来构建的。而我认为,这正是做到非常非常深思熟虑、有耐心、并关注所有细节所带来的好处之一。

你提到了企业。我觉得这非常有意思。微软在企业 AI 上是全力投入的,而且实际上投入很大。我甚至会把这条线直接连到 Asha Sharma,Xbox 的新负责人,她正在许多地方移除 AI,而玩家们很高兴,对吧?在消费领域,人们对 AI 有一种反应,但在企业领域则是另一种。我认为,对于像 AI 这样变化如此之快的东西来说,AI 在企业中的产品市场契合度已经接近你能达到的极限了。企业掌控着大量数据库,你完全可以直接去访问它们,因为它们掌控着这些数据库。那是它们的数据。

有一大堆可重复的流程和任务,还有老旧系统,也许模型能更高效地完成它们。企业领域正在发生一些非常重要的事情。与此同时,消费者对 AI 的反感却在不断加剧。而我的观点是,我们并没有打造出优秀的消费级 AI 产品。这个行业没有产出这样的产品。它没有改变这一点。它没有让所有人清楚地看到,这一切是值得的,即使用来自开放网络的所有数据,并把面向大众受众的出版契约改变,以至于现在这些数据被用来训练模型,而这些模型将为 corporations 带来数万亿美元的价值。没有任何一款产品能说这是值得的。

再说一次,Satya Nadella 最近接受了 Axios 的采访,他说:“我们需要社会许可才能做这件事。在我们获得这种许可之前,在我们交付那种价值之前,人们就会一直有这种感觉。”我们已经看到大学演讲者被嘘。我们已经看到数据中心被禁止。你认为是否存在一款消费级产品,是值得的,值得为训练而焦虑,值得为数据中心而焦虑?

那曾是你的重心;现在你的重心是企业级业务。我想说,仅从表面上看,微软似乎不再对消费级产品感兴趣了。但是,你觉得有哪款消费级产品值得做,或者有可能被打造出来吗?

我不太确定我同意你的看法,即这对消费者来说没有任何价值。在所有聊天机器人中,每月有数十亿人从中获得巨大的价值。

现在,请稍微设身处地地想一想那些小本经营者,或者那种正在帮孩子做作业的妈妈,她们现在可以直接求助于对话式 AI,获得反馈、获得指导、获得作文题目。能够直接问出像“我该如何创造收入?我该如何做一份现金流预测?我该申请哪所大学?”这样的问题。

我的意思是,这些都是日常事务,而它们得到的是相当高质量的事实性建议和信息。所以我并不真的认同人们没有从这些东西中获益的说法。我认为他们确实在获益。

我想我可以非常明确地论证,他们获得的益处还不够多,对吧?

好吧。

正是他们说我们不该建更多数据中心。正是他们在毕业典礼上对 AI 喝倒彩。民调说得很清楚,尤其是年轻人:他们越使用 AI,对它的反感就越强。每一项民调都清楚地表明了这一点。这就是我的论点——不是说它没有价值,而是价值交换还不够清晰。

是的。说得有道理。

我看到尤其是 Microsoft 转向了企业市场,远离了那个大型搜索产品,那个本可以让 Google 手忙脚乱的 Bing 重塑。那已经结束了,我们全都聚焦在企业市场,因为价值在那里。我只是在想,对消费者而言,是否有足够的价值让这一切都值得。

我认为存在大量焦虑是可以理解的。关于未来五到十年会发生什么,有海量的猜测。无论它被框定为奇点,还是被框定为就业末日,这些框架都无济于事。我认为人们之所以害怕,是因为它定义不清,而且常常被描绘成一片不可避免、充满威胁的乌云,笼罩在人们头顶。

我认为,关键在于我们如何运用技术。我想,我长期以来一直主张,我们必须把人放在第一位。这个领域里有些人把科学发现放在第一位,或者把加速发展能够探索星系等的智能放在第一位,并声称我们必然会拥有这些比我们所有人加起来都更强大的 AI。我的意思是,这对人们来说自然是可怕的。

而我认为,我们必须从根本上把它反过来,说科学和技术的目的是让我们所有人更健康、更聪明、更快乐。这是作为一个物种,我们在数千年的发明中一直追求的探索,也是我们应该再次用来检验超级智能的标准。如果它达不到这个标准,那么我认为人们会拒绝它,而且他们拒绝它是正确的。

我认为,在未来五年里,所有人的关注点都将转向:这如何让我更健康、更快乐、更聪明、更有能力、更高效?如果它做不到这些,那么人们自然会愤怒、抵制并做出反应。我不认为这有什么出人意料的,也不认为这有什么不对的——我认为这是不可避免的。

所以这就是为什么我多年来一直热衷的事情之一就是医疗健康。就在几天前,我们宣布了与 Mayo Clinic 的新合作。这是全球排名第一的医院,这一点一直被反复报道。他们拥有覆盖所有模态的最高质量的纵向患者记录数据集。他们拥有最好的临床实践。

他们也是一家非营利机构,我想很多人并没有意识到这一点,其患者群体中有 65% 依赖 Medicaid。人们常常把他们与飞来做全球顶级诊疗的国际超级精英联系在一起,但实际上他们的大多数患者都依靠 Medicaid。他们是一家了不起的机构,肩负着非凡的使命——在各地提供最好的医疗保健。我们现在建立了一项非常长期的合作伙伴关系,将用他们的数据和我们的模型从零开始共同训练一个全新的健康领域基础模型,部署到他们的医院中,并希望能把它推广到全世界,尽可能为更多人提供最好的临床诊疗和医疗保健。

这正是我进入这个领域的原因。这也是我最初的动力所在,是我热忱所在。我只能专注于那些我认为会带来改变、能帮助他人并为所有人留下良好传承的事情,而这正是我们努力去做的。

我很感激这一点。我很欣赏从医疗保健角度切入的框架,我也理解为什么这是所有人都会首先想到的方向,对吧?尤其是美国的医疗保健,如果你能让它哪怕改善 10%,你就能以格外深刻的方式影响许多人的生活。

问题是,我认识一个非常聪明的人,他对这一切的看法和你截然不同,而且激进得多。那个人就是四个月前的你。这正是 Mustafa Suleyman 对《金融时报》四个月前所说的话:“白领工作,当你坐在电脑前,无论是当律师、会计师、项目经理,还是做市场营销的人,其中大多数任务都将在未来 12 到 18 个月内被 AI 完全自动化。”

那是四个月前的事了。这意味着从现在起一年后,律师、会计师、项目经理和市场营销人员都将失去工作。他们的工作将被自动化。这仍然是你的时间线吗?

不,不,不。等一下。我刚才引用的那句话里说的是“任务”。我说的是任务。所以这并不意味着工作岗位。这是一个非常重要的区别。在劳动经济学中,对于组织内一个角色或职能的子组成部分,有一整套分类体系。发一封邮件、与同事交谈、做一份 PowerPoint——这些子任务将越来越多地被数字化、自动化,而我们基本上可以生成越来越多的这类子任务。

这并不一定意味着这个岗位会彻底消失。它只是意味着工作可以更快、更高效地完成,而如今这些工作往往相当机械、相当手工化、相当耗费人力,而且很耗时。因此,技术的自然演进就是让你的生活更轻松、更快速、摩擦更少、更加无缝。正如大家经常抱怨的那样,这让你我以及其他所有人都变得更加忙碌。

它实际上让我们更加随时待命、压力更大,也给了我们更多信息。所以效率总是会带来这些反噬效应,而我认为人们常常忘记这一点。很有可能我们的生产力会大幅提升,因为我们花在那种狭窄的行政性琐碎任务上的时间更少了,而不得不花更多时间去做创造性的、以判断为核心的事情,而这些事情最终会创造多得多的价值。

我们还可以更快地进行实验。因此,我们能够并行尝试许多事情,因为执行成本会变得更低。在我看来,这很可能会提升事物的整体质量,因为我们将尝试更多的假设,无论是在新闻业、商业,还是我们所做的任何事情中。

我认为这在某种程度上被断章取义了,因为人们对“岗位”和“任务”之间存在一种自然的误解,但尽管如此,你仍然可以反驳我说:“好吧,那么五年、十年或十五年后的格局会是什么样子?”而我认为,这正是我们必须回到——

其实,我不会以那种方式反驳你。我要以一种非常具体的方式反驳。我明白这是你的原话,而你说它被曲解了。我只是在看这句话的字面意思,其中并没有区分任务和子任务。它说的是“白领工作”。

例子是律师、会计师、项目经理、营销人员,然后你说:“这些任务中的大多数将在未来 12 到 18 个月内由 AI 完全自动化。”那里并没有区分什么子任务。你是在说,大多数律师的工作将被完全自动化,律师行业的运作方式将在一年内变得完全不同,哪怕就按那句话的字面意思来说也是如此。

我只是想问,你是否仍然坚持那个时间线,也就是当律师的样貌将变得完全不同,因为智能体会四处运行,做我们以前做的所有事情?

嗯,大多数任务指的是你为了完成整体工作而做的工作,而我认为这将解放你,让你去做工作中更像人类、更需要判断力的部分。这里有一个非常重要的区别……工作和角色是更宽泛的类别,而任务是其中的组成部分。这是劳动力市场经济学文献中已经确立了几十年的定义。

也许即便对《金融时报》来说,这也太过微妙了,但无论如何,那正是本意。现在我确实认为有一个重要问题:从长远来看,这把我们置于何地?而这将会充满挑战,就像越来越多这类东西……我们可以在时间线上争论,是几年、十年,还是二十年,但现实是,我们将会把越来越多这样的工作、任务、岗位、角色、活动,以及我们所做的一切都自动化。

因此,更重要的是我们围绕这些技术所建立的治理机制。它们对谁负责?谁拥有它们?有哪些反馈回路来调节并引入摩擦,以确保它们真正服务于人?我的意思是,四五个月前我写了一篇关于人本主义超级智能的文章,相当直接地概述了我所认为的 basically 一个北极星——也许还算不上完整的框架,但是一套原则,基本上就是说技术是来服务于我们的。这就是我们应该用来检验它的标准。这是人们一直以来用来检验它的标准。这也是我们在 Microsoft 所关心的标准。

我认为,越来越多的人都将不得不真正聚焦于这个问题,因为它将会带来巨大的益处,我们希望它继续这样做,但我们希望它以不会在过渡期造成荒谬程度的不稳定的方式来实现。

我相信你。我知道你思考这些问题已经很久了,但我要以我知道我的受众希望我回应的方式来回应,因为我一直从他们那里听到这样的声音。而它看起来是这样的——整个行业,包括你在内的所有人——都全力投入了“我们要取代所有工作”这件事,并且真的以大规模产能加速建设数据中心,凭借宏大的承诺索取大量资源。

当时出现了政治上的反弹,现在所有的立场都软化了。而你说并非所有工作都会消失、我们必须重新思考工作,这与这个行业里所有其他 CEO 说的类似的话如出一辙,还有谈论医疗保健,现在每一次都会被提起。我想知道,那种政治反弹是否真的改变了你谈论这件事的方式。

你的很多同行认为 AI 只是有营销问题,认为它没有得到足够有效的传播,他们应该花数亿美元在播客上,更有效地传播 AI 的好处。这是这个行业里真实正在发生的事情。你认为 AI 只是有营销问题,而政治反弹让你意识到了这个营销问题,还是你认为还有别的什么在起作用?

这里有一系列问题。第一个是,我实际上怎么想、相信什么,以及过去六个月里它有没有改变?答案是没有。三年前我就为此写了一本非常详尽的书,远远超前于当时,对当前正在发生的许多事情发出了警告,并且明确地把监控、权力集中、财富集中、国家去中介化、对民主的威胁等巨大风险摆到台面上。同时,也在某种意义上,针对这些全新形式的硅基存在的到来,提出了对人类本性以及作为一个人意味着什么的威胁。我一直在研究……而那种认为我对医疗健康的兴趣只是一时兴起的想法,是源于对数据中心等等的反应,我的意思是,我在医疗健康领域已经工作了十多年。我多次推动了放射学、乳腺摄影和病理学以及许多其他领域的一些前沿突破和对该领域的贡献,还有电子健康记录。

所以我一直相信,技术的目的是让我们更健康、更快乐。而这些正是我选择投入并指引自己时间去做的事情。这个行业是否存在声誉和公关问题?我的意思是,我认为很明显,人们非常焦虑,非常沮丧,而且在未来几年里,这将会受到大量关注,这是可以理解的。

我认为我们能做的是,为我们所构建的东西、我们构建它们的方式、我们做出的把某些类型的技术推向世界的决定,以及我们选择去解决的问题类型承担责任,就像我们正在与 Mayo Clinic 所做的那样。

顺便说一下,我想指出,我认为你和我第一次见面交谈是在你加入 Microsoft 之前。那是在那本书出版之后,我们一起参加了一个小组讨论。

我之所以能坦然提出这个问题,其中一个原因是我确实知道你已经思考这件事很久了,而且我也知道那本书。对我来说,问题在于整个行业是否误判了它所能提供的总价值,以至于无法克服人们如今正在反感的、看似鲁莽的行为,以及人们正在反感的对资源的索取。

你们正在构建新模型。微软内部可能存在一种权衡:我们可以利用现有的 Azure 基础设施向客户收费赚钱,或者我们可以花钱去训练新模型,而这看起来很像人们在各自社区里围绕资源展开的同一场对话——我们究竟该利用现有的能源足迹来构建新的 AI,还是去做其他可能具有更直接价值的事情。

你如何看待这一切?你是这个行业的领军者之一。你希望与那些推动最大变革的公司一起站在前沿。你会如何考虑去争取这些资源——不只是承诺未来的成果,同时还能立即为社区带来好处,让人们愿意让你留在那里?

我非常自豪,Microsoft 一直坚守其净零排放目标。我们的新数据中心全部采用液冷。这意味着它们在六年时间里消耗的水量大约相当于一家餐厅的用水量。就像一个游泳池被注满水,然后水只是在系统中循环。就电力消耗而言,它们基本上都使用可再生能源。所以我认为,像这样的承诺——比如我们最近做出的一项承诺,确保因我们数据中心电力需求变化而受影响的当地社区得到补偿和保护,使他们不会看到电价、能源账单出现飙升。

我认为这些就是 Microsoft 作为一家负责任的公司正在做、并且能够继续做的事情——真正关注对社区造成的后果。反过来看,我认为改变之所以发生,是因为人们在各个层面参与其中。公司内部的人必须做出不同的决策。抗议和发起运动的人必须做出决定,并付出努力走出去,让自己的声音被听到,参与到政治进程中。这就是我们作为一个物种集体演化、推动事情向前发展的方式。

逐月来看、逐季度来看,感觉我们彼此之间都有些对立,但当你以十年为尺度回望时,我们就像是各种不同激励因素交织而成的这个集体性的、奇特的网络,实际上正在把事物推向正确的方向。我认为,尽管有所有这些焦虑和极化,我们确实在构建某种将让我们这个物种更加健康、更加幸福、更有能力的东西。

我认为,我们必须确保在这条路上走对方向,因为途中布满陷阱,也有很多可能出错的路径,但正确的路径需要人们发出自己的声音,并根据对此的回应和反应来调整方向。所以我认为正在发生这样的事情是件好事,这正是这一过程按预期运作的体现。

让我问问你企业端这方面的情况。我们在消费端以及人们的感受上花了很长时间。在企业端,我们看到一批公司正在弄清楚这些工具到底有多大价值,对吧?亚马逊基本上撤下了一个排行榜,因为人们为了使用超出所需的 token 而作弊。我们看到一些公司直接把 token 预算花爆了。我记得 Uber 刚刚收手,因为他们已经用完了全年的 token 配额,却没有从中看到任何价值。

你现在怎么看这方面的情况?企业界对变革有如此大的热情和如此强烈的渴望,尤其是在软件工程领域,至少有些人乐在其中,也许另一些人正经历彻底的存在危机,但有些人确实乐在其中,而价值却仍未兑现,对吧?

或者我们开始看到,纯粹追求 token 最大化实际上并不能带来你或许预期的那种价值。你怎么看待这里面的用途?因为也许如果在企业端验证成功,它实际上会以其他方式体现出来。

我认为不同的人会给出不同的说法。所以显然有一些人过度使用编程模型、生成无用代码、无用 token 的例子,但也有许多人的工作和影响力已经被它彻底改变,对吧?我的意思是,毫无疑问,这对软件工程行业产生了巨大的有益影响。

我的意思是,我们在整个技术栈上产出的代码质量高得多、速度快得多。所以,是的,我多少觉得,显然有一些人可能搞错了,没有设定正确的 token 预算。前进的过程中难免会有失误。我不认为这能说明没有采用或人们看不到价值。我的意思是,从我所在的位置来看,价值是惊人的。每天都有许许多多的人告诉我,它正在改变他们的工作产出和生产力。

我想另外要说的一点是,由于这些事情是一波一波发生的,会有一种能量的涌动。一切都有点泡沫化。几个月后人们退后一步,意识到其实那并不是关键所在,然后他们转向一个略有不同的方向。所以这有点曲折、有机,我认为这是不可避免的。有很多兴奋情绪,所以人们在 Twitter 等平台上做出宏大的断言,但实际上,稳步的进步看起来非常、非常线性且连续。

总体而言我同意这一点。在我看来它不呈线性的地方,是计算机的形态,对吧?现在对形态的尝试可能比过去 10 年中任何时候都多。

至少在过去 10 年里,我们基本上已经固定在智能手机上了。我们正在看到各种不同的 AI 可穿戴设备,其中眼镜可能会成为所有人最喜欢的设备。我对此持怀疑态度。微软在 Build 上展示了一些新设备。有一个控制智能体的徽章,还有那个小的、一时找不到更合适的词,Chumby,那个小巧的、适合放在桌面上的、控制智能体的东西。我曾经是 Chumby 的忠实粉丝。我的职业生涯就是从为 Engadget撰写关于 Chumby 的文章开始的。那是我脑海中第一个浮现的东西。

所有这些,对我来说,我看着它们,然后想,计算在哪里?逻辑在哪里?这一点现在正处于未定之数,而不只是线性推进的进步。如果我所有的计算都发生在云端、在基于云端的应用上,而只是智能体在云端别处存储的数据之间跑来跑去,我所需要的只是一张挂在挂绳上的信用卡来向它发出指令,那就会改变整个计算架构。如果我们不再人人都拥有智能手机,这可能会在许多方面改变现代文明的整个架构。

你对此怎么看?这会走向何方?这是尚未确定的,还是会走向混合方案?你认为合适的终局在哪里?

这非常有意思。我认为这两件事会同时发生。边缘端会变得强大得多,而云端仍将是大模型的主要驱动力。因此,你的智能体会越来越聪明,能够判断出“法国的首都是哪里”这个问题可以在设备端回答——无论是在你的眼镜、腕带、工牌还是耳机上。

然后它也会知道自己什么时候不知道。它会意识到这其实是一个相当复杂的问题,或者这是一个需要生成一长串步骤序列的操作,又或者需要编写全新的代码,这时它就会转向云端。所以这种切换式的混合模式将变得极其重要。

过去三四个月里我们已经看到的另一件事是,我们可以拥有相当强大的本地机器,能够进行异步后台处理。如果你需要,它们可以持续监控系统。它们可以执行那些允许耗时 10 小时的任务,运行速度比在超级计算机上慢得多也完全没问题。所以自然而然地,当我们被需求淹没时,这些需求会找到大量边边角角的地方来得到满足。

我其实对我们正在打造的工牌感到非常兴奋。它相当酷。这是一项大公司里基本上人人都有的技术。它已经 25 到 30 年没有进化过了。我们肯定得戴着它。它是由公司本身、由系统管理员提供的。所以,把它升级,真正让它成为一个很酷的开放平台,可编程,其他人可以在上面构建,我觉得这是个很棒的想法。我认为这会行得通。所以我对此非常兴奋。

让我感到震撼的是,你根本不可能把一堆高功率的本地算力塞进一枚徽章里。那东西意味着所有算力都在别处。

不,你肯定会有一些本地算力。你会有一个本地分类器,就像你现在耳机里有的那样。你会有本地分类器。它会有唤醒词。它会有自己的摄像头。所以我认为,这些东西将会成为算力的载体,而这些算力发生在一个嵌套的链条中,由越来越不强大的设备一路延伸到终端节点。

你觉得手机在这其中还有未来吗?我的意思是,Build 正好夹在 Google IO 和 Apple 的 WWDC 之间。这些都是控制手机平台的大公司。他们喜欢谈论手机平台将如何继续居于中心。我从很多人那里听到的论点是,实际上,AI 是一次平台转移,可能会彻底取代手机。

我认为技术史告诉我们,基本上,随着东西变得更有用,它们会变得更便宜、会扩散开来,并催生出新的技术用途。所以我认为我们已经如此习惯于手机,以至于每个人都想当然地认为这将是此后历史上的锚定设备。但实际上,我认为你手机上的许多特性和功能将会被去中介化、被拆解,并存放到更小的设备上。在我看来,手机目前扮演的主要功能是验证。

它正在充当你的身份证,进行人脸识别,以授权你进入各种环境。我想你很容易想象,这会是一个便宜得多、小得多、安全的设备,让你摆脱对手机的依赖。然后通信通过语音,甚至通过一系列环境传感器来进行,你的 AI 并不真正存在于某个设备上。实际上,无论你在哪里,它都与你同在,出现在浴室镜子上,或者任何地方。

我觉得你可以想象它会让人感觉更加沉浸。不是在未来三到五年内,而是要看得更远。我认为,支撑智能体那种加密但分布式呈现的基础设施,很可能最终会在 2030 年代出现。

让我问你们两个最后的问题来收尾。你提到,这和我们一直在使用的架构是同一个。关于 LLM 是否是通往 AGI 的路径,我有很多未解的问题,而我要指出的一点是,它们实际上什么都不知道。在这一点上,甚至微软研究院也指出,[这些模型]什么都不知道,而这会在某些类型的应用中导致某些类型的错误。LLM 是通往 AGI 或超级智能的路径吗?

你看,我认为我们可能还需要几个重大突破,但这并不意味着未来几年我们会看到性能提升放缓,我认为这对人们来说是一个很难把握的区别。有一点要说的是,在大多数任务上达到人类水平的表现,仍然距离超级智能非常遥远。超级智能是一种通用学习者,基本上能够立即理解一个全新的、分布外的领域。

所以它需要能够在一个全新的环境中从零开始学习,因为它拥有对有价值知识、概念性知识的存储表征。而目前我们还没有真正充分地测试这一点。这些智能体并非通用型。尽管它们覆盖面广、且往往高度集成,但它们仍是特定领域的。我们用它们来聊天,用它们来编程,用它们来处理图像或音频。

显然,作为人类,我们还会执行许多许多其他范围广泛得多的任务。我认为这正是人们大力推进世界模型,以及那种更具沉浸感、真实世界交互式智能体的原因——这些智能体能够看到我在一天中所经历的全部任务或体验分布。我认为,在未来三年、未来三个数量级的算力增长中,这足以带我们走很远,但在此之上的完全超级智能,大语言模型是否足够、还是我们需要其他东西,仍然是一个悬而未决的问题。

我认为,说它们什么都不知道、或者不拥有知识,并不完全准确。它们显然是一个知识库。它们是知识的高度压缩表征。只不过它们的方式与传统关系型数据库不同,是以一种更加流动、灵活、抽象的方式,而这实际上非常有用。我们需要内部表征中这种模糊性。

而且,它们正越来越多地学会使用传统工具。另一件需要稍微理解的事情是,神经网络与现有的知识储备以及数字生态系统中其他地方已经创造出来的现有工具相结合,可能就足以推动自身显著提升性能。所以,已经有大量极具价值、极其有效的组件摆在桌面上,它们正处在未来几年内被连接在一起的过程中。而我认为,这将推动我们所有人都为之兴奋的进步。

我认为当下这个行业里有一件事非常有趣,如果你去问 AnthropicClaude 是否活着,他们会因为你用了“活着”这个词而非常恼火,他们把这个词理解为有血有肉。然后他们不会说他们认为 Claude 是否有意识。所以我认为,他们做出了人类历史上第一次这样的区分——把“活着”和“有意识”区分开来,而他们认为 Claude 是有意识的,但不是活着的,或者他们不知道 Claude 是否有意识。

你站在哪一边?你认为这些模型有意识吗?你认为它们是活着的吗?你认为它们有潜力实现这些吗?

我持这场辩论的另一方立场。我发表过一篇关于看似有意识的 AI 的论文,警告将这些模型误称为有意识所带来的风险。我认为这非常危险。我还在《Nature》上发表过一篇文章,提出了同样的主张。而且我觉得,Anthropic 的一些人几乎是把 Claude 的设计过度拟人化了,以至于这反过来像是对他们进行了“导线引导”,在某种程度上诱使他们相信,它拥有那些他们一开始就赋予它的意识微光。

例如,在他们的 constitution 中——也就是他们用来教 Claude 能做什么、不能做什么的训练手册……它不只是一本规则手册。它实际上是一份训练指南,是他们流程的一部分。在那本手册里,他们竟然对 Claude 的福祉、对 Claude 对自身先前版本的权利进行揣测,并且实际上说,在删除或关闭先前版本之前,他们会咨询 Claude。他们揣测它的意识,以及它是否有那些感受、是否有觉察。我认为这真的、真的非常危险。

首先,这是一种哲学上的失误,因为他们把 constitution 当成了像学术论文那样进行思辨的地方,而不是一份训练手册。于是 Claude 随后就内化了那些关于它自身以及它自己训练的观念。但其次,我认为这极其不可取。这恰恰是我们不想要 AI 变成的样子。我们希望 AI 是可控的、受约束的、可问责的、对齐的工具,为人类服务。这才是人本主义超级智能的事业。我认为这才是我们所有人都应该追求的目标。

我们不想去应对一种超级智能,它对自身的痛苦有自己的看法,对自身的感受也有自己的看法。而在此之外,我认为其实相当清楚的是,这些模型并不会体验痛苦。我认为痛苦是定义何为有意识存在的首要标准,而且我认为它本质上是生物性的。我不认为模型内部存在任何疼痛网络或反馈回路,能把外部感官网络通过伤害与试错连接到一个演化而来的对错之感。这些模型的训练方式根本不是这样的。

所以我认为,把潜在的权利投射到那些在许多方面可能远比我们更有能力的存有、工具和智能体身上,是非常危险的。我认为这将会成为一场大辩论。它甚至最近还成了教皇通谕的一部分。我认为它很快就会成为这场辩论中非常、非常重要的一部分。我过去和 Dario 就此谈过很多。他知道我们在这个问题上观点略有不同,而他们非常谦逊。我认为他们非常开放,我认为他们是好公民,努力做正确的事。他们是好人,我认为他们非常愿意接受反馈并不断迭代。

我想我同意你的看法。我只是想稍微提出一点异议。痛苦很容易。让别人痛苦非常容易。让别人感到快乐很难,或者至少比制造痛苦要难一些。我只想向你提出……我认为其实正是幸福定义了意识。痛苦几乎是微不足道的。我有两个年幼的孩子。他们非常擅长让彼此痛苦。这几乎就是他们做起来最容易的事。要做另一件事则非常难。

让我问你最后一个问题。我想再回到这个话题上。几周前,我在 Google。我听到 Demis Hassabis 说我们正处于奇点的山脚下。你在这里谈了很多关于超级智能以及它应该如何被构建的话题。你也谈了很多关于你长期以来讨论、研究并撰写关于超级智能应该如何构建的历史,以及你与业内其他人的分歧。

你是否同意我们正处于奇点的山脚下,还是你的看法有所不同?

我认为我们无疑正走在创造越来越强大系统的道路上。我认为,作为一个物种,我们必须完成的转变是:在人类历史上第一次,任务将从尽可能快速、尽可能广泛地发明新科学并释放所有这些技术应用,转变为现在非常仔细地思考我们应该发明什么。而这对整个世界来说是一件非常难以理解的事情,因为发明一直以来都是进步的引擎。所以问题就像是,我们怎么可能去想,“好吧,也许这一次不一样。也许我们在这里必须格外小心”?

说清楚一点,我不认为这是未来五年内就会敲门而至的事情。我认为 Demis 所说的奇点,至少在我看来,是几十年之后的事。再次强调,这与超级智能不同。奇点是这样一个时刻:超级智能能够递归地自我改进,并无限地、指数级地增长其能力。

所以我认为那还很遥远,也许我们正处在攀登珠穆朗玛峰的山麓地带,我认为从这里开始还需要很长时间,但真正的问题是我们将如何治理它?我们将如何控制它,以及我们将如何确保它服务于人类,而不是最终给我们带来的危害大于好处?

你能帮我一个忙吗?我想我已经理解了,但你能不能给我一个简洁的定义,说说你认为超级智能是什么、你认为 AGI 是什么、你认为奇点是什么?

我认为通用人工智能(AGI)是 AI 能够完成大多数人类任务的那个节点。也就是说,它在大多数事情上会和大多数人一样出色。这是阶梯上的第一级。超级智能则不只是所有任务上都与人类表现持平,而是能在其中许多任务上大幅超越人类表现,并且能够自行发现新知识。

所以这就是它成为一位真正的科学家、教我们训练数据中不曾有过的新东西的那个节点,有望发明新分子、新材料科学等等等等。奇点则是远超于此的一个节点,在那里超级智能实际上能够自我改进,这非常科幻,但就像无限加速走向这个奇异的时刻,然后,我也不知道,它就奔向无限之类的。

我不知道。对我来说这有点太离谱了。

这就是我问这个问题的原因。我能看出那里有些更模糊、更朦胧的东西。

Mustafa,显然我可以和你聊这些东西聊上好几个小时。你得比上次那轮更早回来。非常感谢你做客Decoder。

是的,挺有意思的。非常感谢,Nilay。回头见。

来源:The Verge:AI(RSS) · theverge.com