跳到正文
北京时间
原文
Dwarkesh Patel:Podcast & Blog(RSS)· Dwarkesh Patel·· 2025-11-13精选

萨提亚·纳德拉:微软如何为 AGI 做准备

Satya Nadella — How Microsoft is preparing for AGI

AI 导读

萨提亚·纳德拉阐述微软迈向通用人工智能(AGI)的战略布局与技术路径,揭示其在AI基础设施领域的核心投入。内容包含对Fairwater 2的实地探访,这是目前全球最强大的AI数据中心,展示微软为支持下一代大模型所构建的顶级算力底座与能源架构。

推荐理由

纳德拉亲述微软AGI路线图,揭秘全球最大AI数据中心Fairwater 2内幕

正文 · AI 翻译

作为本次访谈的一部分,萨提亚·纳德拉让迪伦·帕特尔(SemiAnalysis 创始人)和我独家抢先参观了他们全新的 Fairwater 2 数据中心。

微软正在建设多个 Fairwater 数据中心,每个都拥有数十万块 GB200 和 GB300 芯片。在这些相互连接的大楼之间,总容量将超过 2 吉瓦。打个比方,即使是 Fairwater 的其中一栋大楼,其算力也超过了目前存在的任何其他 AI 数据中心。

随后,萨提亚回答了一系列关于微软如何在整个技术栈的各个层面为 AGI 做准备的问题。

可在 YouTube 上观看;也可在 Apple Podcasts 或 Spotify 上收听。

时间戳

00:00:00 - Fairwater 2

Dwarkesh Patel 00:00:00

今天我们采访的是萨提亚·纳德拉。“我们”指的是我和迪伦·帕特尔,他是 SemiAnalysis 的创始人。萨提亚,欢迎你。

萨提亚·纳德拉 00:00:07

谢谢。很高兴来到这里。感谢你们来到亚特兰大。

Dwarkesh Patel 00:00:10

感谢你带我们参观这个新设施。能亲眼看到这一切真是太棒了。

萨提亚·纳德拉 00:00:13

当然。

Dwarkesh Patel 00:00:15

萨提亚和斯科特·格思里(微软云和 AI 部门执行副总裁)带我们参观了他们全新的 Fairwater 2 数据中心,这是目前全球最强大的数据中心。

斯科特·格思里 00:00:25

我们力求每 18 到 24 个月将训练容量提升 10 倍。因此,这实际上相当于在 GPT-5 训练所用算力的基础上再提升 10 倍。打个比方,这栋大楼里的网络光模块数量,几乎相当于两年前整个 Azure 所有数据中心的总和。

萨提亚·纳德拉 00:00:44

它拥有大约五百万个网络连接。

Dwarkesh Patel 00:00:47

你们在同一区域内的不同站点之间以及两个区域之间都拥有如此巨大的带宽。那么,这是否意味着你们对未来规模扩展下了一个很大的赌注,即你们预计未来会出现某个巨大的模型,需要两个完全不同的区域来共同训练?

萨提亚·纳德拉 00:00:59

目标是能够将这些算力聚合起来,用于一个大型训练任务,然后跨站点把这些资源整合在一起。实际情况是,你会用它来做训练,也会用它来做数据生成,还会以各种方式用于推理。它不会永远只用于单一工作负载。

Scott Guthrie 00:01:20

Fairwater 4,你将在附近看到它在建,它也会接入那个 1 Petabit 网络,这样我们就能以极高的速率将这两个站点连接起来。然后我们通过 AI 广域网连接到密尔沃基,那里还有多个 Fairwater 正在建设中。

Satya Nadella 00:01:35

你确实可以看到模型并行和数据并行。它本质上就是为这个园区内的训练任务和超级计算集群而设计的。然后通过广域网,你可以连接到威斯康星州的数据中心。你完全可以运行一个训练任务,让所有这些资源聚合在一起。

Scott Guthrie 00:02:00

我们现在看到的这个单元里还没有任何服务器,也没有机架。

Dylan Patel 00:02:04

一个单元里有多少个机架?

Scott Guthrie 00:02:06

我们通常不分享这个具体数字,不过……

Dylan Patel 00:02:10

这就是我问的原因。

Scott Guthrie 00:02:12

你上楼就能看到了。

Dylan Patel 00:02:14

那我就开始数了。

Scott Guthrie 00:02:15

你可以开始数。我们让你数。

Dylan Patel 00:02:16

这栋楼里有多少个单元?

Scott Guthrie 00:02:17

这部分我也不能告诉你。

Dwarkesh Patel 00:02:19

嗯,除法很简单,对吧?

Satya Nadella 00:02:24

天哪,这声音真大。

Dwarkesh Patel 00:02:27

你看着这个,是不是在想:“现在我总算知道我的钱花在哪儿了。”

Satya Nadella 00:02:30

感觉就像:“我经营一家软件公司。欢迎来到软件公司。”

Dwarkesh Patel 00:02:35

一旦你决定使用 GB200 和 NVLink,设计空间有多大?还有多少其他决策需要做?

Satya Nadella 00:02:41

模型架构与优化的物理方案之间存在耦合关系。从这个角度看也令人担忧——未来会有新芯片问世。就拿 Vera Rubin Ultra 来说,它的功率密度将截然不同,冷却需求也会天差地别。因此你不能只按单一规格来构建一切。这又回到了我们稍后会讨论的话题:你希望的是随时间逐步扩展,而不是一次性扩展到位然后被它束缚住。

00:03:20 - AGI 的商业模式

Dylan Patel 00:03:20

回顾过去所有的技术转型——无论是铁路、互联网、可替换零件、工业化还是云计算——每一次革命从技术发现到经济中的普及速度都在不断加快。许多参加过 Dwarkesh 播客的人都认为,这是最后一次技术革命或转型,而这一次的情况非常、非常不同。

至少在市场上,短短三年内,我们已经看到超大规模云服务商明年的资本支出飙升至 5000 亿美元,这种速度是此前任何革命都无法比拟的。最终状态似乎也截然不同。你对这个问题的看法,与我所说的那种"AI 狂热者"——他们高喊"AGI 即将到来"——似乎很不一样。我想更深入地了解你的观点。

Satya Nadella 00:04:17

我首先也怀有同样的兴奋感——也许工业革命之后,这就是最重大的事件。我以此为出发点。但与此同时,我也清醒地认识到,这仍然处于早期阶段。我们已经构建了一些非常有用的东西,看到了许多出色的特性,这些缩放定律似乎也在发挥作用。我乐观地认为它们会继续奏效。其中一部分确实需要真正的科学突破,但也涉及大量的工程工作和其他方面。

话虽如此,我也倾向于认为,即便是过去 70 年计算领域所发生的一切,也是一场帮助我们前进的征程。我很喜欢 Raj Reddy 对人工智能的一个比喻。他是卡内基梅隆大学的图灵奖得主。甚至在通用人工智能出现之前,他就对 AI 有过这样一个比喻:它要么应该是一位守护天使,要么应该是一个认知放大器。我很喜欢这个说法。这是一个思考 AI 本质的简单方式。归根结底,它对人类有什么用处?它将成为认知放大器和守护天使。如果我这样看,我就把它看作一种工具。

但你也可以从非常玄妙的角度来看待它,说这不仅仅是一种工具。它做了所有这些事情,而此前这些事情只有人类才能做到。但过去许多技术也是如此。很多事情只有人类能做,然后我们有了能完成这些事情的工具。

Dwarkesh Patel 00:05:56

我们不必纠结于这里的定义,但一种思考方式是,也许需要五年、十年、二十年。在某个时间点,最终一台机器会产出“萨提亚 token”,而微软董事会认为这些“萨提亚 token”价值连城。

Dylan Patel 00:06:10

你通过采访萨提亚,浪费了多少这部分经济价值?

Dwarkesh Patel 00:06:15

我负担不起“萨提亚 token”的 API 成本。不管你怎么称呼它,“萨提亚 token”是工具还是智能体,都无所谓。现在,如果你有成本在每百万 token 几美元甚至几美分量级的模型,那里就有巨大的利润空间,因为一百万个“萨提亚 token”价值极高。我的问题是,这部分利润会流向哪里,以及微软能在多大程度上参与其中。

Satya Nadella 00:06:45

从某种意义上说,这又回到了一个根本问题:经济增长的图景究竟会是什么样?企业会变成什么样?生产力又会如何?对我来说,这才是关键所在。如果工业革命创造了……在技术扩散七十年后,你才开始看到经济增长。这是另一件需要记住的事。即使这次技术扩散的速度更快,要实现真正的经济增长,它必须扩散到工作本身、工作成果以及工作流程都必须发生改变的程度。所以我认为,企业要实现真正的变革,所需的变革管理能力是我们不应低估的。

展望未来,人类及其产生的模型 token 是否会获得更高的杠杆效应——无论是未来的 Dwarkesh token 还是 Dylan token?想想技术的体量。没有技术,你能运营 SemiAnalysis 或这个播客吗?绝无可能,至少无法达到你目前所实现的规模。

所以问题在于,这个规模有多大?它会不会因为某些新技术的出现而放大十倍?绝对会。因此,无论你是要达到某个收入数字,还是达到某个受众规模,或者其他什么目标,我认为这都将会发生。关键在于,工业革命花了七十年,也许一百五十年才实现的事,可能在二十年、二十五年内就发生。如果幸运的话,我很乐意把工业革命两百年间发生的变化压缩到二十年内完成。

Dylan Patel 00:08:28

微软历来可能是最伟大的软件公司,也是最大的软件即服务公司。你们在过去经历过一次转型——过去你们销售 Windows 许可证和 Windows 或微软的光盘,而现在你们销售 Microsoft 365 的订阅服务。

当我们从那个转型阶段过渡到你们今天的业务时,这之后也正在发生另一场转型。软件即服务的每用户增量成本极低。研发投入很大,客户获取成本也很高。这大致就是为什么——不是微软,而是SaaS公司在市场上表现严重不佳的原因,因为AI的销售成本实在太高,这彻底打破了这些商业模式原有的运作方式。

作为或许是全球最伟大的软件即服务公司,你打算如何带领微软过渡到这个销售成本至关重要、每用户增量成本截然不同的新时代?因为目前你们的收费方式还是,“嘿,Copilot 只要 20 美元。”

萨提亚·纳德拉 00:09:29

这是个很好的问题,因为从某种意义上说,商业模式本身的杠杆仍将保持相似。如果你看看从消费端到企业端的整个模型菜单,会有一些广告单元,会有一些交易,会有为制造AI设备的人准备的设备毛利率。还会有订阅模式,包括消费者和企业级,然后是按量计费。所以我仍然认为这些都是计量的方式。

回到你的观点,什么是订阅?到目前为止,人们喜欢订阅是因为他们可以为此做预算。订阅本质上是对某些消费权利的授权,这些权利被封装在订阅中。所以我认为这在某种程度上成了一个定价决策。你被授权消费多少——如果你看看所有编程类的订阅服务,它们本质上就是这样的,对吧?然后还有专业版、标准版等等。所以我认为这就是定价和利润率结构将如何分层的方式。

有趣的是,对微软来说,好消息是我们恰好涉足所有这些计量方式的业务。在投资组合层面,我们几乎同时拥有按量计费、订阅模式,以及所有其他面向消费者的杠杆。我认为时间会告诉我们,这些模式中哪些在哪些类别里是行得通的。

既然你提到了 SaaS 方面,我对此思考很多。以 Office 365 或 Microsoft 365 为例。低 ARPU 是件好事,原因很有趣。在从服务器向云端迁移的过程中,我们过去常问自己的一个问题是:“天哪,如果我们只是把当时使用 Office 许可证和 Office 服务器的同一批用户迁移到云端,并且我们还有销售成本,这不仅会压缩我们的利润率,而且我们从根本上会变成一家盈利能力更低的公司。”

但实际发生的情况是,向云端迁移极大地扩展了市场。我们在印度卖出了几台服务器,但销量不大。然而在云端,突然间印度的每个人都能负担得起按份额购买服务器和 IT 成本了。事实上,我当初没有意识到的最重要的一点是,人们在 SharePoint 底层存储上的花费有多大。实际上,EMC 最大的业务板块可能就是为 SharePoint 提供存储服务器。所有这些在云端都消失了,因为没人需要再去购买。实际上,这曾是营运资本,意味着它本质上是现金流出。所以,云端极大地扩展了市场。

因此,AI 这件事也会如此。以编程为例,我们用 GitHub 和 VS Code 花了数十年打造的东西,编程助手在一年内就达到了那样的规模。我认为接下来也会发生同样的事情,那就是市场会大规模扩张。

00:12:48 - Copilot

Dwarkesh Patel 00:12:48

问题在于,市场会扩张,但触及微软的那部分收入会扩张吗?Copilot 就是一个例子。如果你看今年早些时候,根据 Dylan 的数据,GitHub Copilot 的收入大约是 5 亿美元左右,而且没有接近的竞争对手。而现在,Claude Code、Cursor 和 Copilot 的收入都差不多,大约在 10 亿美元左右。Codex 也在追赶,大约在 7 到 8 亿美元。所以问题是,在微软能够触及的所有界面中,微软的 Copilot 同类产品有什么优势?

Satya Nadella 00:13:25

顺便说一句,我很喜欢这张图表。

我非常喜欢这张图表,原因有很多。一是我们仍然位居榜首。二是这里列出的所有公司,都是在过去四五年间诞生的。对我来说,这是最好的迹象。你有了新的竞争对手,新的生存危机。当你说,现在是谁?Claude 会干掉你,Cursor 会干掉你,而不是 Borland。谢天谢地。这意味着我们走在正确的方向上。

就是这样。我们从零发展到这种规模,这就是市场扩张。这就像云服务之类的东西。从根本上说,编码和 AI 这个类别很可能会成为最大的类别之一。它就是软件工厂类别。事实上,它可能比知识工作还要大。我想对此保持开放的心态。

我们将面临激烈的竞争。这是你的观点,说得很好。但我很高兴我们能把已有的优势转化为现在的局面,现在我们必须去竞争。在竞争方面,即使在我们刚刚结束的上一个季度,我们发布了季度公告,我认为我们的订阅用户从 2000 万增长到了 2600 万。我对我们的订阅增长以及未来的发展方向感到满意。

但更有趣的事情是,猜猜其他那些生成大量代码的公司,他们的所有代码仓库都去了哪里?它们都去了 GitHub。GitHub 在仓库创建、Pull Request 等所有指标上都处于历史最高水平。从某种意义上说,我们想保持这种开放性。这意味着我们想要拥有它。我们不想把它和我们自身的增长混为一谈。有趣的是,我们大概每一秒就有一位开发者加入 GitHub,我记得数据是这样的。而其中 80% 的人,仅仅因为存在,就自然而然地进入了某个 GitHub Copilot 工作流。顺便说一句,其中许多工具甚至还会使用我们的一些代码审查智能体,这些智能体默认是开启的,因为你随时可以使用。我们在这方面会有很多很多结构性的机会。我们接下来要做的,和我们当初对 Git 所做的类似。GitHub 的基础组件,从 Git 开始,到 Issues,再到 Actions,这些都是强大而美妙的东西,因为它们基本上都是围绕你的代码仓库构建的。我们想要扩展这一点。

上周在 GitHub Universe 大会上,我们大致就是这么做的。我们提出了 Agent HQ 这一概念性构想,并计划将其构建出来。例如,你会看到一个名为“任务控制中心”的东西。进入任务控制中心后,我就可以开始下达指令。有时我把它形容为所有这些 AI 智能体的“有线电视”,因为本质上,我会将 Codex、Claude、Cognition 的产品、任何人的智能体、Grok 等,全部打包到一个订阅服务里。这样我就能获得一个综合套餐,然后直接发布任务并引导它们,让它们都在各自独立的分支上工作。我可以监控它们。我认为这将成为最大的创新领域之一,因为现在我希望能够使用多个智能体。我希望能够整合多个智能体的输出结果。我还希望能够牢牢掌控我的代码仓库。

如果需要构建某种平视显示器,让我能够快速引导和分类编码智能体生成的内容,那么对我来说,这需要结合 VS Code、GitHub,以及我们将作为“任务控制中心”控制平面来构建的所有这些新原语。可观测性……想想所有将要部署这些东西的人。这将需要一整套可观测性能力,来追踪哪个智能体在什么时间对哪个代码库做了什么。我认为这就是机遇所在。

归根结底,你的观点很有道理,那就是我们最好保持竞争力并不断创新。如果我们不这样做,就会被颠覆。但我喜欢这张图表,至少只要我们还处于领先地位,即使面临竞争也是如此。

Dylan Patel 00:17:26

这里的关键点在于,无论谁的编码智能体最终胜出,GitHub 都将继续增长。但那个市场本身可能只以 10%、15% 或 20% 的速度增长,这远高于 GDP 增速。这是一个很棒的复利增长点。然而,这些 AI 编码智能体的业务规模,从去年年底大约 5 亿美元的年化收入(当时只有 GitHub Copilot),增长到了现在,涵盖 GitHub Copilot、Claude Code、Cursor、Cognition、Windsurf、Replit、OpenAI Codex 等,今年第四季度的年化收入已经达到 50 到 60 亿美元。这是 10 倍的增长。

当你审视软件智能体的总可寻址市场时,它是指你支付给员工的 20000 亿美元工资,还是比那更大的范畴?因为现在世界上每家公司都能更多地开发软件?毫无疑问微软会从中分一杯羹。但你们的市场份额在短短一年内就从接近 100%(或者说肯定远高于 50%)跌到了 25% 以下。人们凭什么相信微软能继续赢下去?

萨提亚·纳德拉 00:18:30

这又回到了之前的一点,迪伦——这里没有与生俱来的权利,我们不应该有任何自信,只能说我们应该去创新。从某种意义上说,我们知道自己拥有的幸运之处在于,这个品类将比我们之前占据高份额的任何东西都要大得多。让我这么说吧。你可以说我们在 VS Code 中占有高份额,我们在 GitHub 的代码仓库中占有高份额,那是一个不错的市场。但关键在于,在一个广阔得多的市场中即使只占有不错的份额……

你可以说我们在客户端-服务器计算领域占有高份额。我们在超大规模计算领域的份额要低得多。但这是不是一门大得多的生意?数量级的差距。所以至少有一个存在性证明:只要我们所竞争的市场在创造更多价值,即使我们的份额地位不如从前,微软也一直过得不错。而且会有多个赢家。事情就是这样。

但我接受你的观点,归根结底这意味着你必须变得有竞争力。我每个季度都在关注这一点。这就是为什么我对我们即将用 Agent HQ 做的事情非常乐观——把 GitHub 变成所有这些智能体汇聚的地方。正如我所说,我们会在那里有多次射门机会。不一定非得……其中一些参与者可以和我们一起成功,所以不一定只有一个赢家、一个订阅。

00:20:02 - 谁的利润率会扩张得最多?

德瓦克什·帕特尔 00:20:02

我想关注这个问题的原因在于,这不仅关乎 GitHub,从根本上说还关乎 Office 以及微软提供的所有其他软件。关于 AI 如何发展,你可以有一种设想:模型会一直受到限制,你需要始终拥有这种直接可见的可观察性。

另一种愿景是,随着时间的推移,这些目前能完成耗时两分钟任务的模型,未来将能处理耗时 10 到 30 分钟的任务。再往后,它们或许能自主完成需要数天的工作量。届时,模型公司可能会收取数千美元的费用,以提供一种真正的“同事”——它可以使用任何用户界面与人类沟通,并在不同平台间迁移。

如果我们正接近那个阶段,为什么那些越来越赚钱的模型公司没有攫取全部利润?为什么随着 AI 能力越来越强而变得不那么重要的“脚手架”环节,反而会如此关键?这就像现在存在的 Office 软件,与那些只是从事知识工作的同事之间的对比。

萨提亚·纳德拉 00:21:07

这是个很好的观点。所有价值都会转移到模型上吗?还是会在脚手架和模型之间分配?我认为时间会给出答案。但我的基本观点是,激励机制会变得清晰。以信息工作为例,或者就拿编程来说。事实上,我在 GitHub Copilot 中最喜欢的设置之一叫做“自动”,它会自动进行优化。实际上,我购买订阅后,“自动”模式就会开始根据我要求它做的事情进行选择和优化。它甚至可以完全自主运行。它可以在多个模型之间套利可用的 token 来完成一项任务。

如果你接受这个论点,那么其中的商品化部分将是模型。尤其是有了开源模型,你可以选择一个检查点,然后利用你的一堆数据,你就能看到效果。我认为我们所有人——无论是来自 Cursor 还是微软——都会开始看到一些内部模型的出现。然后你会将大部分任务交给它处理。

所以一种观点是,如果你赢得了脚手架——目前它需要处理这些智能问题中的各种障碍或“锯齿状”问题,这是你必须做的——如果你赢得了它,那么你就会垂直整合到模型中,仅仅是因为你拥有数据的流动性等等。未来将有足够多的检查点可用。这是另一回事。

从结构上看,我认为世界上始终会存在一个能力相当不错的开源模型,你可以拿来使用,前提是你有与之配合的东西,也就是数据和脚手架。我可以论证,如果你是一家模型公司,你可能会遭遇“赢家诅咒”。你可能完成了所有艰苦的工作,实现了令人难以置信的创新,但距离被商品化只差一次复制。而拥有用于接地和上下文工程的数据以及数据流动性的人,就可以获取那个检查点并对其进行训练。所以我认为正反两方面的论点都能成立。

Dylan Patel 00:23:36

梳理一下你所说的,世界上存在两种观点。一种观点认为,市面上有如此多不同的模型。开源模型也存在。模型之间会存在差异,这些差异将在一定程度上决定谁胜谁负。但脚手架才是让你获胜的关键。

另一种观点则认为,实际上模型才是核心知识产权。每个人都处于激烈的竞争中,并且存在某种“嘿,我可以用 Anthropic 或 OpenAI”的情况。你可以从收入图表中看到这一点。OpenAI 的收入一旦他们最终拥有了与 Anthropic 能力相似(尽管方式不同)的代码模型后,便开始飞速增长。

还有一种观点认为,模型公司才是攫取所有利润的一方。因为纵观今年,至少在 Anthropic,其推理的毛利率从远低于 40% 增长到了年底的 60% 以上。尽管中国的开源模型比以往任何时候都多,但利润率仍在扩大。OpenAI 具有竞争力,Google 具有竞争力,X/Grok 现在也具有竞争力。所有这些公司现在都具备竞争力,然而尽管如此,模型层的利润率却显著扩大了。你对此怎么看?

Satya Nadella 00:24:43

这是个很好的问题。也许几年前人们会说:“哦,我只需要封装一个模型就能建立一家成功的公司。”这种说法可能已经被证伪了,这主要是因为模型的能力以及所使用的工具。

但有趣的是,当我审视 Office 365 时,就拿我们构建的这个叫 Excel Agent 的小东西来说吧。它很有意思。Excel Agent 并不是一个 UI 层面的包装器。它实际上是一个位于中间层的模型。在这种情况下,因为我们拥有 GPT 系列的全部知识产权,我们正将其植入 Office 系统的核心中间层,让它学会如何原生地理解 Excel 及其内部的一切。这不仅仅是“嘿,我只有像素级的理解”。它完全理解 Excel 的所有原生构件。因为你想一想,如果我要让它执行一些推理任务,我甚至需要修正自己犯下的推理错误。这意味着我不仅要看到像素,还要能看出“哦,那个公式我搞错了”,并且我需要理解这一点。

在某种程度上,这一切并非通过 UI 包装层加一些提示词来完成,而是在中间层通过教会它 Excel 的所有工具来实现的。我基本上是给它一个 Markdown 格式的说明,来教会它如何成为一名精通 Excel 的用户。这有点奇怪,因为它又回到了 AI 大脑的层面。你构建的不仅仅是传统意义上的 Excel 和业务逻辑。你是在传统意义上的 Excel 业务逻辑之上,用这个知道如何使用工具的模型,包裹上一层认知层。从某种意义上说,Excel 将自带一个分析师,以及所有会用到的工具。这就是大家都会去构建的那类东西。

所以即便是模型公司,它们也必须参与竞争。如果它们定价过高,你猜怎么着,如果我是一个这类工具的构建者,我就会用别的模型来替代你。我可能会暂时用你一阵子。所以只要存在竞争…… 总会有赢家通吃的情况。如果有一个模型能遥遥领先于其他所有模型,那确实是赢家通吃。但只要存在竞争,有多个模型可供选择,就像超大规模计算领域的竞争一样,并且还有开源模型作为制衡,那么在模型之上构建价值就有足够的空间。

在微软,我的看法是,我们将继续深耕超大规模业务,这将支撑起多个模型。我们还将拥有 OpenAI 模型长达七年的使用权,并在此基础上进行创新。从根本上说,我认为我们拥有一个前沿级别的模型,可以完全灵活地使用和进行创新。同时,我们也会通过 MAI 构建自己的模型。因此,我们始终会拥有模型层面的能力。然后,无论是在安全、知识工作、编程还是科学领域,我们都会构建自己的应用框架,这些框架将以模型为核心。它不会是模型的简单包装,而是将模型融入应用之中。

Dwarkesh Patel 00:28:04

关于你提到的其他事情,我有很多问题。但在我们进入这些话题之前,我仍然在想,这是否没有前瞻性地看待 AI 能力,你似乎还是以今天模型的样子来想象它们。它能截取你的屏幕截图,但无法查看每个单元格内部以及其中的公式是什么。我认为这里更好的思维模型是,想象这些模型能够像人类一样熟练地使用计算机。一个使用 Excel 的人类知识工作者可以查看公式、使用替代软件、在必要时将数据在 Office 365 和其他软件之间迁移,等等。

萨提亚·纳德拉 00:28:43

这正是我想说的。

Dwarkesh Patel 00:28:45

但如果情况如此,那么与 Excel 的集成就没那么重要了。

萨提亚·纳德拉 00:28:48

不,不,别担心 Excel 集成这件事。毕竟,Excel 是作为分析师工具而构建的。很好。那么,无论这个作为分析师的 AI 是谁,它都应该拥有可以使用的工具。

Dwarkesh Patel 00:29:03

它们有计算机。就像人类可以使用计算机一样。那就是它们的工具。

萨提亚·纳德拉 00:29:05

工具就是计算机。所以我要说的是,我本质上是在构建一个作为 AI 智能体的分析师,它恰好先天就具备如何使用所有这些分析工具的知识。

Dwarkesh Patel 00:29:20

为了确保我们说的是同一件事,是不是像我这样的人使用 Excel……

萨提亚·纳德拉 00:29:30

不,它是完全自主的。所以我们现在或许应该阐述一下我对公司未来走向的看法。公司的未来将是工具业务,我有一台电脑,我使用 Excel。事实上,未来我甚至还会有一个 Copilot,而这个 Copilot 也将拥有智能体。但一切仍由我掌控,所有信息都会反馈给我。这是一个世界。

第二个世界是,公司仅仅为某个 AI 智能体提供计算资源,而该智能体完全自主地工作。这个完全自主的智能体本质上将拥有一套可供其使用的、具象化的相同工具。因此,这个接入的 AI 工具拥有的不仅仅是一台裸机,因为使用工具来完成任务在模型 token 利用上会更高效。

事实上,我倾向于这样看待:我们目前的业务是面向终端用户的工具业务,但未来将本质上转变为支持智能体工作的基础设施业务。这是另一种思考方式。实际上,我们在 M365 底层构建的所有东西仍然会非常重要。即使你是 AI 智能体,你仍然需要存储、归档、发现和管理所有这些活动的地方。这是一种新的基础设施。

Dwarkesh Patel 00:31:00

为了确保我理解正确,您是说理论上,未来一个具备实际计算机使用能力(这正是目前所有模型公司都在努力的方向)的 AI,即使它没有与微软合作或不在我们的体系内,也可以使用微软的软件。但您的意思是,如果它使用我们的基础设施,我们会为其提供更低层次的访问权限,使其在执行原本也能通过其他方式完成的相同任务时,效率更高?

萨提亚·纳德拉 00:31:24

百分之百正确。过去我们有服务器,然后出现了虚拟化,接着我们有了更多的服务器。这是另一种理解方式。不要把工具看作是最终目的。人类使用工具时,工具底层的整个基础架构是什么?这个完整的基础架构同样也是 AI 智能体的启动基础,因为 AI 智能体也需要一台计算机。

事实上,我们观察到增长最为显著的一个有趣现象是:那些正在制作 Office 文档制品以及从事自主智能体等工作的开发者,都希望配置 Windows 365。他们确实希望能够为这些智能体配置一台计算机。没错。正因如此,我们将实质上拥有一个终端用户计算基础设施业务,这个业务会持续增长,因为其增长速度将超过用户数量的增长速度。

这也是人们常问我的另一个问题:“嘿,按用户计费的业务会怎样?”至少从早期迹象来看,或许可以这样理解按用户计费业务:它不仅仅是按用户计费,而是按智能体计费。如果你说是按用户和智能体计费,那么关键就在于要为每个智能体配置什么?一台计算机、一套围绕它的安全措施、一个与之关联的身份。所有这些东西,包括可观测性等,都属于管理层。这些都将被整合到其中。

Dylan Patel 00:32:54

看待这个问题的方式——至少是我目前的想法,也很想听听你的看法——是这些模型公司都在构建环境,用于训练它们的模型使用 Excel、在亚马逊购物或预订机票等。但与此同时,它们也在训练这些模型进行迁移。因为这可能是当下最具直接价值的事情:将基于大型机的系统转换为标准云系统,将 Excel 数据库转换为带有 SQL 的真正的数据库,或者将 Word 和 Excel 中完成的工作转换为更程序化、更高效的传统方式,这些工作人类同样可以完成。只是对软件开发者来说,这样做成本效益不高。

这似乎是未来几年内,至少是短期内,所有人利用AI大规模创造价值的方式。如果模型能够自主利用工具迁移到其他平台,微软在其中将扮演什么角色?是的,微软在数据库、存储以及所有其他类别中占据领导地位,但Office生态系统的使用量将显著减少,就像大型机生态系统的使用量可能会减少一样。实际上,大型机在过去二十年里仍在增长,尽管已经没人再谈论它们了。

萨提亚·纳德拉 00:34:16

完全同意。

迪伦·帕特尔 00:34:17

这如何体现?

萨提亚·纳德拉 00:34:18

归根结底,在相当长一段时间内,我们将处于一个混合世界。因为人们将使用那些需要与智能体协作的工具,而这些智能体又必须使用工具,并且彼此之间需要通信。我生成的产物是什么?人类需要看到什么?所有这些都是任何场景中实实在在需要考虑的因素,包括输出和输入。我认为这不仅仅是“哦,我迁移走了”那么简单。关键在于,我必须生活在这个混合世界中。

但这并没有完全回答你的问题,因为可能会出现一个真正高效的新前沿,即智能体与智能体协作,实现完全优化。即使智能体与智能体协作,需要哪些基本要素?是否需要存储系统?该存储系统是否需要具备电子取证功能?是否需要可观测性?是否需要一套身份系统,让多个模型共用同一个身份体系?这些都是我们今天为Office系统或其他系统所拥有的核心底层基础设施。未来我们同样需要这些。

你之前提到过数据库。我是说,天哪,我真希望整个 Excel 都能有一个数据库后端。我希望这一切能立刻实现。而且那个数据库得是个好数据库。事实上,数据库将是一个会不断壮大的重要领域。如果我想象所有 Office 工件都能被更好地结构化,并且由于智能体世界的到来,结构化与非结构化数据之间的连接能力得以提升,那么这将推动底层基础设施业务的发展。而这一切的消耗,恰恰都是由智能体驱动的。

你可以说,这一切不过是一家模型公司即时生成的软件。这种说法也可能成立。我们也会成为这样一家模型公司。我们将构建……竞争格局可能是,我们会构建一个模型,再加上所有基础设施并对其进行配置,然后那些有能力做到这一点的公司之间就会展开竞争。

00:36:17 - MAI

Dwarkesh Patel 00:36:17

说到模型公司,你说你们不仅会拥有基础设施,还会拥有模型本身。目前,微软 AI 两个月前发布的最新模型在 Chatbot Arena 中排名第 36。你显然拥有 OpenAI 的知识产权。如果你认同这一点,那看起来似乎落后了。为什么会这样,尤其是考虑到理论上你有权 fork OpenAI 的 monorepo 或蒸馏他们的模型,特别是如果拥有领先的模型公司是你战略的重要组成部分?

萨提亚·纳德拉 00:36:51

首先,我们绝对会在所有产品中最大限度地使用 OpenAI 的模型。这是我们在未来七年里会一直坚持的核心工作,而且不仅仅是使用,还会在此基础上增加价值。这就是分析师和这个 Excel 智能体的意义所在——这些都是我们将要做的事情,我们会进行强化学习微调。我们还会在 GPT 系列模型之上进行一些中间训练,利用我们独特的数据资产来构建能力。

对于 MAI 模型,我认为我们应当这样看待它:新协议带来的好消息是,我们可以非常明确地组建一支世界级的超级智能团队,并以极高的雄心去推进。但与此同时,我们也要利用这段时间,明智地思考如何将这两者结合起来。这意味着,一方面我们要高度聚焦产品,另一方面也要高度聚焦研究。因为我们能够使用 GPT 系列模型,我最不希望做的事情就是让我的算力仅仅用于重复劳动,而没有带来太多价值。

我希望能够利用我们用于生成 GPT 系列模型的算力,将其价值最大化,同时让我的 MAI 算力用于……以我们推出的图像模型为例,它在图像竞技场中排名第九。我们既用它来做成本优化,它也部署在 Copilot 和必应中,我们会继续使用它。我们在 Copilot 中还有一个音频模型,它具备个性等等。我们针对自己的产品对它进行了优化。所以我们会做这些事情。

即便在 LMArena 上,我们从文本模型起步,它首次亮相时排名大约在第 13 位。顺便说一句,它只用了大约 15,000 块 H100 就完成了训练。这是一个非常小的模型。所以,这再次证明了核心能力、指令遵循能力以及其他各方面。我们想确保自己能够达到业界最先进的水平。这向我们表明,根据缩放定律,如果我们投入更多算力,我们能够实现什么。接下来我们要做的是一款全模态模型,它将融合我们在音频、图像和文本方面所做的工作。这将是 MAI 这边的下一个重要里程碑。

因此,当我思考 MAI 路线图时,我们将打造一支一流的超级智能团队。我们将继续以开放的方式发布其中一些模型。这些模型要么会用于我们的产品,因为它们对延迟友好、成本友好或具备其他优势,要么会拥有某种特殊能力。我们将开展真正的研究,为迈向超级智能所需的未来五、六、七、八项突破做好准备——同时利用我们拥有的 GPT 模型家族这一优势,在此基础上继续推进。

迪伦·帕特尔 00:39:45

假设我们快进七年,你不再能使用 OpenAI 的模型。微软要如何确保自己领先,或拥有一个领先的 AI 实验室?如今,无论是规模扩展还是推理能力,OpenAI 已经取得了许多突破。而谷歌则开发了 Transformer 架构等所有突破性技术。

但这同样是一场人才争夺战。你已经看到 Meta 在人才上投入了超过 200 亿美元。你也看到 Anthropic 去年从谷歌挖走了整个 Blueshift 推理团队。最近,Meta 又从谷歌挖走了一个庞大的推理和后训练团队。这类人才战争非常耗费资金。可以说,如果你在基础设施上投入 1000 亿美元,那么你也应该花相应数额的资金在那些使用基础设施的人才身上,以便他们更高效地实现这些新突破。

人们凭什么相信微软会拥有一支世界级的团队,能够实现这些突破?一旦你决定打开资金水龙头——你现在在资本效率上做得不错,看起来也很明智,没有把钱浪费在重复工作上——但一旦你决定需要这么做,人们又怎么能说:“哦,好吧,现在你们能冲进前五的模型行列了”?

萨提亚·纳德拉 00:41:00

归根结底,我们要打造一支世界级的团队,而一支世界级的团队已经开始组建。穆斯塔法即将加入,还有凯伦。阿马尔·苏布拉马尼亚,他在 Gemini 2.5 项目中负责了大量后训练工作,现在在微软。南多,他在 DeepMind 主导了许多多媒体方面的工作,也在那里。我们将打造一支世界级的团队。事实上,就在本周晚些时候,穆斯塔法会发布一些内容,更清晰地说明我们实验室未来的方向。

或许,我想让世界知道的是,我们将构建能够支持多种模型的基础设施。因为从超大规模的角度来看,我们希望打造规模最大的基础设施集群,能够支持世界所需的所有模型,无论是来自开源社区,还是显然也包括 OpenAI 及其他公司的模型。这是我们的任务之一。

其次,在我们自身的模型能力方面,我们绝对会在产品中使用 OpenAI 的模型,同时也会开始构建我们自己的模型。而且,我们可能——就像 GitHub Copilot 中使用了 Anthropic 的模型一样——甚至会将其他前沿模型也整合到我们的产品中。我认为,每一次都是如此……归根结底,产品在完成特定任务或工作时的实际表现才是关键。我们会从这一点出发,反向进行必要的垂直整合,因为我们深知,只要产品能很好地服务市场,你总能找到成本优化的方法。

Dwarkesh Patel 00:42:31

未来有一个问题。目前,我们的模型在训练和推理之间存在区别。有人可能会说,不同模型之间的差异正变得越来越小。展望未来,如果你真的期待某种接近人类水平的智能,那么人类是在工作中学习的。想想你过去的三十年,是什么让萨提亚的 token 如此有价值?正是你在微软积累的过去三十年的智慧和经验。

我们最终会拥有达到人类水平的模型,它们将具备在工作中持续学习的能力。在我看来,这将为领先的模型公司带来巨大价值,因为该模型的多个副本会被广泛部署到经济体系中,学习如何完成每一项工作。与人类不同,它们可以将各自学到的知识整合回那个模型。这就形成了一种持续学习的指数级反馈循环,几乎就像一场智能爆炸。

如果这种情况发生,而微软到那时并非领先的模型公司……你的意思是,我们可以用一个模型替代另一个,等等。那是不是就没那么重要了?因为这一个模型知道如何完成经济体系中的每一项工作,而其他处于长尾位置的模型则做不到。

萨提亚·纳德拉 00:43:39

你的观点是,如果世界上只有一个模型被最广泛地部署,它能看见所有数据并进行持续学习,那游戏就结束了,可以关门大吉了。但至少在我看来,现实情况是,在当今世界,尽管某个模型可能占据主导地位,但并非如此。以编程为例,存在多个模型。事实上,这种情况每天都在减弱。并没有一个模型被广泛部署。而是有多个模型正在被部署。这就像数据库一样。人们总在问:“能不能有一个数据库被到处使用?”但事实并非如此。有不同类型的数据库被部署用于不同的用例。

我认为,任何模型都会因持续学习而产生某种网络效应——我称之为数据流动性。这种情况会在所有领域发生吗?我不这么认为。会在所有地区发生吗?我不这么认为。会在所有细分市场发生吗?我不这么认为。会在所有类别中同时发生吗?我也不这么认为。因此,我觉得设计空间如此之大,机会仍然非常充足。

但你的核心观点是,要拥有基础设施层、模型层和脚手架层的能力,并且能够将这些能力组合起来——不是简单地垂直堆叠,而是根据各自的目的进行组合。你不能构建一个只为单一模型优化的基础设施。如果那样做,万一你落后了怎么办?事实上,你构建的所有基础设施都将白费。你需要构建一个能够支持多个模型家族和系列的基础设施。否则,你投入的资本,如果只针对一种模型架构优化,就意味着只要出现一次类似 MoE 的突破性调整,你的整个网络拓扑结构就作废了。这是一件可怕的事情。

因此,你希望基础设施能够支持你自身模型家族以及其他模型家族未来可能出现的任何东西。你必须保持开放。如果你认真对待超大规模业务,你就必须认真对待这一点。如果你认真对待成为一家模型公司,你就必须说:“人们可以在模型之上做哪些事情,以便我能拥有一个 ISV 生态系统?”除非我认为自己能掌控每一个品类,否则这根本行不通。那样你就不会有 API 业务,而这必然意味着你永远无法成为一家成功部署到任何地方的平台公司。因此,行业结构会迫使人们走向专业化。在这种专业化中,像微软这样的公司应该在每一层都凭自身实力去竞争,而不是认为这只是一条通往“一锤定音”的道路,只需垂直整合所有这些层级就行。这种情况根本不会发生。

00:47:47 - 超大规模业务

Dylan Patel 00:47:47

所以去年,微软本有望成为迄今为止最大的基础设施提供商。你是 2023 年最早行动的,所以你走出去,获取了所有资源,包括租赁数据中心、启动建设、确保电力供应,等等。你们本有望在 2026 年或 2027 年超越亚马逊。当然,到 2028 年你们肯定能超过他们。

自那以后,姑且称之为去年下半年,微软进行了一次大规模暂停,放弃了一批原本计划租用的数据中心场地,而这些场地随后被谷歌、Meta、亚马逊(部分情况下)以及甲骨文接手。

我们现在就坐在全球最大的数据中心之一里面,所以显然并非所有项目都停了,你们仍在疯狂扩张。但确实有一些场地你们停止了建设。为什么要这么做?

萨提亚·纳德拉 00:48:32

这要稍微回溯一下,超大规模云业务的核心究竟是什么?我们做出的一个关键决策是:如果我们要把 Azure 打造成一个能够完美支持 AI 全阶段——从训练到中间训练、数据生成再到推理——的平台,那么整个计算集群就必须具备可互换性。正是这一考量,导致我们基本上没有针对特定几代硬件去建设大量容量。

因为你们还需要意识到另一件事:迄今为止,我们每 18 个月就将训练容量提升 10 倍,足以支撑 OpenAI 的各种模型。我们认识到,关键在于保持这一发展路径。但更重要的是实现平衡——不仅要训练,还要能够在全球范围内部署这些模型。因为归根结底,货币化的速度才能让我们持续获得资金支持。而基础设施还需要能够支持多种模型。

因此,一旦我们明确了这一点,就及时调整了方向,回到了现在这条道路上。如果审视我们当前的道路,我们现在启动的项目比以前多得多。我们也在尽可能多地获取托管容量——无论是自建、租赁,还是以 GPU 即服务的形式获取。但我们的建设都是基于实际看到的需求、推理服务需求以及训练需求来进行的。我们不想仅仅成为某一家公司的托管方,只拥有一个客户的庞大业务量。那不算一门生意——你应该与那家公司进行垂直整合。

鉴于 OpenAI 将成为一家成功的独立公司,这非常棒。这合情合理。甚至 Meta 也可能使用第三方算力,但最终它们都会转向自建。对于任何拥有大规模业务的公司来说,它们自己就会成为超大规模云服务商。对我来说,关键就是打造一支超大规模的计算集群以及我们自己的研究算力。这就是调整的方向。因此,我感觉非常、非常好。

顺便说一句,另一件事是,我不想被某一代产品的庞大规模所困住。我们刚刚看到 GB200 系列,GB300 系列也即将到来。等到我部署 Vera Rubin、Vera Rubin Ultra 的时候,数据中心的面貌将截然不同,因为每机架功耗、每排功耗将发生巨大变化。冷却需求也将大不相同。这意味着,我不想仅仅为了某一代、某一系列产品就建设整整几吉瓦的算力。所以我认为,节奏很重要,可替代性和地理位置很重要,工作负载的多样性很重要,客户的多样性也很重要,而这正是我们正在努力构建的方向。

我们学到的另一件事是,每一项 AI 工作负载不仅需要 AI 加速器,还需要大量其他组件。事实上,我们很大一部分利润结构将来自这些其他组件。因此,我们希望将 Azure 打造成能够出色处理长尾工作负载的平台,因为这才是超大规模云服务的本质所在,同时我们也清楚,我们必须从最高端训练的裸金属服务开始,保持极强的竞争力。

但这不能挤占其他业务,因为我们的业务不仅仅是与五个客户签订五份裸金属服务合同。那不是微软的业务模式。那可能是其他公司的业务,这很好。我们说过,我们从事的是超大规模云服务业务,归根结底,这是一项面向 AI 工作负载的长尾业务。为了做到这一点,我们将为包括我们自己在内的一系列模型提供领先的裸金属即服务能力。我认为,这就是你看到的平衡点。

Dylan Patel 00:52:41

围绕这个可互换性话题,还有一个问题。好吧,数据中心并不在你理想的位置,你更希望它位于像亚特兰大这样人口密集的中心。我们现在就在这里。还有一个问题是,随着 AI 任务的时间跨度不断增长,这一点有多重要?从推理提示词的 30 秒,到深度研究的 30 分钟,再到未来软件智能体可能需要数小时、数天乃至更久才能完成与人类的交互。那么,它位于 A、B 还是 C 地点,又有什么关系呢?

萨提亚·纳德拉 00:53:14

这是个很好的问题。确实如此。事实上,这也是我们想要思考 Azure 区域应该是什么样子,以及 Azure 区域之间网络连接如何的另一个原因。我认为,随着模型能力的演进和这些 token 使用方式的变化——无论是同步还是异步——你都不希望自己处于不利的位置。

此外,还有数据驻留法律的问题。整个欧盟的情况就是如此,我们不得不创建一个欧盟数据边界。这基本上意味着,你不能随意将调用往返于任何地方,即使是异步调用也不行。因此,你可能需要拥有高密度的区域性设施,同时还要考虑电力成本等因素。

但你提出的一点完全正确:我们构建的拓扑结构必须不断演进。首先,要考虑每瓦特每美元的 token 成本。经济账怎么算?在此基础上,还要叠加使用模式。使用模式包括同步和异步。同时还要考虑计算和存储。因为延迟对某些事情可能很重要。存储最好就在附近。如果我的 Cosmos DB 靠近这里,用于会话数据甚至自主系统,那么它也必须位于附近,诸如此类。所有这些考量因素,都将塑造超大规模云业务的形态。

迪伦·帕特尔 00:54:38

在暂停之前,我们曾为你预测,到 2028 年你的规模将达到 12 到 13 吉瓦。现在我们大约是 9.5 吉瓦。

但更关键的一点是——我希望你能更明确地承认,这是你不想涉足的业务——那就是甲骨文(Oracle)的规模将从你体量的五分之一,发展到2027年底超过你。

虽然他们的投入资本回报率达不到微软的水平,但他们仍然能实现35%的毛利率。所以问题在于,也许微软确实不适合做这项业务,但通过拒绝这项业务、放弃优先购买权等做法,你实际上已经创造出了一个超大规模云服务商。

萨提亚·纳德拉 00:55:23

首先,我不想否定甲骨文在建设自身业务方面取得的成功,我祝他们一切顺利。我想我已经回答过你的问题是,对我们来说,去为一家模型公司做托管商,且其收入承诺(RPO)时间窗口有限,这并不合理。就这么说吧。

你需要思考的不是未来五年做什么,而是未来五十年做什么。我们已经做出了我们的一系列决策。我对我们与OpenAI的合作关系以及我们正在做的事情感到非常满意。我们的业务储备相当可观。我们祝愿他们取得巨大成功。事实上,我们本身就是甲骨文算力容量的买家。我们祝他们成功。

但在这一点上,我认为我们试图实现的产业逻辑已经非常清晰,那就是这并非为了追逐……首先,顺便说一句,我一直在追踪你提到的那些指标,无论是AWS、谷歌还是我们自己的,我认为这非常有用。但这并不意味着我必须去追逐它们。我追逐它们,不能仅仅因为它们在某个时期内可能代表的毛利率。微软真正能够且应该去清理的业务储备是什么?那才是我们会去做的事。

德瓦克什·帕特尔 00:56:40

即使我们退一步来看,我也有个问题。我理解你的观点,即在其他条件相同的情况下,拥有一个可以从中获得更高利润的长尾客户群,比向少数实验室提供裸金属服务是更好的生意。但接下来有个问题是,这个行业的发展方向是什么?如果我们相信我们正走在通往越来越智能的AI的道路上,那么为什么行业的形态不是OpenAI、Anthropic和DeepMind成为那个长尾企业实际开展业务的平台呢?它们需要裸金属,但它们是平台。那么,直接使用Azure的长尾客户是谁?因为你想要使用通用的认知核心。

萨提亚·纳德拉 00:57:22

但这些模型都将可以在Azure上使用,所以任何说“嘿,我想用某个开源模型和一个OpenAI模型”的工作负载,如果你今天去Azure Foundry,你可以配置所有这些模型,购买PTU,获取Cosmos DB,获取SQL数据库,获取一些存储,获取一些计算资源。这才是真实的工作负载的样子。真实的工作负载不仅仅是向模型发起一个API调用。真实的工作负载需要所有这些要素来构建一个应用或实例化一个应用程序。

事实上,模型公司需要这些才能构建任何东西。这不仅仅是“我有一个token工厂”。我必须拥有所有这些要素。这就是超大规模业务。而且它不依赖于任何一个模型,而是依赖于所有这些模型。所以,如果你想要Grok加上,比如说,OpenAI再加上一个开源模型,那就来Azure Foundry,配置它们,构建你的应用程序。这里还有一个数据库。这大概就是这项业务的样子。

还有一项独立的业务,叫做单纯向模型公司出售原始裸金属服务。而关于你想在多大程度上参与这项业务、不想参与多少、以及它具体是什么,都存在争议。这是业务中一个非常不同的细分领域,我们参与其中,同时我们也对其可能挤占其他业务的程度设定了限制。但至少我是这么看的。

迪伦·帕特尔 00:58:40

这里其实涉及两个问题。一是,为什么不能两者兼顾?二是,根据我们对 2028 年自身容量的估算,实际少了 3.5 吉瓦。当然,你可以把这部分容量专门用于 OpenAI 的训练和推理,但也可以用来支撑 Azure、Microsoft 365 和 GitHub Copilot 的日常运行。我完全可以自己建好,然后不给 OpenAI 用。

萨提亚·纳德拉 00:59:08

或者,我可能想建在别的地方。比如阿联酋、印度、欧洲。正如我所说,考虑到监管要求和数据主权需求,我们目前确实面临容量瓶颈,必须在全球各地建设。首先,美国本土的容量至关重要,我们当然想全力建设。

但展望 2030 年,我会从全球视角审视微软的业务形态,包括第一方和第三方。第三方又细分为前沿实验室及其需求规模,以及我们为多种模型准备的推理容量,还有自身的研究算力需求。这些都会纳入我的考量。你指出的暂停确实存在,但暂停的原因并非“天哪,我们不想建了”。而是我们意识到,需要根据工作负载类型、地理位置以及时间节点,以略有不同的方式来建设我们真正想要的东西。

我们会持续提升吉瓦级容量,关键在于以什么速度、在什么地点推进。以及如何顺应摩尔定律——我是否真的要在 2027 年过度建设 3.5 吉瓦,还是应该把这一规模分摊到 2027-2028 年,即便知道……我们从英伟达身上学到的最重要一课就是,他们的技术迭代速度也在不断加快。

这是一个重要因素。我不想被某一代产品拖住四五年,承受折旧损失。事实上,黄仁勋给了我两点建议。第一,要以光速执行。这就是为什么我们在亚特兰大数据中心能做到……我的意思是,从我们拿到设备到交付给实际工作负载,只需要大约90天。这在那方面确实是光速执行。我希望在这方面做到出色。

这样一来,我每一代都在规模上持续建设。然后每五年,你就能拥有一个更加均衡的体系。这实际上就变成了像这样大规模工业运营的流程——你突然不再失衡,不会因为一次性投入太多而被困住,正如你所说,所有资源都集中在一个地点,这个地点可能很适合训练,但未必适合推理,因为即使全是异步处理,欧洲也不会允许我把数据往返传输到得克萨斯。所以这些都是需要考虑的因素。

Dylan Patel 01:01:38

我该如何理解你过去几周的做法与刚才这番话之间的关系?你宣布了与Iris Energy、Nebius和Lambda Labs的合作,而且后续还有更多。你正在从这些新型云服务商那里租用算力,而不是自己建设。

萨提亚·纳德拉 01:01:58

这对我们来说没问题,因为当你对需求有清晰预见,并且这些需求可以在别人建设的地方得到满足时,这很好。事实上,我们会采用租赁、定制化建设,甚至算力即服务的方式——当我们没有算力但需要算力,而别人正好有。

顺便说一句,我甚至欢迎所有新型云服务商加入我们的市场。因为你想,如果他们把自己的算力带到我们的市场,那么通过Azure来的客户就会使用这些新型云服务——这对他们是巨大的胜利——同时他们还会使用Azure的计算、存储、数据库等所有其他服务。所以我完全不认为“嘿,我应该把所有东西都自己吞掉”。

01:02:44 - 自研芯片与OpenAI合作

Dwarkesh Patel 01:02:44

你提到这种折旧资产,在五六年内会占到数据中心总拥有成本的75%。而黄仁勋在这上面赚取75%的利润率。所以所有超大规模云厂商都在努力开发自己的加速器,以降低这笔高昂的设备成本,从而提高自身利润率。

迪伦·帕特尔 01:03:09

如果看各家进展,谷歌遥遥领先于其他所有人。他们做这件事的时间最长。

他们自家TPU的产量将达到大约五百万到七百万颗。再看亚马逊,他们试图生产三百万到五百万颗(生命周期出货量)。但当我们看微软自家芯片的订单量时,远低于这个数字。你们的项目也开展了同样长的时间。你们内部芯片的进展如何?

萨提亚·纳德拉 01:03:32

问得好。有几点需要考虑。首先,任何新加速器面临的最大竞争对手,往往甚至是英伟达的上一代产品。在集群中,我关注的是整体总拥有成本。即便对我们自己的芯片,我也有很高的标准——顺便说一句,我刚刚看过Maia 200的数据,看起来很不错,但我们在计算侧也学到了一点……我们之前大量使用英特尔芯片,后来引入了AMD,再后来引入了Cobalt。我们就是这样逐步扩展的。至少在核心计算领域,我们有很好的实证,证明如何自研芯片,并管理一个让三者以某种平衡共同运行的集群。

因为,顺便说一句,就连谷歌也在购买英伟达的芯片,亚马逊也一样。这很合理,因为英伟达在不断创新,而且它是通用平台。所有模型都能在上面运行,客户需求也确实存在。因为如果你构建自己的垂直方案,你最好有自己的模型——要么用它做训练,要么做推理——而且你必须自己创造需求,或者补贴需求。因此,你要确保以适当规模进行扩展。

我们的做法是,在我们自己的 MAI 模型与我们的芯片之间建立紧密的闭环,因为我认为,这正是你自主研发芯片的天然权利所在——你完全是根据自己的需求来设计微架构,然后与自身模型的迭代保持同步。对我们而言,好消息是 OpenAI 有一个我们可以访问的项目。因此,认为微软不会拥有某种——

Dylan Patel 01:05:15

你们能访问到什么程度?

Satya Nadella 01:05:16

全部。

Dylan Patel 01:05:17

也就是说,你们获得了所有这些知识产权?那么你们唯一没有的知识产权就是消费级硬件?

Satya Nadella 01:05:20

没错。

Dylan Patel 01:05:21

哦,好的。有意思。

Satya Nadella 01:05:26

顺便说一句,我们也给了他们大量知识产权,帮助他们起步。这也是他们能够……的原因之一。因为我们共同建造了所有这些超级计算机。我们为他们建造了这些,他们也理所当然地从中受益。现在,随着他们在系统层面进行创新,我们也能获得所有成果。我们首先希望将他们构建的东西实例化,为他们所用,然后我们再将其扩展。

所以,如果要说的话,我对你问题的看法是,微软希望成为英伟达出色的、我称之为“光速”的执行合作伙伴。因为坦率地说,整个计算集群就是生命线本身。显然,黄仁勋凭借其利润率做得非常出色,但总拥有成本(TCO)涉及多个维度,我希望能在 TCO 方面做到极致。在此基础上,我希望能够真正与 OpenAI 体系、MAI 体系以及系统设计展开合作,因为我们知道我们在两端都拥有知识产权。

Dwarkesh Patel 01:06:32

说到权利,你在几天前的一次采访中提到,在与 OpenAI 达成的新协议中,你们拥有对 OpenAI 无状态 API 调用的独家权利。我们有点困惑,是否真的存在任何状态。你刚才提到,未来所有这些复杂的工作负载都需要内存、数据库和存储等。如果 ChatGPT 在会话中存储数据,那这还算无状态吗?

Satya Nadella 01:07:03

这就是原因所在。我们做出的战略决策,同时也兼顾了 OpenAI 为获取算力所需的灵活性……你可以把 OpenAI 想象成同时拥有 PaaS 业务和 SaaS 业务。SaaS 业务是 ChatGPT。PaaS 业务是他们的 API。这个 API 是 Azure 独占的。而 SaaS 业务,他们可以在任何地方运行。

Dylan Patel 01:07:31

而且他们可以跟任何想合作的人合作来构建 SaaS 产品?

Satya Nadella 01:07:34

如果他们想要一个合作伙伴,而那个合作伙伴想使用无状态 API,那么 Azure 就是他们获取无状态 API 的地方。

Dylan Patel 01:07:43

似乎他们有一种方式可以共同构建产品,而且这是一个有状态的东西……

Satya Nadella 01:07:47

不,即使那样,他们也必须来 Azure。再说一次,这样做是本着“我们珍视合作伙伴关系中的什么”的精神。同时,我们确保,考虑到 OpenAI 所需的所有灵活性,我们是他们的好合作伙伴。

Dylan Patel 01:08:05

那么举个例子,Salesforce 想要集成 OpenAI。不是通过 API。他们实际上是一起合作,共同训练一个模型,然后部署在,比方说,亚马逊上。这允许吗?还是他们必须使用你们的……

Satya Nadella 01:08:16

对于任何这样的定制协议,他们都必须来运行它……我们做了一些例外,比如美国政府等等,但除此之外,他们必须来 Azure。

01:09:35 - 资本支出爆炸

Dwarkesh Patel 01:09:35

退一步说,当我们在工厂里来回走动时,你谈到的一件事是,微软,你可以把它看作一家软件公司,但现在它真的正在变成一家工业公司。所有这些资本支出,所有这些建设。仅看过去两年,你们的资本支出已经增长了两倍左右。如果你把这个趋势外推,它实际上会变成一场巨大的工业爆炸。

Dylan Patel 01:10:01

其他超大规模云服务商也在举债。Meta 在路易斯安那州发行了 200 亿美元的债券,还做了公司贷款。很明显,所有人的自由现金流都在趋近于零——我敢肯定,你要是敢这么干,Amy 肯定会狠狠批评你——但实际情况就是这样。

萨提亚·纳德拉 01:10:19

我认为你提到的结构性变化是巨大的。我的描述是,我们现在既是一家资本密集型业务,也是一家知识密集型业务。事实上,我们必须利用我们的知识来提高资本支出的投资资本回报率。

硬件厂商在宣传摩尔定律方面做得非常出色,我认为这令人难以置信,也非常棒。但即使你看一下我在财报电话会议上引用的一些数据,对于某个 GPT 系列模型来说,我们在每美元每瓦特 token 吞吐量方面,通过软件优化所取得的季度环比和年度同比提升,都是巨大的。在某些情况下,提升幅度达到 5 倍、10 倍,甚至 40 倍,这完全取决于你如何进行优化。这就是知识密集型带来的资本效率提升。在某种程度上,这正是我们必须掌握的核心能力。

有人问我,传统托管服务商和超大规模云服务商之间的区别是什么?答案是软件。没错,这确实是资本密集型业务,但只要你拥有系统知识,以及按工作负载、按集群进行优化的软件能力……这就是为什么当我们谈论可互换性时,其中包含了大量的软件成分。这不仅仅是集群本身的问题。

关键在于能够驱逐一个工作负载,然后调度另一个工作负载。我能否管理好这个调度算法?这正是我们必须做到世界一流的领域。所以,是的,我认为我们仍将是一家软件公司,但没错,这是一项不同的业务,我们会管理好它。归根结底,微软拥有的现金流使我们能够同时让这两条业务线良好运转。

Dwarkesh Patel 01:12:18

似乎短期内,你更倾向于认为事情需要一段时间才能发展,过程会更加曲折。但从长远来看,也许你认为那些谈论 AGI 和 ASI 的人是正确的。Sam 最终会是对的。

我有一个更宏观的问题:考虑到你必须对这项五年折旧的资产进行巨额投资,对于超大规模云服务商来说,什么才是合理的做法?如果像山姆这样的人预期三年内实现的目标,你这边要等到2040年,那么在这种情况下,你做什么才是合理的?

萨提亚·纳德拉 01:12:52

需要有一部分资金分配给——我称之为——研究型算力。这应该像你做研发投入一样去做。坦白说,这是最合理的核算方式。我们应该把它视为纯粹的研发支出,然后问自己:“研究型算力需要多少?你打算如何扩展它?” 就算说要在某个时期内实现一个数量级的增长。你自己选个时间,是两年?还是16个月?随你定。这算是入场券的一部分,属于研发费用。

其余部分则完全由需求驱动。最终,你可以超前于需求进行建设,但你最好有一个不会完全偏离轨道的需求计划。

德瓦克什·帕特尔 01:13:39

你相信……这些实验室现在预测2027-28年收入将达到1000亿美元,并且预测收入将以每年3倍、2倍的速度持续增长……

萨提亚·纳德拉 01:13:50

当前市场上存在各种激励因素,这也很合理。你指望一个试图融资的独立实验室做什么呢?他们必须拿出一些数字,这样他们才能真正去筹集资金,以便支付算力账单和其他开销。

这是一件好事。总会有人承担风险并投入其中,而且他们已经展现出了进展。这并非全是风险,而看不到他们已经取得的成果——无论是OpenAI,还是Anthropic。所以我对他们所做的一切感到非常满意,而且我们与这些伙伴有大量的业务往来。因此,这一切都很好。

但归根结底,有两件简单的事。一是你必须为研发进行投入。你提到了人才。AI 领域的人才非常稀缺。你必须在这方面花钱。你还得在算力上花钱。所以从某种意义上说,研究人员与 GPU 的配比必须很高。这大致就是在这个世界上成为一家领先研发公司的必要条件。这是一件需要规模化的事情,而且你必须拥有足够强大的资产负债表,才能在它成为普遍共识之前很久就支撑起这种规模化。这算是其中一件事。但另一件事则完全关乎如何预测未来。

01:15:07 - 世界会信任美国公司来引领 AI 发展吗?

Dylan Patel 01:15:07

纵观全球,美国在许多技术栈上都占据主导地位。美国通过微软拥有 Windows,它甚至在中国也有部署,是主要的操作系统。当然,还有开源的 Linux,但 Windows 在中国个人电脑上无处不在。再看看 Word,它也是无处不在。看看所有这些不同的技术,它们都无处不在。微软和其他公司也在其他地方发展壮大。他们在欧洲、印度以及所有其他地区——东南亚、拉丁美洲和非洲——建设数据中心。在所有这些不同的地方,你都在建设能力。

但这似乎截然不同。如今,技术、算力所涉及的政治层面……美国政府并不关心互联网泡沫。但似乎美国政府,以及世界上其他所有政府,都非常关心 AI。问题是,我们处于一个两极分化的世界,至少美国和中国是这样,但欧洲、印度以及所有其他国家都在说:“不,我们也要拥有主权 AI。”

微软要如何应对这种与 90 年代不同的局面——那时世界上只有一个重要的国家,那就是美国,我们的产品销往世界各地,因此微软受益匪浅——而如今却进入了一个两极分化的世界?在这个世界里,微软不一定理所当然地有权赢得整个欧洲、印度或新加坡。实际上存在着主权 AI 的举措。你对此的思考过程是怎样的?你如何看待这个问题?

Satya Nadella 01:16:36

这是一篇极其关键的文章。我认为,美国科技行业和美国政府的重中之重,是确保我们不仅要开展领先的创新工作,还要在全球范围内共同建立对我们技术栈的信任。因为我常说,美国是一个不可思议的地方。它在历史上是独一无二的。它拥有世界4%的人口,25%的GDP,以及50%的市值。我认为你应该思考这些比例并加以反思。

这50%之所以存在,坦率地说,是因为世界对美国怀有信任——无论是其资本市场,还是其技术,以及它在任何特定时期对领先行业关键事务的管理。如果这种信任被打破,那对美国来说就不是好事。我们以此为基础,我认为特朗普总统、白宫、大卫·萨克斯,实际上所有人都明白这一点。

因此,我赞赏美国政府与科技行业共同采取的任何行动,例如,作为一个行业,我们在全球各地共同承担自身资本的风险。我希望美国政府能够因美国公司在全球范围内的外国直接投资而获得赞誉。这是最不常被提及,但却是美国应该做的最好的营销——这不仅关乎流入美国的外国直接投资,更在于最领先的行业,即这些AI工厂,正在世界各地被建立起来。由谁建立?由美国和美国公司。

因此,你以此为起点,然后围绕它建立其他协议,涉及它们的连续性、合理的主权关切,以及数据驻留等问题,让它们拥有真正的自主权和隐私保障。事实上,我们对欧洲的承诺值得一读。我们就如何管理在欧洲的超大规模投资做出了一系列承诺,以确保欧盟和欧洲各国拥有主权。

我们还在法国和德国建设主权云。我们推出了名为 Azure 主权服务(Sovereign Services on Azure)的产品,它实际上为用户提供密钥管理服务以及机密计算能力,包括 GPU 上的机密计算——我们与英伟达在这方面开展了出色的创新合作。因此,我非常有信心,无论是从技术层面还是政策层面,我们都能够建立起对美国技术栈的这种信任。

Dwarkesh Patel 01:19:42

随着模型层面出现持续学习等网络效应,您认为这一局面将如何演变?也许超大规模云平台层面也存在类似的情况。您预计各国会说“看,很明显一个或几个模型是最好的,所以我们会使用它们,但我们会制定法律,要求模型权重必须托管在我们国家境内”吗?还是说,您预计会出现一种推动力,要求模型必须在本国境内训练?

或许可以打个比方:半导体对经济至关重要,各国都希望拥有自己的主权半导体,但台积电就是做得更好。而半导体对经济如此重要,以至于你只能去台湾购买半导体。你不得不这么做。人工智能也会是这样吗?

萨提亚·纳德拉 01:20:26

归根结底,重要的是人工智能在其经济中的应用,以创造经济价值。这就是扩散理论,最终起决定作用的不是领先的行业,而是利用领先技术创造自身比较优势的能力。所以我认为,这从根本上来说将是核心驱动力。

但话虽如此,他们也会希望这种局面具有连续性。所以从某种意义上说,我相信这也是为什么总会有人质疑“嘿,这个模型会不会出现失控式部署?”的原因之一。这就是为什么开源将永远存在。从定义上讲,必然会有多个模型。这将是一种方式。这也是人们要求连续性、避免集中化风险的一种方式——换种说法就是如此。

所以你会说:“嘿,我想要多个模型,然后我还想要一个开源的。”我觉得只要这一点存在,每个国家都会觉得:“好吧,我不必担心部署最好的模型并广泛推广,因为我随时可以拿走我的数据和流动性,把它转移到另一个模型上,无论是开源的,还是来自其他国家的,或者其他什么。”集中度风险与主权——这实际上就是自主权——这两点将决定市场结构。

迪伦·帕特尔 01:21:49

问题在于,半导体行业并不存在这种情况。所有冰箱、汽车里的芯片都是台湾制造的。

萨提亚·纳德拉 01:21:56

直到现在才出现这种情况。

迪伦·帕特尔 01:22:00

即便如此,如果台湾被切断供应,就不会再有汽车或冰箱了。台积电亚利桑那厂并不能替代任何实际比例的生产。所谓的主权,某种程度上可以说是一种骗局。拥有它是有价值的,拥有它也很重要,但它并不是真正的主权。我们是一个全球经济体。

萨提亚·纳德拉 01:22:21

我认为这有点像在说:“嘿,到了这个地步,我们对于韧性意味着什么以及需要做什么,还一无所知。”任何国家,包括美国在内,到了这个地步都会不惜一切代价,在某些关键供应链上变得更加自给自足。

所以,我作为一家跨国公司的负责人,必须把这一点作为首要考量。如果我不这么做,那我就没有尊重那个国家长期的政策利益。我并不是说他们不会在短期内做出务实的决策。当然,全球化不可能就这么倒退。所有这些资本投资也不可能以那种方式、那种速度进行……但与此同时,想想看,如果有人跑到华盛顿说:“嘿,我们不打算建任何半导体工厂了,”他们会被赶出美国。在其他每个国家,情况也会一样。

因此,作为企业,我们必须尊重这些经验教训,无论是否因为疫情让我们警醒。但无论如何,人们都在说:“全球化确实很棒,它让供应链全球化且极其高效。但还有一种东西叫韧性,我们需要韧性。”所以,这种特性将会被构建出来。

我认为你提出的关键在于速度。你不能打个响指就说所有台积电的工厂现在都搬到亚利桑那州,并且具备全部产能。这是不可能的。但有没有计划?会有计划。我们是否应该尊重这一点?当然。所以我觉得这就是现实世界。我想顺应世界的现状以及它未来的发展方向,而不是说:“嘿,我们有一个不尊重你观点的看法。”

Dwarkesh Patel 01:24:24

为了确保我理解正确,这里的想法是每个国家都会想要某种数据驻留、隐私等要求。而微软在这方面尤其有优势,因为你与这些国家有关系,你在建立这类主权数据中心方面有专业知识。因此,微软在一个主权要求更多的世界里具有独特的适应性。

萨提亚·纳德拉 01:24:48

我不想把它描述成我们拥有某种独特的特权。我只想说,我认为这是一项业务要求,我们几十年来一直在做所有这些艰苦的工作,并且我们计划继续做下去。

所以,我对迪伦之前那个问题的回答是,我认真对待——无论是在美国,当白宫和美国政府说“我们希望你们将更多的晶圆启动量分配给美国的晶圆厂”时,我们认真对待。或者,无论是数据中心和欧盟边界的问题,我们也认真对待。所以对我来说,尊重各国关心主权的合理原因,并将其作为软件和物理设施来构建,这就是我们将要做的事情。

Dylan Patel 01:25:40

随着我们走向两极世界——美国与中国——竞争不再只是你与亚马逊、你与Anthropic、或你与谷歌之间的较量。整个竞争格局中涌现出大量参与者。美国要如何重建信任?你们会采取什么行动来重建信任?从而传达出“实际上,不,美国公司将成为你们的主要供应商”这一信息。同时,你如何看待与崛起的中国公司之间的竞争,无论是字节跳动和阿里巴巴,还是深度求索和月之暗面?

Dwarkesh Patel 01:26:13

补充一下这个问题,一个担忧在于,我们正在讨论AI如何演变成一场工业资本支出竞赛,你需要在整个供应链上快速进行大规模建设。当你听到这一点时,至少到目前为止,你只会想到中国。这是他们的比较优势。尤其是,如果我们不会在明年就一步登天实现ASI,而是需要几十年的建设和基础设施投入,那么你如何应对中国的竞争?在那个世界里,他们是否拥有特权?

萨提亚·纳德拉 01:26:43

这是个很好的问题。事实上,你刚才恰好点明了为什么对美国科技的信任可能是最重要的特征。甚至可能不是模型能力本身。关键在于:“我能否信任你这家公司,能否信任你的国家及其制度,成为长期的供应商?”这或许才是赢得全球市场的关键。

Dwarkesh Patel 01:27:10

这是个很好的收尾话题。萨提亚,感谢你接受这次访谈。

萨提亚·纳德拉 01:27:14

非常感谢。

Dylan Patel 01:27:16

谢谢。

萨提亚·纳德拉 01:27:18

太棒了。你们两位真是绝佳的搭档。

来源:Dwarkesh Patel:Podcast & Blog(RSS) · dwarkesh.com