跳到正文
北京时间
原文
Dwarkesh Patel:Podcast & Blog(RSS)· Dwarkesh Patel·· 2026-03-14精选

Dylan Patel — 深度剖析 AI 算力扩展的三大瓶颈

Dylan Patel — Deep dive on the 3 big bottlenecks to scaling AI compute

AI 导读

Dylan Patel 深度解析了制约 AI 算力规模扩张的三大核心瓶颈:电力基础设施限制、先进制程芯片产能不足以及网络互联带宽瓶颈。尽管 NVIDIA H100 已发布三年,受供需严重失衡及新一代芯片交付延迟影响,其市场价格与战略价值持续攀升,当前实际价值甚至超过发布初期。文章指出,这些结构性约束正重塑 AI 基础设施的投资逻辑与部署节奏。

推荐理由

顶尖硬件分析师拆解AI算力扩张的三大瓶颈,揭示H100为何比三年前更值钱

正文 · AI 翻译

并逐一剖析了实验室、超大规模云服务商、晶圆厂以及芯片制造设备供应商的经济逻辑。

关于技术栈的每一个层级,我都学到了海量知识。祝阅读愉快!

赞助商

  • Mercury 在这个报税季已经为我节省了大量时间。去年,我用 Mercury 向所有合作过的承包商索要了 W-9 表格。而到了今年需要发放 1099 表格时,我只需点击一个按钮,Mercury 就帮我全部寄出了。了解更多信息,请访问 mercury.com。

  • Labelbox 发现,即使语音模型表面上能应对打断,其性能实际上也会下降。为了弄清原因,他们构建了一个名为 EchoChain 的新型评估流水线。EchoChain 能够诊断语音模型的具体失效模式,让你了解模型真正需要什么才能妥善处理打断。请访问 labelbox.com/dwarkesh 查看详情。

  • Jane Street 本质上就是一个附带交易部门的研究实验室——他们的基础设施也印证了这一点。他们拥有数万块 GPU、数十万个 CPU 核心以及 EB 级的存储空间。这正是从嘈杂的市场数据中挖掘深层微弱信号所需的配置。如果你对此感兴趣,可以访问 janestreet.com/dwarkesh 查看空缺职位。

时间戳

00:00:00 – 为什么一块 H100 如今比三年前更值钱

好了,这一期节目是我的室友教我半导体知识。

Dylan Patel

这也是当前这套设备的告别演出。

确实如此。你用完之后,我就想:“这玩意儿我不能再用了,我得赶紧脱手。”

Dylan Patel

Dwarkesh 可不要捡别人剩下的。

Dylan 是 SemiAnalysis 的 CEO。Dylan,我有个迫切的问题想问你。如果把四大巨头——亚马逊、Meta、谷歌、微软——加起来,你最近发布的它们今年预测资本支出总额是 6000 亿美元。按租用这些算力的年度价格来算,这差不多相当于 50 吉瓦。显然,我们今年不可能部署 50 吉瓦的算力,所以这很可能是在为未来几年内陆续上线的算力买单。我们应该如何理解这些资本支出转化为实际算力的时间线?

同样的问题也适用于各大实验室。OpenAI 刚刚宣布融资 1100 亿美元,Anthropic 也宣布融资 300 亿美元。如果看他们今年即将上线的算力——你应该告诉我具体是多少,但总计是不是大约 4 吉瓦?OpenAI 和 Anthropic 今年为维持算力支出而租用算力的成本是每吉瓦 100 到 130 亿美元。仅这些单独的融资额就足以覆盖他们全年的算力支出。这还不包括他们今年将要获得的收入。

所以请帮我理解一下:第一,大型科技公司的资本支出实际上线的时间尺度是怎样的?第二,如果一吉瓦数据中心的年成本是 130 亿美元,那这些实验室筹集这么多钱是为了什么?

迪伦·帕特尔

所以当你谈到这些超大规模企业的资本支出达到约 6000 亿美元,再看整个供应链的其他部分,总额会达到约一万亿美元。其中一部分是用于今年立即上线的算力:即今年支付的芯片和其他资本支出部分。但也有大量是前期筹备性的资本支出。

当我们谈论今年美国新增 20 吉瓦的容量时,其中一部分并非今年支出。那部分资本支出实际上是在前一年支出的。以谷歌 1800 亿美元为例,其中很大一部分用于 2028 年和 2029 年的涡轮机定金。一部分用于 2027 年的数据中心建设。一部分用于购电协议、首付款以及他们为更远的未来所做的所有其他安排,以便能够实现这种超快速扩张。这适用于所有超大规模企业以及供应链中的其他参与者。

因此,今年大约部署 20 吉瓦,其中很大一部分来自超大规模企业,另一部分则不是。对于所有这些公司来说,他们最大的客户是 Anthropic 和 OpenAI。Anthropic 和 OpenAI 目前大约拥有两到两吉瓦半的算力,并且他们正试图将规模扩大得更大。

看看 Anthropic 过去几个月的表现,营收增加了 40 亿或 60 亿美元,我们可以直接画一条直线,说他们每个月还会再增加 60 亿美元营收。有人会认为这是悲观看法,觉得他们应该增长得更快。这意味着他们在未来十个月内将增加 600 亿美元营收。按照媒体最新报道的 Anthropic 当前毛利率计算,这 600 亿美元营收对应的推理计算支出大约为 400 亿美元。

这 400 亿美元的计算资源,按每吉瓦约 100 亿美元的租赁成本计算,意味着他们仅为了支撑营收增长,就需要增加 4 吉瓦的推理容量。这还是假设他们的研发训练集群保持不变的前提下。从某种意义上说,Anthropic 需要在今年年底前达到远高于 5 吉瓦的规模。这对他们来说确实非常困难,但并非不可能。

我能就此问个问题吗?如果 Anthropic 今年年底前无法达到 5 吉瓦的规模,但他们又需要这个规模来支撑已经远超预期的营收——而且可能还会更高——同时还要确保明年的模型足够优秀而进行研发和训练:那么这些算力要从哪里来?

迪伦·帕特尔

达里奥上次上你播客时非常保守。他说:“我不会在算力上疯狂投入,因为如果我的营收在不同时间点以不同速度增长……我不想破产。我要确保我们在规模化扩张上负责任。”但实际上,与 OpenAI 那种“我们就签下这些疯狂的大单子”的做法相比,他搞砸了。

到今年年底,OpenAI 能获得的算力将远超 Anthropic。Anthropic 要怎样才能获得这些算力?他们只能去找以前不会考虑的、质量较低的供应商。Anthropic 历来都选择最优质的供应商,比如全球最大的公司谷歌和亚马逊。而现在微软正在整个供应链上扩张,Anthropic 则转向其他较新的玩家。

OpenAI 在对接多个合作方方面表现得更为激进。没错,他们从微软、谷歌和亚马逊获得了大量算力,但他们也从 CoreWeave 和甲骨文获得了大量资源。他们还找了一些看似随机的公司,比如软银能源——这家公司从未建过数据中心,但现在却在为 OpenAI 建设数据中心。他们还找了其他许多公司,比如 NScale,来获取算力。

Anthropic 面临一个难题,因为他们在算力上过于保守,不想过于激进。从某种意义上说,去年下半年很多金融恐慌的原因在于:“OpenAI 签了所有这些协议,但他们没有钱来支付……” 好吧,甲骨文的股票要暴跌,CoreWeave 的股票也要暴跌。所有这些公司的股票都暴跌了,信贷市场也陷入混乱,因为人们认为最终买家无力支付。现在的情况变成了:“哦等等,他们融了一大笔钱。好吧,那他们能付得起了。”

Anthropic 则要保守得多。他们的态度是:“我们会签合同,但我们要有原则。我们会刻意低于我们自认为可能做到的水平,保持保守,因为我们不想有破产的风险。”

我想理解的是,在紧急情况下必须获取算力意味着什么?是不是只能去找那些新型云服务商?他们的算力更差吗?具体差在哪里?

你是否需要向云服务商支付额外的毛利率,而这些费用在正常情况下本不必支付,因为他们是在最后一刻才介入的?是谁建设了备用算力,使得 Anthropic 和 OpenAI 能够在最后一刻获取到?

如果到 2027 年 OpenAI 最终拥有的算力总量与 Anthropic 相近,那么 OpenAI 获得的具体优势是什么?他们是不是只是今年结束时拥有的千兆瓦数不同?如果是这样,到今年年底,Anthropic 和 OpenAI 各自将拥有多少千兆瓦的算力?

Dylan Patel

要获取超额算力,是的,超大规模云服务商确实有闲置容量。并非所有算力合同都是五年期的长期协议。有些算力来自2023年或2024年,或者2025年的H100,这些合同签署的期限较短。OpenAI的绝大部分算力都是通过五年期合同签署的,但还有许多其他客户签的是一年期、两年期、三年期或六个月期的按需合同。

随着这些合同到期,市场上谁最愿意出价?从这个角度看,我们看到H100的价格大幅上涨。人们甚至愿意以超过2美元的价格签署长期合同。我见过一些交易,某些AI实验室——我故意说得有点模糊——以高达2.40美元的价格签署了两到三年的H100合同。如果你考虑利润率,建造Hopper的成本是1.40美元,分摊到五年。现在,两年过去了,你以2.40美元的价格签署两到三年的合同?这些利润率要高得多。

现在你可以排挤掉所有其他供应商,无论是亚马逊、CoreWeave、Together AI、Nebius,还是其他任何公司。这些新型云服务商通常是Hopper占比更高的公司,因为它们在这方面更为激进。它们也倾向于签署更短期的合同——不是CoreWeave,而是其他公司。所以,如果我想要Hopper,市场上确实还有一些容量。

此外,虽然Oracle或CoreWeave的大部分Blackwell容量都是通过长期合同签署的,但本季度上线的任何容量都已经售出。在某些情况下,它们甚至没有达到承诺的销售数字,因为存在一些数据中心延迟——不仅仅是这两家,还有Nebius、微软、亚马逊和谷歌。但有很多新型云服务商,以及一些超大规模云服务商,它们正在建设尚未售出的容量,或者原本打算分配给某些内部用途(不一定专注于超级AGI)的容量,现在可能会转而出售。

以 Anthropic 为例,他们不必直接拥有全部算力。亚马逊可以拥有算力并提供 Bedrock 服务,谷歌可以拥有算力并提供 Vertex 服务,微软可以拥有算力并提供 Foundry 服务,然后与 Anthropic 进行收入分成,反之亦然。

基本上,你的意思是 Anthropic 要么以收入分成的形式支付这 50% 的溢价,要么以临时抢购算力的形式支付,而如果他们提前购买算力,本不必支付这笔费用。

Dylan Patel

没错,这确实需要权衡。但与此同时,整整四个月里,所有人都在对 OpenAI 说:“我们不会跟你签协议。”这听起来很疯狂,但原因在于“你没钱”。现在所有人又说:“OpenAI,我们一直都相信你。你现在融了这么多钱,我们可以签任何协议。”Anthropic 在这方面就受到了限制。目前能新增的算力买家并不多,因为 Anthropic 率先达到了那个能力层级,其收入正在飙升。

这很有意思。否则你可能会认为,拥有最好的模型是一种贬值极快的资产,因为三个月后你就没有最好的模型了。但拥有最好模型之所以重要,是因为你可以借此签署这些协议,提前锁定算力,并获得更优惠的价格。

这或许是个显而易见的观点。但至少直到最近,人们还在大谈特谈 GPU 的折旧周期问题。那些看空者,比如 Michael Burry 或其他人,曾说过:“看,人们说这些 GPU 能用四五年。也许是因为技术进步太快,但实际上,这些 GPU 采用两年折旧周期才合理。”这会增加特定年份报告中的摊销资本支出,使得建设所有这些云服务在财务上不那么有利可图。

但事实上,你指出折旧周期可能比五年更长。如果我们还在使用 Hoppers——尤其是如果 AI 真的腾飞,到 2030 年我们会说:“我们必须重启 7 纳米晶圆厂,必须重新启用 A100”——那么折旧周期实际上会非常长。我觉得这是你观点中一个有趣的财务含义。

迪伦·帕特尔

这里有几个线索可以展开。一个是,GPU 的折旧会如何变化?我想我之前没有回答你的问题,那就是我认为 Anthropic 到今年年底,通过自身以及其产品通过 Bedrock、Vertex 或 Foundry 提供服务,能够达到大约 5 吉瓦,可能还会略高一些。我认为他们能够达到 5 到 6 吉瓦,这远远超出了他们最初的计划。OpenAI 大致相同,实际上根据我们的数据会略高一些。

但无论如何,回到 GPU 的折旧周期。迈克尔·伯里说是三年或更短。这大致是他的论点。这里有两个视角可以看。从机械层面,有一个 TCO 模型,即 GPU 的总拥有成本,我们据此预测 GPU 的价格并构建集群的总成本。成本包括多项:你的数据中心成本、网络成本、智能运维以及数据中心里负责更换设备的人员成本。还有备件成本、实际芯片成本、服务器成本。所有这些不同的成本被汇总在一起。其中涉及一些折旧周期和某些信贷成本。

你会得出这样的结论:“嘿,如果折旧周期是五年,那么大规模部署 H100 的成本是每小时 1.40 美元。”如果你在这五年内以每小时 2 美元的价格签署协议,你的毛利率大约是 35%,略高于这个数。如果你以每小时 1.90 美元签约,毛利率也大约是 35%。然后你假设在第五年,这块 GPU 就彻底报废了。

在某些情况下,人们提出的论点是:如果你没有签署长期合同——因为英伟达每两年就会将性能提升三倍或四倍,而价格仅上涨一倍或50%……那么H100的价格……诚然,2024年市场价值可能是每GPU小时2美元,毛利率35%;但到了2026年,当Blackwell进入超高产量、每年部署数百万颗时,你实际上就只值每小时1美元了。而当2027年Rubin(尽管今年开始出货,但明年才进入超高产量)以每年数百万颗的规模部署到云端时,性能又提升了3倍,价格再涨50%或一倍,那么Hopper就只值每小时0.70美元了。因此,GPU的价格将持续下跌。这是其中一种视角。

另一种视角是:你从芯片中获得的效用是什么?如果你能制造出无限的Rubin或无限的最新型芯片,那么是的,情况确实会如此。随着新芯片推出、单位性能价格上升,Hopper的现货或短期合同价格会下跌。但由于半导体产能和部署时间线极为有限,实际决定这些芯片价格的,并非我今天能买到的对比产品,而是我今天能从这块芯片中获取的价值。

从这个意义上说,我们以GPT-5.4为例。GPT-5.4的运行成本远低于GPT-4,且活跃参数量更少。从活跃参数角度看,它小得多,因为它是更稀疏的MoE架构,而GPT-4是较粗糙的MoE架构。此外,在训练、强化学习、模型架构和数据质量方面还有许多其他进步,使得GPT-5.4远优于GPT-4,并且服务成本更低。当你审视一块H100时,它每GPU能为5.4生成的token数量,比运行GPT-4时要多。因此,它用更高质量的模型生成了更多的token。

GPT-4 模型 token 的最大可寻址市场规模(TAM)是多少?可能只有几十亿美元,也可能达到数百亿美元。采用需要时间。对于 GPT-5.4 来说,这个数字很可能超过一千亿美元。但存在采用滞后、竞争压力,以及所有其他厂商都在持续改进的问题。如果改进就此止步,那么一块 H100 的价值就将取决于 GPT-5.4 能从中获取的价值,而非 GPT-4 能获取的价值。这些实验室处于竞争环境中,因此它们的利润率不可能无限增长。这就形成了一种相当有趣的动态:一块 H100 今天比三年前更值钱。

这太疯狂了。从向前推进的角度来看,这也很有意思。如果我们真的开发出了 AGI 模型,如果服务器上真的有了一个真人……关于人脑能完成多少次浮点运算,这些数字都相当模糊。但按浮点运算量来算,一块 H100 估计能达到 1e15 次,这与一些人估算的人脑浮点运算量相当。显然,在内存方面,人脑要多得多。一块 H100 有 80 GB,而人脑可能有 PB 级。

迪伦·帕特尔

哦,是吗,你有 PB 级?给我报一个 PB 级的 0 和 1 字符串啊,老兄。给我报一个字符串。

嗯,这其实正是关键所在。

迪伦·帕特尔

不,我们只是拥有了有史以来最好的稀疏注意力技术。

不过说真的,在压缩的信息量方面,它可能达到 PB 级。人脑是一个极其稀疏的 MoE 模型。但无论如何,想象一下,一个人类知识工作者每年能创造六位数的价值。如果一块 H100 能产生接近这个水平的价值,如果我们真的在服务器上有了真人,那么一块 H100 的价值足以在几个月内收回成本。

所以当我采访达里奥时,我试图表达的观点并非我认为奇点两年后就会到来,因此达里奥迫切需要购买更多算力——尽管从收入角度看,他确实需要购买更多算力。我想表达的是:鉴于达里奥似乎一直在说的话——根据他的表态,我们距离一个“天才数据中心”还有两年,最多不超过五年,而一个“天才数据中心”理应创造数万亿美元的收入——那么,他为什么一直声称要在算力上更保守,或者用你的话说,在算力投入上不如 OpenAI 激进,这就完全说不通了。

我想这个观点被误解了,因为后来人们都在抨击我,说:“哦,这个播客主是想劝这家市值数千亿美元公司的CEO梭哈一把啊,老兄。”我只是想说,他内部的说法是自相矛盾的。不管怎样,能把这事说清楚是好事。

迪伦·帕特尔

我认为回到之前的观点:如果模型如此强大,那么一块 GPU 的价值会随时间增长。目前只有 OpenAI 和 Anthropic 持有这种观点。但随着我们进一步向前发展,每个人都会看到每块 GPU 的价值飙升。从这个意义上说,你现在就应该承诺投入算力。

有趣的是,按照 Anthropic 的风格,有个梗说他们有承诺恐惧症,而且有点多角恋倾向。不是指达里奥,但这确实是个流传的梗。

这就解释了一切。顺便说一句,有一种有趣的经济效应叫阿尔钦-艾伦效应,其核心思想是:如果你提高不同商品的固定成本,其中一种质量更高,另一种质量较低,那么在边际上,这会促使人们选择质量更高的商品。

举个具体的例子:假设味道更好的苹果售价两美元,品质较差的苹果售价一美元。现在假设你对它们征收进口关税。那么好苹果和中等苹果的价格就变成了三美元对两美元。

迪伦·帕特尔

这是因为两者都涨了一美元,还是应该涨 50%?

不,因为两者都涨了1美元。整体效果是,如果存在一个同时适用于两者的固定成本,那么它们之间的价格差——即价格比——就会发生变化。以前,较贵的那一个是前者的2倍,现在只是1.5倍了。

所以我在想,如果把这个逻辑套用到AI上,是不是意味着:如果GPU变得更贵,算力价格就会有一个固定成本的上涨。结果就是,这会促使人们愿意为稍好一点的模型支付更高的溢价。因为算盘是这样的:反正我都要花这么多钱在算力上,那还不如多花一点点,确保用的是最好的模型,而不是稍差一点的模型。

迪伦·帕特尔

所以Hopper从2美元涨到了3美元。如果一个Hopper能生成100万个Opus的token,也能生成200万个Sonnet的token,那么Opus和Sonnet之间的价格差就缩小了,因为GPU的价格涨了1美元,从2美元变成了3美元。

有意思。我觉得这非常有道理。我们看到,如今所有的流量都集中在最好的模型上,所有的收入也来自最好的模型。在一个算力受限的世界里,会发生两件事。第一,那些没有承诺问题、签了五年算力合同的公司,锁定了巨大的利润率优势。他们以两年前、三年前或五年前的交易价格,锁定了五年的算力。

而如果你那份五年合同已经执行了三年,别人的两年或三年合同到期了,现在他们想按当前价格——也就是按模型价值定价的价格——来购买算力,那价格就会高得多。所以,早期承诺签约的人总体上利润率更高。市场上签订长期合同的比例,远大于那些可以作为临时弹性产能、最后一刻才补充的短期合同比例。

与此同时,利润空间又流向何处?随着模型价值越来越高,云服务商能在多大程度上灵活调整定价?看看 CoreWeave,他们目前的平均合同期限超过三年。其超过 98% 的计算资源合同期都在三年以上。这就导致他们陷入一个困境:实际上无法灵活调整价格。但每年他们新增的计算能力都远超以往。

仅今年一年,Meta 新增的计算能力就相当于其 2022 年用于支撑 WhatsApp、Instagram 和 Facebook 所有业务以及开展 AI 工作的整个计算和数据中心集群的总和。他们今年单是新增的量就达到这个规模。

同样,你提到 Meta 在这样做,CoreWeave、谷歌和亚马逊也是如此,所有这些公司每年都在疯狂增加计算资源。这些新增的计算资源会以新的价格成交。从某种意义上说,是的,只要处于起飞阶段,你就已经被锁定了。“哦,OpenAI 去年从 600 兆瓦增长到 2 吉瓦,今年从 2 吉瓦增长到 6 吉瓦以上,明年再从 6 吉瓦增长到 12 吉瓦。”所有成本都集中在新增的计算资源上,而不是之前的长期合同。

那么,掌握主动权的是基础设施提供商,他们可以收取利润。现在,云服务商、新型云服务商或超大规模云服务商都能收取这部分利润。他们能在一定程度上做到,但再往上游看,谁掌握了所有的内存和逻辑芯片产能?大部分是英伟达。他们已经签署了大量长期合同。目前他们手握 900 亿美元的长期合同,并且正在与内存供应商谈判为期三年的新协议。

还有亚马逊和谷歌通过博通、亚马逊直接以及 AMD 这些公司。这些公司掌握着所有主动权,因为他们已经锁定了产能。台积电没有涨价,但内存供应商在某种程度上大幅提价。他们准备再次将价格翻倍甚至三倍,但同时也在签署这些长期协议。

能够获取所有边际利润的,可能是云服务商,可能是芯片供应商,也可能是内存供应商,直到台积电或 ASML 站出来说:“不,我们要大幅提价。”但与此同时,模型供应商能否获得高额利润?至少在今年,我们会看到模型供应商的利润率大幅上升。因为它们的产能严重受限,不得不抑制需求。Anthropic 不可能在保持当前发展速度的同时,不采取抑制需求的措施。

00:24:52 – 英伟达早早锁定了台积电的产能分配;谷歌正面临挤压

Dwarkesh Patel 1:20:33

我们来谈谈逻辑芯片和内存。英伟达具体是如何锁定这两者如此大的份额的?根据你的数据,到 2027 年,英伟达将占据 N3 晶圆产能的 70% 以上,大概是这个水平。我忘了 SK 海力士和三星等厂商的内存数据是多少。

想想新式云服务业务是如何运作的,以及英伟达是如何与之合作的;或者想想强化学习环境业务是如何运作的,以及 Anthropic 是如何与之合作的。在这两种情况下,英伟达都在刻意试图分化互补行业,以确保自身拥有尽可能多的议价能力。它们将产能分配给各种新式云服务商,以确保不会出现某一家公司掌握所有算力的局面。

类似地,Anthropic 或 OpenAI 在与数据提供商合作时,也会说:“不,我们要播下种子,培育一个庞大的行业生态,这样我们就不会被任何单一的数据环境供应商所束缚。”

我想知道,在 3 纳米制程上——这将是 Trainium 3、TPU v7 以及其他潜在加速器所使用的制程——为什么台积电要把所有产能都交给英伟达,而不是试图分化市场?

Dylan Patel

这里有几个要点。关于 3 纳米制程,如果我们回顾去年,苹果占据了 3 纳米产能的绝大部分。苹果正在转向 2 纳米制程。内存价格上涨,因此苹果的出货量可能会下降。随着内存价格上涨,他们要么削减利润,要么继续推进。由于存在长期合同,会有一定的时间延迟,但苹果很可能会减少需求,或者更快地转向 2 纳米制程,而目前 2 纳米制程仅适用于移动芯片。未来,AI 芯片也会转向该制程。所以苹果有这个打算。

苹果也在与第三方供应商洽谈,因为他们正逐渐被台积电挤出。台积电在高性能计算(HPC)、AI 芯片等领域的利润率高于移动芯片领域,因为他们在 HPC 领域的优势比在移动芯片领域更大。

当你审视台积电当前的运营逻辑时,他们实际上为那些生产 CPU 的公司提供了非常充足的产能分配。想想亚马逊,他们拥有 Trainium 和 Graviton,这两款芯片都采用 3 纳米制程,Graviton 是他们的 CPU,Trainium 是他们的 AI 芯片。台积电在分配产能时,对 Graviton 的兴趣远高于 Trainium,因为他们认为 CPU 业务增长更稳定、更长期。

作为一家保守的公司,不愿过度追随增长周期,你实际上应该优先将产能分配给增长更稳定、增速较低的市场,然后再将全部新增产能分配给高速增长的市场。这通常是普遍做法。AMD 也是如此。对于他们获得的 CPU 产能分配,台积电的兴趣远高于 GPU 产能分配。亚马逊的情况也一样。

英伟达的情况有些特殊,因为他们确实也生产 CPU、交换机、网络设备、NVLink、InfiniBand、以太网、网卡等产品。总体而言,随着 Rubin 架构及其整个芯片家族的发布(其中 GPU 最为重要),到今年年底,这些产品中的大部分都将采用 3 纳米制程。然而,英伟达仍然获得了大部分的供应量。

部分原因在于,你观察市场时,台积电等公司会以多种方式预测市场需求,但这也是一种市场信号。市场在传递信号:“嘿,明年我们需要这么多产能。我们需要这么多。我们会签署不可取消、不可退货的订单,甚至可能支付预付款。”英伟达只是比谷歌或亚马逊早得多地采取了行动。在某些情况下,谷歌和亚马逊遇到了阻碍。其中一款芯片延迟了大约几个季度。Trainium 这类事情也发生了。

在这种情况下,出现了一种巨大的声音:“好吧,这些公司在延迟,但英伟达想要更多、更多、更多、更多。我们正在与供应链的其他环节核实,产能是否足够?”他们去找所有 PCB 供应商,问:“PCB 产能够吗?”胜宏科技是英伟达最大的 PCB 供应商之一,而且是一家中国公司。所有 PCB 都来自中国,或者说其中大部分来自中国。他们问:“你们有足够的 PCB 产能吗?太好了。嘿,内存供应商,谁有足够的内存产能?好的,英伟达有。太好了。”

当你观察谁足够“AGI 上脑”,愿意在长期时间线上以那些对没有“AGI 上脑”的人来说荒谬的水平购买算力——但他们仍然愿意支付相当高的溢价并现在就签约,因为他们认为未来那个比例会失衡——半导体供应链也会发生同样的事情。我不认为英伟达完全“AGI 上脑”。黄仁勋并不相信软件会被完全自动化以及所有这些东西。

是加速计算,而不是 AI 芯片,对吧?

迪伦·帕特尔

是 AI 芯片。

但他是这么称呼的,对吧?

迪伦·帕特尔

是的。我认为这是一个更宽泛的术语,AI 包含在其中,但也包括物理建模和模拟。

但他好像并没有拥抱主要的使用场景。

迪伦·帕特尔

我认为他是在拥抱的,但我只是不认为他像达里奥或山姆那样“AGI 上脑”。但他仍然比去年第三季度的谷歌或亚马逊要“AGI 上脑”得多得多,而且他看到了更多的需求。

原因其实很简单。看看所有数据中心建设情况就知道了。他就像在说:“好,我要占据这个市场份额。”我们追踪了所有数据中心,其中很多数据中心可能归属不同方。某种程度上,谷歌和亚马逊,尤其是谷歌,尽管部署自家 TPU 对他们更有利,但他们不得不部署大量 GPU,因为他们的 TPU 数量不足以填满数据中心。他们无法获得足够的芯片制造产能。

我对此有个疑问。谷歌卖了一百万个,是 v7 吗?

迪伦·帕特尔

是的。

——把 Ironwood 卖给了 Anthropic,而你说现在最大的瓶颈,今年或明年,我想从现在起永远都会是,构建这些芯片所需的逻辑和内存。谷歌拥有 DeepMind,这个第三大知名 AI 实验室。如果这是最大的瓶颈,他们为什么要把芯片卖掉,而不是直接给 DeepMind 用?

迪伦·帕特尔

这又是一个…… DeepMind 的人当时说:“这太疯狂了。我们为什么要这么做?”但谷歌云的人和谷歌高管有不同的想法。

你我都认识 Anthropic 的计算团队。两位主要成员都来自谷歌。他们看到了这个脱节,谈成了一笔交易,并在谷歌意识到之前就获得了这些计算资源。根据我们掌握的数据,这一系列事件发生在第三季度初,在六周内,我们看到 TPU 的容量大幅增加。在那六周里,容量多次提升。

当时有多个请求。谷歌甚至不得不去找台积电,向他们解释为什么需要增加产能,因为这一切来得太突然。产能增加很大一部分是为了卖给 Anthropic。因为 Anthropic 比谷歌更早看到了机会。

后来谷歌推出了 Nano Banana 和 Gemini 3,导致用户指标飙升。然后谷歌领导层才反应过来:“哦。”于是他们开始表态,必须每六个月将计算能力翻倍,或者类似的具体数字。

他们确实清醒了许多,然后去找台积电说:“我们还要更多,还要更多。”台积电回复道:“抱歉,各位,我们已经卖光了。2026年我们或许能多挤出5-10%,但真正要发力得等到2027年了。”

在我看来,各大实验室之间存在这种信息不对称。具体细节我不确定。这是我根据供应链中晶圆订单的所有数据,以及Anthropic和Fluidstack签署的数据中心相关情况,自己拼凑出来的说法。

我很清楚谷歌搞砸了。从谷歌Gemini的年化经常性收入就能看出来。从第一季度到第三季度,他们的收入几乎为零——第三季度开始有所增长后才有一点。但到了第四季度,他们的年化经常性收入达到了50亿美元。很明显,谷歌最初并没有看到收入飙升。从某种意义上说,Anthropic在年化经常性收入爆发之前也存在一些承诺方面的问题,尽管他们拥有更大的信息不对称优势,并且预见到了即将到来的趋势。谷歌会比Anthropic更保守,而谷歌的年化经常性收入甚至更少。所以他们当时就是不愿意这么做,后来才意识到应该这么做。

自那以后,谷歌在行动上变得极其痴迷于通用人工智能。他们收购了一家能源公司。他们为涡轮机支付了定金。他们购买了比例高得离谱的已供电土地。他们去找公用事业公司谈判长期协议。他们在数据中心和电力方面行动非常激进。我认为谷歌是在去年底才清醒过来的,但这花了一些时间。

你认为到明年年底,谷歌会拥有多少吉瓦的电力?

迪伦·帕特尔

买我的数据。

这类信息你是要收费的。

迪伦·帕特尔

是的,没错。

00:34:34 – 到2030年,ASML将成为AI算力扩展的首要制约因素

我感觉每年阻碍我们扩展AI算力的瓶颈都在变化。几年前是CoWoS封装。去年是电力。今年你会告诉我瓶颈是什么。

但我想了解五年后,什么因素会限制我们部署“奇点”?

迪伦·帕特尔

最大的瓶颈是算力。对此,前置时间最长的供应链并非电力或数据中心,而是半导体供应链本身。瓶颈从电力与数据中心重新切换到了芯片上。

在芯片供应链中,存在多个不同的瓶颈。包括内存、台积电的逻辑晶圆,以及晶圆厂本身。建造一座晶圆厂需要两到三年时间,而数据中心则不到一年。我们见过亚马逊在短短八个月内建成数据中心。由于制造芯片的晶圆厂建造复杂度极高,前置时间存在巨大差异。制造设备的前置时间也非常长。

随着我们不断扩展规模,瓶颈会根据供应链当前无法满足的需求而发生变化。此前是 CoWoS、电力和数据中心,但这些都属于前置时间较短的环节。CoWoS 是将芯片封装在一起的工艺,相对简单得多。电力和数据中心归根结底也比芯片的实际制造简单得多。此前,移动端或 PC 端的产能曾向数据中心芯片转移,这种转移在一定程度上是可替代的。

相比之下,CoWoS、电力和数据中心则必须作为全新的供应链从头开始建设。但现在,移动和 PC 行业——曾经占据半导体行业的大部分——已经没有多余的产能可以再转移给 AI 了。英伟达如今是台积电和全球最大内存制造商 SK 海力士的最大客户。从普通人的 PC 和智能手机那里转移资源来支持 AI 芯片,已经几乎不可能再进一步了。所以现在的问题是:我们如何扩大 AI 芯片的产量?这是迈向 2030 年过程中最大的瓶颈。

如果存在一个绝对的千兆瓦上限,仅基于“我们无法生产超过这么多台 EUV 光刻机”就能预测到 2030 年,那将会非常有趣。

Dylan Patel

要进一步扩展算力规模,今年和明年存在不同的瓶颈,但最终到2028或2029年,瓶颈将落在供应链的最底层,也就是ASML。ASML制造着世界上最复杂的机器:EUV光刻机。其售价在3亿至4亿美元之间。目前他们每年能生产约70台,明年将达到80台。即便在供应链极度扩张的情况下,到本十年末他们也仅能生产略超100台。

这意味着什么?到本十年末他们能制造100台这样的设备,而目前是70台。这如何实际转化为AI算力?我们看到Sam Altman以及供应链上许多其他人都在谈论这些数字:千兆瓦、千兆瓦、千兆瓦。我们到底在增加多少千兆瓦?我们看到Elon说要在太空中建设一百千兆瓦。

一年。

Dylan Patel

一年。这些数字的问题,或者说对这些数字的挑战,实际上并不在于电力或数据中心。我们可以深入探讨这一点,但真正的瓶颈在于芯片制造。

以英伟达Rubin芯片的一千兆瓦算力为例。Rubin在GTC大会上发布,我相信就在本期播客上线的那一周。要建成一千兆瓦基于英伟达今年年底推出的最新芯片的数据中心容量,需要几种不同的晶圆技术。你需要大约5.5万片3纳米晶圆,大约6000片5纳米晶圆,以及大约17万片DRAM内存晶圆。

在这三个不同的类别中,每个类别所需的EUV光刻次数各不相同。在制造晶圆的过程中,有成千上万个工艺步骤,涉及材料的沉积和去除。但关键步骤——至少在先进逻辑芯片中占芯片成本30%的步骤——实际上并不在晶圆上添加任何东西。你拿起晶圆,在上面涂上光刻胶,这是一种在曝光时会发生化学变化的化学物质。然后将其放入EUV光刻机中,以特定方式照射光线,从而在晶圆上形成图案。这其中涉及一个所谓的掩模版,它实际上就是设计图案的模板。

当你观察一块先进的三纳米晶圆时,它大约有七十层掩模、七十层光刻层,其中二十层是最先进的极紫外光刻(EUV)。如果一吉瓦产能需要五万五千片晶圆,而每片晶圆需要二十次极紫外光刻(EUV)处理,你可以算一下。一吉瓦就需要一百一十万次极紫外光刻(EUV)处理。这很简单。再加上其他部分,最终达到两百万次,涵盖五纳米工艺和所有存储芯片。一吉瓦大约需要两百万次极紫外光刻(EUV)处理。

这些设备非常复杂。当你思考它在晶圆上的工作方式时,它是将晶圆进行扫描和步进。在整个晶圆上,这个过程要重复几十次。当讨论极紫外光刻(EUV)处理次数时,指的是整个晶圆以特定速率被曝光。

一台极紫外光刻(EUV)设备每小时大约能处理七十五片晶圆,设备开机率约为百分之九十。最终,要完成一吉瓦所需的两百万次极紫外光刻(EUV)晶圆处理,大约需要三台半极紫外光刻(EUV)设备。所以三台半极紫外光刻(EUV)设备就能满足一吉瓦的需求。

想想这些数字很有趣。一吉瓦的成本是多少?大约是五百亿美元。而三台半极紫外光刻(EUV)设备成本是多少?是十二亿美元。实际上这个数字要小得多,这很有意思。数据中心的经济性资本支出是五百亿美元,而在此基础上构建的模型 token 价值甚至更大。供应链中可能有一千亿美元的人工智能价值,却被这价值十二亿美元、且供应链无法快速扩张的设备所制约。

你最近写了一篇文章,提到过去三年台积电的资本支出达到了一千亿美元。所以是每年三百亿、三百亿、四百亿美元。其中一小部分被英伟达用于三纳米或之前四纳米工艺的芯片制造。它上个季度的收益是多少?是四百亿美元。四百亿美元乘以四就是一千六百亿美元。仅英伟达一家,就将一千亿美元资本支出中的一小部分(这部分资本支出将在多年内折旧,而非仅在今年),转化为一年内的一千六百亿美元。

当你顺着供应链往下走到 ASML 时,情况变得更加严峻——这家公司要用价值十亿美元的机器来生产一千兆瓦的产能。当然,这些机器使用寿命超过一年,所以实际产出比这个数字还要高。

现在我想了解的是,到 2030 年,如果不仅算上当年售出的机器,还包括前几年累积下来的,总共会有多少台这样的机器?这意味着什么?Sam Altman 说他希望到 2030 年每周实现一千兆瓦的产能。把这些数字加起来,与他的目标是否一致?

Dylan Patel

如果你仔细想想,这完全是一致的。台积电和整个生态系统目前已经拥有大约 250 到 300 台 EUV 光刻机。在此基础上,今年增加 70 台,明年 80 台,到 2030 年增长到 100 台。到本十年末,你将拥有 700 台 EUV 光刻机。按每 3.5 台 EUV 光刻机对应一千兆瓦产能计算——假设全部用于 AI(实际并非如此)——那么数据中心可以部署的 AI 芯片总产能将达到 200 千兆瓦。

Sam 的目标是每年 52 千兆瓦。这样算下来他只占 25% 的份额。显然,有一部分份额要分配给移动设备和 PC,前提是我们还能继续拥有消费电子产品,并且不会被挤出这个市场。但大致来说,他说的意思是占芯片总产能的 25% 市场份额。这个数字非常合理,因为仅今年一年,我认为他就能获得已部署的 Blackwell GPU 中 25% 的份额。这并不算疯狂。

ASML 是什么时候开始出货 EUV 光刻机的?是 7 纳米工艺开始的时候吗?我不确定具体时间。你的意思是,到 2030 年,他们还将使用最初在 2020 年出货的机器?也就是说,在这个全球技术最先进的行业中,最关键的机器要连续使用十年?我觉得这很令人惊讶。

Dylan Patel

ASML 出货 EUV 光刻机已有大约十年,但直到 2020 年左右才进入大规模量产。设备本身并非一成不变。早期设备的吞吐量甚至更低。围绕这些设备有一系列规格指标,其中一项叫套刻精度。我之前提到过,你要将一层层结构堆叠起来。你会进行一些 EUV 光刻,然后执行一系列不同的工艺步骤——沉积材料、刻蚀、清洗晶圆——在完成下一次 EUV 光刻之前,要重复几十道这样的步骤。

有一项规格指标叫套刻精度,具体是指:你完成了所有这些工作,在晶圆上绘制了这些线条,现在我要绘制这些触点。假设我要绘制这些触点,将金属线条连接到通孔,而再上一层则是另一组垂直走向的线条,这样你就在连接相互垂直的导线。你必须能够将它们精确地落在彼此之上。这就叫套刻精度。

ASML 一直在快速提升套刻精度这项指标。ASML 也在快速提升晶圆吞吐量。设备的价格上涨了,但涨幅不及设备性能的提升。最初,EUV 光刻机售价为 1.5 亿美元。随着时间的推移,展望到 2028 年,现在价格是 4 亿美元。但设备的性能也提升了一倍以上,尤其是在吞吐量和套刻精度方面——套刻精度指的是,即使你在两次光刻之间执行了大量步骤,仍能精确地将后续光刻层对准到前一层之上。

ASML 的进步速度非常快。同样值得注意的是,ASML 可能是世界上最慷慨的公司之一。他们拥有这种关键核心技术。没有其他公司能与之竞争。也许中国在本十年末会拥有一些 EUV 光刻机,但其他任何公司都没有任何能与 EUV 相提并论的技术,然而 ASML 并没有疯狂地抬高价格和利润率。你去问问我们经常聊到的其他人,比如 Leopold,他们会说:“让价格涨上去吧。”因为他们有能力这么做。利润率就在那里。你可以拿走这些利润。英伟达拿走了利润。存储芯片厂商也在拿走利润。但 ASML 从未将价格提升幅度超过其设备性能的提升幅度。

从某种意义上说,它们始终为客户提供了净收益。问题不在于工具停滞不前,而在于这些工具已经老旧。是的,你可以对它们进行一些升级,而新工具也正在到来。为简单起见,我们在本期播客中忽略了每项工具在覆盖层或吞吐量方面的进步。

你说我们今年生产 60 台这样的机器,随后几年生产 70 台、80 台。如果 ASML 决定将其资本支出翻倍或增至三倍,会发生什么?是什么阻止他们在 2030 年生产超过 100 台?你为什么如此确信,即使是五年后,你也能相对确定他们的产量?

迪伦·帕特尔

我认为这里有几个因素。ASML 并没有决定“豁出去了,尽可能快地扩大产能”。总体而言,半导体供应链也没有这样做。它经历过繁荣与萧条,我们可以多聊一点。基本上,一些参与者最近才醒悟过来,但总的来说,没有人真正看到每年 200 吉瓦的 AI 芯片需求,或半导体供应链中每年数万亿美元的支出。他们没有被 AI 说服。他们没有被 AGI 说服。

我们今年就要达到一万亿美元了。

迪伦·帕特尔

是的,我理解你的感受,但我的意思是供应链中没有人真正理解这一点。我们不断被告知我们的数字太高了,而当它们被证明正确时,他们又会说:“哦,是的,但你明年的数字还是太高了。”

ASML 的工具包含四个主要组件。它有光源,由圣地亚哥的 Cymer 制造。它有掩模版台,由康涅狄格州威尔明顿制造。它有晶圆台。它有光学器件,即透镜等。最后两个在欧洲制造。

当你审视这四个组件中的每一个时,它们都拥有极其复杂的供应链,(A)它们并未尝试大规模扩张,并且(B)当它们尝试扩张时,时间滞后相当长。再说一次,这是人类制造的最复杂的机器,没有之一,而且是任何量产规模下的。

我们来具体谈谈光源。光源是如何工作的?它滴落这些锡滴,然后用激光完美地连续击打三次。第一次击中锡滴,使其膨胀开来;第二次再次击中,使其膨胀成完美的形状;然后以超高功率进行轰击。锡滴被激发到足够高的能量,从而释放出极紫外光,波长为13.5纳米,随后这些光进入一个装置,该装置负责收集所有光线并将其引导至透镜组。

然后是透镜组,正如你提到的,由卡尔蔡司和其他一些厂商提供,但蔡司是最关键的部分。他们也没有尝试扩大产能,因为他们看不到……他们觉得:“我们因为AI增长了很多,从60台增加到100台。”但实际上应该是:“不,不,不,我们需要增加到几百台,不过没关系,随便吧。”

据我所知,每台这样的设备大约有18个这样的透镜。它们是多层反射镜,如果我没记错的话,是由钼和钌的完美层叠而成,一层层堆叠起来,然后光线完美地从中反射。我们通常认为透镜是有形状的,用来聚焦光线。而这是一种同时兼具透镜功能的反射镜,因此相当复杂。这些超薄沉积层中的任何缺陷都会导致问题,任何曲率偏差也会导致问题。

扩大生产规模面临诸多挑战。从这个意义上说,它相当具有手工艺性质,因为你每年不是生产数万个,而是生产几百个、几千个。每年60台设备,每台设备18个这样的透镜,那么透镜和投影光学元件的数量仍然在几百个,或者大约一千个左右。

接着你走到掩模台前,这同样是个极其疯狂的东西。这个东西的移动速度,我想说,能达到九个 G。它会以九个 G 的加速度移动,因为当你步进穿过一片晶圆时,设备会这样……晶圆台是互补的。它负责晶圆部分。你要将这两者对准。所有光线经过透镜聚焦后,这里是掩模,这里是晶圆。掩模朝一个方向移动,晶圆朝相反方向移动,同时扫描晶圆上 26x33 毫米的区域,然后停下。它再移动到晶圆的另一部分,重复这个过程。这一切在几秒钟内完成。两者各自以九个 G 的加速度朝相反方向移动。

这其中每一部分都是化学、制造、机械工程和光学工程的奇迹与杰作,因为你必须将所有部件对准,并确保它们完美无缺。所有这些部件都配备了极其庞大的计量系统,因为你必须完美地测试一切。任何环节出错,良率就会直接归零,因为这是一个精密调校到极致的系统。

顺便一提,它体积巨大,以至于你需要在荷兰埃因霍温的工厂里建造它,然后将其拆解,用多架飞机运送到客户现场,再在那里重新组装并再次测试。这个过程需要耗费好几个月的时间。

供应链中有非常多的环节,无论是蔡司制造其透镜和投影光学系统,还是 ASML 旗下公司 Cymer 制造 EUV 光源。每一个环节都有其自身复杂的供应链。ASML 曾表示,其供应链中涉及超过一万人。

是指单个供应商吗?

Dylan Patel

是的。可能不是直接关系。可能是通过蔡司拥有众多供应商,以及某家公司拥有众多供应商来实现的。

你仔细想想,这里说的是两个物理移动的物体,大小只有晶圆片那么大,而且精度必须达到个位数纳米甚至更小,因为整个系统——套刻精度、层与层之间的套刻偏差——必须控制在 3 纳米量级。如果套刻精度是 3 纳米,那就意味着每个独立部件的物理移动精度必须比这个数值还要小。在大多数情况下,它必须达到亚纳米级别,因为这些误差会层层叠加。这绝不是打个响指就能提高产量的事。

就连电力这种简单的事情也是如此。美国要从零电力增长变成百分之二的电力增长,尽管中国已经达到了百分之三十,这对美国来说却极其困难。而这是一个非常简单的供应链,其中从事高难度工作的人寥寥无几。美国大概有十万名电工和电力供应链从业人员,或者更多?

看看 ASML,他们雇佣的员工数量非常少。卡尔蔡司在这上面工作的人可能不到一千,而且这些人都是超级、超级专业的。你不可能随便培训一些人就能在短时间内上手。你也不可能让整个供应链一下子就动员起来。

英伟达已经做了大量工作,才让整个供应链能够交付他们今年计划生产的产能。你去跟 Anthropic 聊,他们会说:“我们缺 TPU,缺训练资源,缺 GPU。”你去跟 OpenAI 聊,他们也会说:“我们缺这些东西。”

OpenAI 和 Anthropic 知道自己需要 X。英伟达并没有那么被 AGI 洗脑。他们在造 X - 1。你顺着供应链往下走,每个人都在做 X - 1。在某些情况下,他们甚至在做 X ÷ 2,因为他们没有被 AGI 洗脑。

最终你会遇到这种时间滞后,导致鞭子无法及时反应。对 AI 的痴迷以及提高产量的愿望需要很长时间才能实现。一旦他们终于明白需要迅速提高产量……他们以为自己明白了。他们认为 AI 意味着我们必须从 60 提升到 100,同时工具变得更好更快,电源功率从 500 瓦提升到 1000 瓦,以及供应链中所有这些其他方面都在技术上进步并提高产量。他们以为自己确实在大幅提高产量。

但如果你仔细算一下这些数字……埃隆想要什么?他希望到 2028 或 2029 年,每年在太空领域达到 100 吉瓦。山姆·奥尔特曼希望到本十年末每年达到 52 吉瓦。Anthropic 可能也需要同样的量,谷歌也需要。你顺着供应链看下去,就会发现,等等,不,供应链根本不可能为所有人建立起足够的产能,以满足他们在算力方面的需求。

00:55:47 – 我们就不能用台积电的老旧晶圆厂吗?

我觉得在过去几年的数据中心供应链中,人们一直在提出这样的论点:“我们被这个特定环节卡住了,因此 AI 算力无法扩展到超过 X 的水平。”但正如你所写的那样,如果电网是瓶颈,那我们就在站点内部自建发电,用燃气轮机等等。如果这也不行,人们还有各种其他替代方案可以依赖。

我想问的是,我们能否想象在半导体供应链中也发生类似的事情。如果 EUV 光刻机成为瓶颈,那我们退回到 7 纳米工艺,像中国目前正在做的那样,用 DUV 光刻机通过多重图形化技术生产 7 纳米芯片,行不行?如果你看看像 A100 这样的 7 纳米芯片,从 A100 到 B100 或 B200 显然已经取得了很大进步。

这些进步中有多少仅仅来自数值精度?如果你从 A100 到 B100 保持 FP16 精度不变。B100 的算力略高于 1 petaflop,而 A100 大约是 300 teraflops。

Dylan Patel

对,312。

保持数值精度不变,从 A100 到 B100 有大约 3 倍的提升。其中一部分来自工艺改进,另一部分仅仅来自加速器设计的改进,而这些我们未来可以再次复制。

从 7nm 制程提升到 4nm 制程,实际带来的效果似乎非常有限。我手头没有具体数字,但假设每月有 15 万片 3nm 晶圆,最终 2nm 的产量也差不多。然而,7nm 晶圆的产量也大致相当。

如果你拥有所有这些旧晶圆,并且由于每片晶圆面积的比特数减少了 50% 左右,导致产能打了五折,那么如果启用 7nm 晶圆能额外提供 50 或 100 吉瓦的算力,似乎也没那么糟糕。请告诉我为什么这个想法很天真。

迪伦·帕特尔

我们确实有可能疯狂到这种地步,因为我们只需要增量算力,而这些芯片带来的算力值得付出更高的成本和功耗。但在很大程度上,这种情况也不太可能发生,因为其中一些比较并不公平。

例如,从算力为 312 万亿次浮点运算的 A100,到算力为 1000 或 2000 FP16 的 Blackwell,再到算力约为 5000 FP16 的 Rubin……这种比较并不公平,因为这些芯片的设计目标截然不同。对于 A100,英伟达针对 FP16 和 BF16 数值格式进行了优化。到了 Hopper,他们就没那么关注这些了,而是专注于 FP8。再看 Rubin,他们不太关心 FP16 和 BF16,主要关注 FP4 和 FP6。数值格式就是他们设计芯片时所针对的目标。

假设我们在 7nm 制程上设计一款新芯片,并针对当今的数值格式进行优化。其性能差异仍然会远大于你提到的浮点运算次数差异。人们往往容易把事情简化为每瓦特浮点运算次数或每美元浮点运算次数,但这并不是一个公平的比较。

我们来看看 Kimi K2.5 和 DeepSeek。当你观察这两个模型在 Hopper 与 Blackwell 上,使用高度优化的软件时的表现,会得到截然不同的性能结果。这其中的大部分差异并非归因于浮点运算次数或数值格式,因为这些模型实际上是 8 比特的。所以,并不是说 Blackwell 和 Hopper 都针对 8 比特进行了优化,而 Blackwell 并没有利用其 4 比特优势。实际上,性能差距要大得多。

诚然,缩小制程工艺、让晶体管变得更小,从而使每颗芯片拥有 X 次浮点运算能力是一回事,但你忽略了那个关键的制约因素。这些模型并非在单颗芯片上运行,而是同时运行在数百颗芯片上。看看深度求索的生产部署——这已经是一年多以前的事了——他们当时就在 160 块 GPU 上运行。他们就是用这些 GPU 来承载生产流量的。他们将模型拆分到 160 块 GPU 上。

每次跨越芯片之间的界限,都会产生效率损失。你必须通过高速电性 SerDes 进行传输,这会带来延迟成本和功耗成本。所有这些动态因素都会造成负面影响。随着制程节点不断缩小,单颗芯片内的算力增加了。现在,芯片内部的数据移动速度至少是每秒几十 TB,甚至每秒几百 TB。而芯片之间,速度大约在每秒 1 TB 的量级。

接下来是物理上彼此非常靠近的芯片之间的数据移动。你能在物理上紧密放置的芯片数量是有限的,因此必须将芯片放在不同的机架中。机架之间的数据移动速度大约在每秒几百 Gb 的量级,即 400 Gb 或 800 Gb 每秒,大致相当于每秒 100 GB。

于是就有了这样一个巨大的阶梯:芯片内部通信速度极快,机架内部慢一个数量级,而机架外部则再慢一个数量级。一旦突破芯片的边界,就会导致性能损失。

我解释这些的原因是,当你对比 Hopper 和 Blackwell 时,即使两者都使用一个机架数量的芯片,Hopper 也要慢得多。在每个域内,你投入到任务中的性能——这些处理单元之间每秒几十 TB 的通信速度,对比这些处理单元之间每秒几 TB 的速度——要高得多,因此性能也高得多。当你看到深度求索和月之暗面 Kimi K2.5 以每秒 100 个 token 的速度进行推理时,Hopper 和 Blackwell 之间的性能差异大约在 20 倍左右。

性能差距并非像 FLOPS 数据所显示的那样只有 2 倍或 3 倍,即便它们都采用相同的制程节点。差异主要在于网络技术以及各自研发的重点方向。你可以将其中一些技术反向移植,但当你看到他们在 3 纳米制程的 Rubin 上所做的那些工作时,有些东西根本不可能在 A100 上完全实现,哪怕你为 7 纳米制程重新设计一颗芯片也不行。

有些架构改进可以移植,有些则不行。性能差距并不仅仅是 FLOPS 的差异。从某种意义上说,它是多种因素累积的结果:单芯片 FLOPS 的差异、芯片间网络速度的差异、单芯片与整个系统之间 FLOPS 数量的差异,以及单芯片与整个系统之间内存带宽的差异。所有这些因素都会叠加放大。

我能问一个非常外行的问题吗?B200 现在在一个芯片上集成了两个 die,因此无需通过 NVLink 或 InfiniBand 就能获得那样的带宽。明年,Rubin Ultra 将在单个芯片上集成四个 die。是什么阻止我们在更老的…… 单个芯片上最多能集成多少个 die,同时仍然能达到每秒几十 TB 的带宽?

迪伦·帕特尔

即使在 Blackwell 架构内部,芯片内部通信与跨芯片通信之间的性能也存在差异。这些差异的界限显然比跨整个芯片通信时要小得多。当芯片数量增加时,会出现一定的性能损失。虽然并非完美,但这比在不同完整封装之间通信要好得多。

先进封装能扩展到多大?英伟达的做法是 CoWoS。谷歌、博通、联发科以及亚马逊的 Trainium 都在采用 CoWoS。但实际上,你可以回顾一下特斯拉在 Dojo 上的尝试——该项目曾被取消后又重启。Dojo 是一块尺寸相当于整个晶圆的芯片,上面集成了 25 颗芯片。这带来了一些权衡:他们无法在上面放置 HBM。但积极的一面是,它上面有 25 颗芯片。迄今为止,它可能仍然是运行卷积神经网络的最佳芯片。只是它不太擅长 Transformer 架构,因为芯片的形状、内存、运算单元以及各种规格参数都不太适合 Transformer,反而更适合 CNN。

Dojo 芯片正是围绕这一点进行优化的,并且他们采用了更大的封装。但随着封装尺寸越来越大,你会遇到其他限制:网络速度、内存带宽以及散热能力。所有这些问题都会逐渐显现出来。这并不简单。但没错,你会看到封装上集成更多芯片的趋势,而且确实可以在 7 纳米工艺上实现这一点。

事实上,华为在他们的昇腾 910C 或 D 上就是这么做的。他们最初只放了一颗芯片,后来增加到两颗。他们正专注于扩大封装规模,因为这是他们能够比无法缩小的制程工艺进步更快的领域。但归根结底,这也是可以在尖端芯片上做到的事情。在封装方面,你在 7 纳米上能做到的,很可能在 3 纳米上也能做到。

01:05:37 – 中国何时会在半导体领域超越西方?

如果我们最终在 2030 年面临这样一个局面:西方拥有最先进的制程工艺,但产能提升不足,而中国……我不知道你是否认为到 2030 年他们能拥有 EUV 和 2 纳米之类的技术。但他们已经深陷半导体领域,并且正在大规模量产。

基本上,我想知道在哪一年会出现一个交叉点——我们在工艺技术上的优势已经消退到足够程度,而他们在规模上的优势已经增长到足够程度。同时,如果他们的优势在于拥有一个实现整个供应链本土化的国家——而不是依赖德国和荷兰的零散供应商——那么中国在量产算力(mass flops)方面的能力是否会领先。

迪伦·帕特尔

截至目前,中国尚未拥有完全本土化的半导体供应链。

但到 2030 年,他们能做到吗?

迪伦·帕特尔

到 2030 年,他们有可能做到。但截至目前,中国所有的 7 纳米和 14 纳米产能都使用的是 ASML 的 DUV 光刻机。他们能从 ASML 进口的数量很大。但 ASML 收入的绝大部分,尤其是 EUV 光刻机的全部收入,都来自中国以外。规模优势仍然掌握在西方以及中国台湾、日本、韩国等一方。

但他们正在尝试制造自己的 DUV 和 EUV 光刻机,对吧?

迪伦·帕特尔

他们正在尝试做所有这些事情。问题在于他们能以多快的速度推进并扩大产量以及提升质量。到目前为止,我们还没有看到这一点。不过,我非常看好他们能在未来五到十年内做到这些。他们将真正扩大产量并进入高速发展期。他们有更多的工程师在为此努力,也有更强的意愿将资金投入到这个问题上。

那么到 2030 年,他们能实现 DUV 光刻机的完全本土化吗?

迪伦·帕特尔

我认为肯定可以。DUV 光刻机,是的。

那么到 2030 年,能实现 EUV 光刻机的完全本土化吗?

迪伦·帕特尔

我认为他们会有可用的样机。但我不认为他们届时就能大量制造。让设备能工作是一回事,然后还有量产地狱(production hell)。ASML 在 2010 年代初期就已经让 EUV 光刻机以某种能力工作了。但当时设备精度不够,没有为高产量制造进行规模化,可靠性也不足。他们必须提升产量,这都需要时间。

量产地狱需要时间。这就是为什么从 EUV 光刻机在实验室里能工作,到在晶圆厂实现大规模量产,又花了五到七年的时间。

你认为到 2030 年,他们能制造出多少台 DUV 光刻机?

迪伦·帕特尔

你是说 ASML?

不,是中国。

迪伦·帕特尔

这是个很好的问题。要深入审视这条供应链,尤其是其本土化程度,确实颇具挑战。我们非常努力。在某些情况下,他们从日本供应商那里采购部件。如果他们想要一条完全本土化的供应链,就不能再从日本供应商那里购买这些透镜、投影光学器件或工作台。他们必须内部自研。

很难说他们最终能达到什么水平。老实说,我认为这就像在黑暗中摸索。但他们每年生产大约 100 台 DUV 光刻机的可能性并非没有,而 ASML 目前每年生产数百台 DUV 光刻机。

目前没有哪家公司拥有月产百万片晶圆的工艺节点。马斯克说他想要实现这个目标,中国显然也打算这么做。台积电正在朝这个方向努力。内存制造商或许也能达到月产百万片晶圆的水平,但不会是在单一工厂内。

想到这种规模就令人难以置信,并且要看到供应链为此而动员起来也颇具挑战。我不想质疑中国的规模化能力。

我想这是个有趣的问题。我认为 SemiAnalysis 迟早会对此进行深入分析。问题是,到什么时候中国本土化的半导体产量会超过西方其他地区的总和?并且,请将你们模型中关于他们何时能大规模生产 DUV 和 EUV 光刻机的预测作为输入参数。

因为存在这样一个问题:如果你对 AI 的发展时间线持长期观点——这里的“长期”指的是 2035 年,从宏观角度看这并不算长——你是否应该预期一个中国主导半导体世界的到来?这个问题很少被问及,因为如果你在旧金山,我们思考的时间尺度是以周为单位的。如果你不在旧金山,你可能根本就不会考虑 AGI 这件事。

如果我们有了 AGI 会怎样?如果这项变革性技术带来了数十万亿甚至数百万亿美元的经济增长和 token 产出,但它发生在 2035 年呢?这对西方与中国意味着什么?SemiAnalysis 必须为此建立一个权威模型。

迪伦·帕特尔

当你把时间尺度拉得那么远时,确实非常困难。我们通常关注的是追踪每一个数据中心、每一座晶圆厂以及所有相关工具。我们追踪它们的去向,但这些事情的时间滞后相对较短。我们只能根据土地购买、许可证审批和涡轮机采购来对数据中心容量做出相对合理的估算。我们知道所有这些要素的流向,这就是我们出售的数据。

当展望到2035年时,情况就变得截然不同了。误差范围会变得非常大,以至于很难做出估算。但归根结底,如果起飞速度或时间线足够慢,我看不出中国为什么不能大幅追赶上来。从某种意义上说,我们正处于一个低谷期——三个月到半年前,甚至可能现在,中国模型已经达到了它们有史以来最具竞争力的水平。我认为 Opus 4.6 和 GPT 5.4 确实已经拉开了差距,让这个鸿沟变得更大了一些,但我相信新的中国模型会陆续出现。

随着我们从销售提供完整推理链的模型 token,转向销售自动化的白领工作——比如一个自动化软件工程师,你向它发送请求,它给你返回结果,而在后端有一系列它不会向你展示的思考过程——从美国模型中蒸馏知识到中国模型的能力将会变得更加困难。

其次,看看各大实验室所拥有的算力规模。OpenAI 去年年底拥有大约两吉瓦的算力。Anthropic 今年将达到两吉瓦以上。到明年年底,它们都将拥有十吉瓦的算力容量。中国在扩展其 AI 实验室算力方面并没有那么快。在某个时间点,当你无法再从这些实验室中蒸馏学习成果到中国模型时,再加上 OpenAI、Anthropic、Google 和 Meta 都在竞相追逐的这场算力竞赛,它们最终会达到一个模型性能开始出现更大分化的阶段。

再看看投入数据中心的这些资本支出。亚马逊正在投入2000亿美元,谷歌投入1800亿美元。所有这些公司都在资本支出上花费数千亿美元。今年美国投入数据中心的资本支出大约接近一万亿美元。那么这些投资的资本回报率如何?你我会认为,数据中心资本支出的资本回报率非常高。

如果看看Anthropic的收入,一月份他们增加了40亿美元。二月份,由于是较短的月份,他们增加了60亿美元。考虑到算力限制是其增长瓶颈,我们来看看他们在三月和四月能取得什么成绩。Claude的可靠性相当低,因为他们严重受限于算力。但如果这种情况持续下去,那么这些数据中心的资本回报率就非常高。

在某个时间点,由于所有这些资本支出、这些模型产生的所有收入以及下游供应链,美国经济在今年和明年会开始越来越快地增长。中国目前还没有做到这一点。他们尚未建立起如此规模的基础设施来投资模型、获得能力,然后大规模部署这些模型。

看看Anthropic,他们的年化经常性收入达到200亿美元。利润率低于50%,至少根据《The Information》上次报道的数据是这样。这意味着他们以租赁成本计算,运行着价值130或140亿美元的算力,而这实际上相当于有人为Anthropic投入了价值500亿美元的资本支出,以产生他们当前的收入。

中国还没有做到这一点。如果(我认为是“当”,而非“如果”)Anthropic的收入再次增长10倍——中国没有能力以那种规模部署算力。所以从某种意义上说,我们正处于快速起飞阶段。这不像是在讨论某个日期前建成戴森球,更像是收入以如此高的速度复利增长,以至于确实影响了经济增长。这些实验室正在聚集的资源增长如此之快。中国尚未做到这一点,因此在这种情况下,美国和西方实际上正在拉开差距。

另一面是,这些基础设施投资的回报率平平。也许它们并没有预期的那么好。也许谷歌想把自由现金流降到零、明年投入3000亿美元资本支出的想法是错误的。也许他们就是错了,而华尔街那些看空的人、那些不懂AI的人才是对的。如果是那样,美国建设了所有这些产能,却得不到高回报。与此同时,中国能够构建一个完全垂直、自主可控的供应链,而不是像美国/日本/韩国/台湾/东南亚/欧洲各国共同构建一个垂直度较低的供应链。从某种意义上说,如果AI达到某些能力水平所需的时间比你这个播客中绝大多数嘉宾认为的要长,那么中国最终有可能在规模上超越我们。

时间线短,美国赢;时间线长,中国赢。

迪伦·帕特尔

对,但我不确定时间线短具体指什么。我认为你不需要相信AGI,也能认同美国获胜的时间线。

01:16:01 – 即将到来的巨大内存瓶颈

我们回到内存这个话题。我认为华尔街的人和业内的人士正在理解这有多重要,但可能大众普遍还不明白这有多么重大。正如你刚才提到的,我们正面临这个内存瓶颈。

之前我问过,我们能否通过退回七纳米制程来解决EUV光刻机短缺的问题。那么让我问一个关于内存的类似问题。HBM由DRAM制成,但每片晶圆面积的比特数比它所用的DRAM少三到四倍。

未来的加速器有没有可能直接使用普通DRAM而不是HBM,这样我们就能从现有的DRAM中获得更多的容量?我认为这可能可行的原因是,如果我们将要拥有的是自主执行任务的智能体,而不是同步的聊天机器人应用,那么你就不一定需要极快的延迟。

也许你可以接受较低的带宽,因为把DRAM堆叠成HBM的目的就是为了获得更高的带宽。有没有可能转向HBM加速器,基本上实现与Claude Code Fast相反的效果,比如搞一个Claude Slow?

迪伦·帕特尔

归根结底,那个愿意为模型 token 支付最高价格的增量买家,最终也是对价格最不敏感的那一个。在一个资本主义社会中,算力应该被分配给价值最高的商品,而私人市场正是通过支付意愿来决定这一点的。

在某种程度上,Anthropic 其实可以推出一个慢速模式。他们可以发布 Claude 慢速模式,并大幅提升每美元能获得的模型 token 数量。他们大概可以把 Opus 4.6 的价格降低 4 到 5 倍,而速度可能只降低 2 倍。仅基于 HBM 的推理吞吐量与速度之间的曲线已经存在。然而他们并没有这么做,因为实际上没有人愿意使用一个慢速模型。

此外,在这些智能体任务上,模型能够以小时为单位的时间跨度运行是很好的。但如果模型运行得更慢,那些小时就会变成一天。反过来,如果模型运行得更快,那些小时就会变成一小时。没有人真的愿意等待长达一天的时间,因为即使是价值最高的任务,也具有一定的时间敏感性。

我很难想象……是的,你可以使用普通的 DRAM。但这会带来几个挑战。芯片的一个核心限制是,芯片的尺寸是固定的,并且所有的输入/输出(I/O)都从边缘引出。通常,芯片的左右两侧连接的是 HBM——因此芯片到 HBM 的 I/O 位于侧面——而顶部和底部则是连接到其他芯片的 I/O。

如果你从 HBM 换成 DDR,那么边缘上的这些 I/O 的带宽会显著降低,但每个芯片的容量会显著增加。然而,你真正关心的指标是每片晶圆的带宽,而不是每片晶圆的比特数。

因为限制 FLOPS(每秒浮点运算次数)的因素,就是能否快速读取和写入下一个矩阵,而为此你只需要更多的带宽。

Dylan Patel

是的,取出权重以及进出 KV 缓存。在许多情况下,这些 GPU 并未以满内存容量运行。这显然是一个系统设计问题:模型、硬件和软件协同设计。你必须计算出需要多少 KV 缓存,多少保留在芯片上,多少卸载到其他芯片并在需要时调用以进行工具调用,以及将这项工作并行化到多少芯片上。

显然,这方面的搜索空间非常广阔,这就是为什么我们推出了 InferenceX,这是一个开源模型,用于搜索各种不同芯片和模型在推理过程中的所有最优解。

关键在于,你并不总是受限于内存容量。你可能会受限于 FLOPS、网络带宽、内存带宽或内存容量。如果简单归纳一下,主要有四个约束条件,而每个条件又可以进一步细分。

如果改用 DDR,是的,每个 DRAM 晶圆产生的比特数会增加四倍,但突然间约束条件会发生很大变化,你的系统设计也会随之改变。速度会变慢。市场会变小吗?也许吧。但同时,所有这些 FLOPS 都被浪费了,因为它们只是在空转等待内存。你并不需要那么大的容量,因为你实际上无法增加批次大小,否则 KV 缓存的读取时间会更长。

有道理。HBM 和普通 DRAM 之间的带宽差异是多少?

迪伦·帕特尔

一个 HBM4 堆栈——我们来谈谈 Rubin 中使用的技术,因为这是我们一直关注的重点——其位宽为 2048 位,连接在宽度为 13 毫米的区域上。它的内存传输速率约为每秒 100 亿次传输。

因此,一个 HBM4 堆栈在宽度约为 11 到 13 毫米的区域上拥有 2048 位带宽。这就是你在芯片上占用的“海岸线”。在这条“海岸线”上,有 2048 位数据以每秒 100 亿次传输的速度进行传输。将两者相乘,再除以 8(将比特转换为字节),每个 HBM 堆栈的带宽大约为每秒 2.5 TB。

当你观察 DDR 时,在同样的面积上,它的位宽可能只有 64 或 128 位。DDR5 的传输速率在每秒 6.4 到 8000 吉次传输之间。因此,你的带宽要低得多。计算下来是 64 乘以 8000 再除以 8,得出每秒 64 GB。即使按宽松的算法,128 乘以 8 吉次传输,在同样的边缘面积上,你也只能达到每秒 128 GB,而相比之下是每秒 2.5 TB。

每单位边缘面积的带宽存在一个数量级的差异。如果你的芯片是正方形,或者尺寸为 26 毫米乘 33 毫米——这是单个裸晶的最大尺寸——那么你只有这么多边缘面积。在芯片内部,你放置了所有的计算单元。你可以尝试做一些事情来改变这种状况,比如增加 SRAM 或更多缓存。但归根结底,你受到带宽的极大限制。

接下来还有一个问题:在哪里可以削减需求,以便为 AI 腾出足够的资源。我想情况尤其糟糕,因为正如你所说,如果为了获得同样的字节数需要四倍的晶圆面积,那么对于 HBM 来说,你必须削减四倍的笔记本电脑和手机消费需求,才能为 AI 腾出一个字节。

这对未来一两年意味着什么?抱歉问题有点长,你在新闻通讯里提到,2026 年大型科技公司资本支出的 30% 将用于内存?

迪伦·帕特尔

是的。

这太疯狂了,对吧?在大概 6000 亿美元或类似的总额中,30% 仅仅用于内存。

迪伦·帕特尔

是的。显然,英伟达在某种程度上叠加了利润率,所以你必须把这一点剥离出来,将他们的利润率分别应用到内存和逻辑芯片上。但归根结底,他们三分之一的资本支出都流向了内存。

这太疯狂了。随着内存紧缩的到来,未来一两年我们应该预期什么?

迪伦·帕特尔

内存紧缩将持续加剧,价格也将继续上涨。这对市场的不同部分影响各异。人们会越来越讨厌 AI 吗?是的,因为智能手机和个人电脑不会逐年变得更好。事实上,它们会逐年变得更差。

如果你看一部 iPhone 的物料清单,内存占了多大比例?如果内存价格翻倍,iPhone 的成本会提高多少?

迪伦·帕特尔

据我所知,一部 iPhone 有 12 GB 内存。过去每 GB 大约成本 3 到 4 美元,所以总共是 50 美元。但现在内存价格已经涨了三倍。假设 DDR 内存每 GB 是 12 美元,那么成本就从 50 美元变成了 150 美元。

对苹果来说,成本增加了 100 美元。苹果是有利润空间的,但他们不会自己消化这部分成本。NAND 闪存也面临同样的市场行情,所以实际上,iPhone 的成本可能增加了 150 美元。其中仅 DRAM 就增加了 100 美元成本,NAND 也面临类似的市场状况。因此,iPhone 的成本实际上可能增加了 150 美元。苹果要么把这部分成本转嫁给消费者,要么自己消化。我不认为苹果会大幅压缩自己的利润空间,他们可能会承担一小部分。但归根结底,这意味着最终消费者买一部 iPhone 要多付 250 美元。

这还只是与去年的价格相比。苹果感受到压力会有些滞后,因为他们通常会签订为期三个月到一年的长期内存合同。但最终,苹果还是会受到相当大的冲击。他们要到下一代 iPhone 发布时才会真正调整价格。

但这是高端市场,每年只有几亿部手机的销量。苹果每年卖出两到三亿部手机。市场的大头是中端和低端机型。过去全球每年能卖出 14 亿部智能手机。现在大约是 11 亿部。我们的预测是,今年可能会降到 8 亿部,明年进一步降到 5 到 6 亿部。

我们参考了来自中国的一些数据,这些数据来自我们在亚洲、新加坡、香港和台湾的分析师。他们一直在追踪这个趋势,发现小米和 OPPO 将低端和中端智能手机的产量削减了一半。

是的,在一部售价 1000 美元的 iPhone 上,物料成本只增加了 150 美元,而苹果的利润率本就更高。但对于更便宜的手机来说,内存和存储占物料成本的比例要大得多。而且利润率也更低,所以消化这部分成本的能力就更弱。此外,它们通常也不倾向于签订长期内存供应协议。

这件事之所以影响重大,是因为如果智能手机销量减半,这种下降将发生在低端和 mid-range 机型上,而不是高端机型。所以,释放出的内存比特数并不会减半。目前,消费类设备占据了内存需求的一半以上。即使智能手机销量减半,由于减半的形态特征,低端市场的削减幅度会超过一半,而高端市场的削减幅度则不到一半,因为你和我仍然会购买那些售价超过一千美元的高端手机。即使它们稍微贵一点,我们也会买。而苹果的销量下降幅度不会像低端智能手机供应商那么大。

个人电脑也是如此。这对市场造成的影响相当剧烈。DRAM 被释放出来,流向了 AI 芯片厂商,他们愿意签订更长期的合同并支付更高的利润率,因为归根结底,他们从最终用户那里获取的利润要高得多。

这很可能会让人们更加讨厌 AI。如今,你已经在 PC 相关的 subreddit 和游戏 PC 相关的推特上看到了各种梗图。比如猫跳舞的视频,配文是:“这就是内存价格翻倍、你买不到新游戏 GPU 或台式机的原因。”当内存价格再次翻倍,尤其是 DRAM 价格翻倍时,情况会更糟。

另一个有趣的动态是,这不仅仅是 DRAM,NAND 闪存也是如此。NAND 的价格也在上涨。这两个市场在过去几年中产能扩张都非常缓慢,NAND 几乎为零。用于手机和 PC 的 NAND 比例,要高于用于手机和 PC 的 DRAM 比例。

当你(主要出于 DRAM 的目的)摧毁需求时,就会释放出更多的 NAND,这些 NAND 可以被分配并流向其他市场。DRAM 的价格涨幅将大于 NAND,因为你从消费端释放了更多需求,而实际上,你为 AI 生产了更多的内存。

抱歉,也许你刚才解释过了但我没跟上。是因为数据中心大量使用固态硬盘吗?

迪伦·帕特尔

确实在用,但用量远不及 DRAM。

好吧,所以它们也会增长,因为会用到一定数量,但需求不像 HBM 那么迫切。说得通。

直到我读了你们的一些简报,才意识到一个事实:未来几年制约逻辑芯片制程微缩的那些限制,与制约我们生产更多存储晶圆的限制非常相似。实际上,存储芯片也需要完全相同的设备——这台 EUV 光刻机。所以我想现在有人可能会问,为什么我们不能生产更多存储芯片?

迪伦·帕特尔

正如我之前提到的,限制因素在当下或明年并不一定是 EUV 光刻机。它们要到本十年后期才会成为瓶颈。目前的限制更多在于物理上根本没有建好晶圆厂。过去三四年里,这些供应商没有新建晶圆厂,因为存储芯片价格非常低。他们的利润率很低,事实上 2023 年他们在存储业务上是亏损的。所以他们决定不建新厂。市场随着时间的推移慢慢复苏,但直到去年才真正变得火热。

2024 年,我们一直在大力强调:推理意味着长上下文,长上下文意味着巨大的 KV 缓存,而巨大的 KV 缓存意味着巨大的存储需求。这个话题我们已经谈了一年半、两年了。那些懂 AI 的人当时就大举押注存储。所以你已经看到了这种动态,但现在它终于体现在了定价上。

这个显而易见的事实花了很长时间才显现:长上下文意味着 KV 缓存变大,你需要更多存储。加速器一半的成本是存储。他们当然会在这方面疯狂投入。这花了整整一年才真正反映在存储价格上。一旦存储价格反映了这一点,又花了三到六个月存储供应商才开始建设晶圆厂。这些晶圆厂需要两年时间才能建成。所以直到 2027 年底或 2028 年,我们才会有真正有意义的晶圆厂来安装这些设备。

相反,为了获取产能,你看到了一些相当疯狂的做法。美光从台湾一家公司收购了一座生产落后制程芯片的晶圆厂。SK海力士和三星也在尝试一些相当激进的手段,以扩大其现有晶圆厂的产能,这些做法同样对经济产生了巨大的连锁反应。

那么,为什么我们不能建造更多产能呢?因为没有地方放置设备。这不仅仅是极紫外光刻机的问题;DRAM和逻辑芯片制造中还涉及其他设备。在逻辑芯片领域,对于N3制程,极紫外光刻成本约占最终晶圆成本的28%。而看DRAM领域,这个比例在百分之十几。这个比例正在上升,但占总成本的比重仍然小得多。这些其他设备同样是瓶颈,尽管它们的供应链不像ASML那么复杂。

你会看到应用材料、泛林半导体以及所有其他公司也在大力扩张产能。但是你没有地方放置设备,因为人类建造的最复杂的建筑就是晶圆厂,而建造一座晶圆厂需要两年时间。

我最近采访了埃隆,他的整个计划就是他们要建造这座TeraFab超级晶圆厂,并且他们要建造无尘室。我甚至不会问你关于非无尘室区域的事情,但我们就假设他们建造了无尘室。

我有几个问题。第一,你认为这是那种埃隆的公司能够比传统建造方式快得多的项目吗?这不是关于制造最终设备。这只是关于建造设施本身。仅仅以极快的速度建造无尘室有多复杂?如果今年或明年我们的瓶颈就在于此,埃隆凭借他“快速行动”的方法,能否做得快得多?第二,如果按照你的看法,两年后我们的瓶颈不在于无尘室空间,而在于设备本身,那么建造无尘室还重要吗?

迪伦·帕特尔

与任何复杂的供应链一样,这需要时间,而且制约因素会随时间推移而变化。即使某个因素不再是制约,也并不意味着该市场不再有利润空间。例如,几年后能源将不再是主要瓶颈,但这并不意味着能源不会快速增长、那里没有利润可图。它只是不再是关键瓶颈而已。在晶圆厂领域,洁净室是今明两年最大的瓶颈。到了2028年、2029年、2030年,那里仍会存在制约因素。

埃隆的特点在于,他拥有极强的能力去获取物质资源,并吸引真正聪明的人来建造东西。他招募优秀人才的方式,就是试图去建造最疯狂的东西。在人工智能领域,这一招其实不太奏效,因为每个人都在试图构建AGI,每个人都雄心勃勃。但在登陆火星、制造能自行着陆的火箭、全自动驾驶电动汽车或人形机器人这些方面,这些方法却能吸引那些认为这是世界上最重要问题的人来攻克它——因为他是唯一一个真正在拼命尝试的人。

在半导体领域,他表示想建造一座月产百万片晶圆的工厂。没有人拥有那么大的工厂。他有可能招募到大量非常优秀的人才,让他们投身于这个月产百万片晶圆的疯狂任务。第一步是建造洁净室,我认为他很可能能做到。但他那种“删繁就简、脏一点没关系”的心态,恐怕是不对的。实际上我认为这百分之百不对。晶圆厂必须非常洁净。厂内所有空气每三秒就要更换一次,速度就是这么快。颗粒物必须少到极致。

但我认为他能建起洁净室。这需要一两年时间。起初速度不会很快,但随着时间的推移,他会越来越熟练。真正复杂的部分其实是开发工艺技术和制造晶圆。我不认为他能很快攻克这一点。这背后积累了大量的知识。将极其昂贵的设备和供应链进行最复杂的整合,是由台积电、英特尔或三星完成的。另外两家公司在这方面甚至做得都不算出色,而且它们已经极其复杂了。

如果到2030年,恰好出现某种彻底的颠覆,我们不再使用EUV(极紫外光刻),你会感到多惊讶?如果我们改用某种效果更好、生产更简单、产量能大得多的技术呢?我确信,作为业内人士,这听起来完全是个天真的问题,但你明白我的意思吗?我们应该给某种完全出乎意料、让这一切都变得无关紧要的技术出现,赋予多大的概率?

迪伦·帕特尔

对于某种非常简单且易于扩展的技术,我赋予的概率非常非常低。有不少公司正在研究有效的粒子加速器或同步加速器,用于产生13.5纳米波长的光(就像EUV),或者波长更窄的光,比如7纳米的X射线,然后用于光刻工具。但这些都是产生这种光的巨型粒子加速器。建造起来非常复杂。

有几家公司在做这件事,我认为这可能会成为超越EUV的行业重大颠覆。但我不认为我们会神奇地造出某种全新的、能直接写入、超级简单、并且可以大规模量产的东西,尽管确实有一些尝试在做类似的事情。

我问这个问题是因为,想想埃隆过去的公司,火箭技术曾被——并且现在依然是——被认为极其复杂的东西。

迪伦·帕特尔

你看,和埃隆相比,我只是个天真的空谈者。我造出过什么呢?所以,也许这是可能的。

为了在未来制造更多内存,我们能否像制造3D NAND那样制造3D DRAM,然后重新使用DUV(深紫外光刻)?

迪伦·帕特尔

这是目前的希望。每个人对 3D DRAM 的路线图都是,你仍然会使用 EUV,因为你希望实现更紧密的重叠对准。当你在进行这些后续处理步骤时,所有东西都是垂直堆叠的,并且层与层之间堆叠得更多。你希望间距更紧密。所以,总的来说,人们仍在尝试用 EUV 来实现它。

但 3D 技术会改变的是单次 EUV 处理能制造多少比特的计算方式。如果转向 3D DRAM,这个数字将大幅提升。这就是希望所在。目前,每个人的路线图都是从当前的 6F 单元,到 4F 单元,最后在本年代末或下年代初实现 3D DRAM。这中间仍有大量的研发、制造和集成工作要做。我不会说这不可能。我认为这很有可能发生。

这也将需要对晶圆厂进行大规模的设备改造。晶圆厂内的设备构成将发生巨大变化。光刻设备实际上是唯一变化不大的东西。但相对于不同类型的化学气相沉积、原子层沉积、干法刻蚀,或使用不同化学物质的各类刻蚀腔体……这些设备的数量会完全不同。针对不同的工艺节点,你需要所有这些不同的设备。你不可能在短时间内把逻辑芯片厂改造成 DRAM 厂,反之亦然,或者把 NAND 厂改造成 DRAM 厂。

同样地,现有的 DRAM 厂仅仅为了从 1-alpha 工艺节点升级到 1-beta 再到 1-gamma 工艺节点,就需要大量的设备改造,因为它们必须增加 DUV,并在使用 EUV 时改变沉积和刻蚀方面的化学材料组合。而且 EUV 设备也必须到位。此外,当你转向 3D DRAM 时,变化会更大,因此这些晶圆厂需要进行大量的设备改造。

这将是一次重大颠覆。这通常会降低 EUV 的需求。但纵观历史,光刻成本占晶圆成本的比例一直在上升。大约在 2014 年,这一比例是 17%,而在过去十五年间已升至 30%。对于 DRAM 来说,这个比例过去在 15% 左右,现在已趋向于 20% 左右。在 3D DRAM 出现之前,它很可能会突破 20% 的区间。但随后,如果我们进入 3D DRAM 时代,最终晶圆成本中 EUV 的占比又会再次上升。

我猜你更关心的不是成本占比,而是它在多大程度上制约了生产。

Dylan Patel

没错,但成本占比——

它是一个代理指标,是的。如果你是 Jensen 或 Sam Altman,或者任何能从扩大 AI 算力中获益巨大的人,会有这样的传闻,说他们会去找台积电,问“为什么我们无法使用 Y 和 Z?”但我认为你的观点是,从某种意义上说,台积电做什么其实并不重要。事实上,即使英特尔和三星建造更多的晶圆厂,从长远来看,你仍然会受到 ASML 以及其他设备和材料制造商的制约。

首先,这个理解正确吗?其次,硅谷的人现在是否应该去荷兰,试图说服 ASML 制造更多设备,以便在 2030 年拥有更多的 AI 算力?

Dylan Patel

我们在 2023、2024 和 2025 年看到了一种有趣的动态。那些比别人更早预见到能源瓶颈的人,不对称地找到了西门子、三菱,当然还有 GE Vernova,并买断了涡轮机的产能。现在,由于能源问题,他们能够以极高的价格在这些地方部署涡轮机。

同理,这也可以用在 EUV 上,只不过 ASML 不会随便相信任何一个想买 EUV 设备的无名之辈。这些涡轮机比 EUV 设备便宜得多,而且产量也大得多。尤其是当你涉及到工业燃气轮机时——不仅仅是联合循环机组,还有那些更便宜、更小、效率较低的型号——人们会为这些设备支付定金。

有人可以这么做。有人应该去荷兰,然后说:“我给你十亿美元。你给我从现在起两年后购买十台 EUV 光刻机的权利,而且我要排在最前面。” 然后在这两年里,你四处走动,等着所有人都意识到:“哦,糟了,我的 EUV 光刻机不够用了”,然后你试图以某个溢价出售你的期权。你实际上所做的就是告诉 ASML:“你们真蠢。你们在这些机器上赚的利润不够多。我来赚这个差价。” 问题是,ASML 会同意吗?我认为不会。

存在一种可能性,他们至少能从中获得需求信号,从而增加产量。

Dylan Patel

有可能。我同意。

但听起来你是在说,即使他们想增加产量,考虑到供应链的限制,他们也做不到。

Dylan Patel

对。但这恰恰是那种市场……如果他们无法增加产量,就像台积电无法那么快地增加产量一样,而需求却在飙升,那么显而易见的解决方案就是进行套利。你我都知道,需求远高于他们的预测以及他们的产能建设能力。

你可以通过锁定产能、签订远期合约,然后在其他人意识到一切都糟透了、我们产能不足时,再试图以高价卖出这些合约来进行套利。这样你就能赚到 ASML 和台积电本应收取的那种超高利润。但问题是,我不知道 ASML 和台积电是否会同意这么做。

01:42:34 – 美国的电力扩容不会成为问题

让我问问你关于电力的问题。听起来你认为电力是可以任意扩容的。

Dylan Patel

不是任意,但基本上可以。

但让我们看看这些数字。如果我没记错的话,你关于 AI 实验室如何增加电力供应的博文暗示,GE Vernova、三菱重工和西门子每年可以生产 60 吉瓦的燃气轮机。还有其他一些来源,但它们的重要性不如燃气轮机。

我猜其中只有一部分会用于 AI。如果到 2030 年,我们有足够的逻辑芯片和存储芯片来支撑每年 200 吉瓦的电力消耗,你是认为这些产能会逐步提升到每年超过 200 吉瓦,还是你有什么别的看法?

Dylan Patel

目前我们处于 20 到 30 的水平。顺便一提,这里指的是关键 IT 容量,这一点很重要。我所说的这些吉瓦,都是指关键 IT 容量。服务器插上电,消耗的就是这么多功率。但整个链条上存在损耗,包括传输、转换、冷却等环节的损失。因此,你需要将今年的 20 吉瓦,或本十年末的 200 吉瓦,再乘以 20% 到 30% 的系数。

此外还有容量因子。涡轮机并非以 100% 的功率运行。以 PJM 为例——我认为它是美国最大的电网,覆盖中西部和部分东北部地区——在他们的模型中,大约需要 20% 的冗余容量。在这 20% 的冗余容量中,所有涡轮机都以 90% 的负荷运行,因为出于可靠性和维护等原因,它们会被降额使用。实际上,由于所有这些因素,能源的名义装机容量总是远高于实际最终的关键 IT 容量。

但问题不仅仅在于涡轮机。如果只用涡轮机发电,那倒是简单、乏味且容易。人类和资本主义的效率要高得多。那篇博客的核心观点是:没错,制造联合循环燃气轮机的公司只有三家,但我们能做的远不止于此。我们可以采用航改型燃气轮机,把飞机发动机改造成涡轮机。市场上甚至还有新进入者,比如 Boom Supersonic 正在尝试这样做,并与 Crusoe 合作。此外,市场上已经存在其他类似的产品。

还有中速往复式发动机:像柴油机那样做旋转运动的发动机。有十家公司生产这类发动机。我来自佐治亚州,以前人们看到 RAM 卡车时会说:“伙计,你这车里装的是康明斯发动机。”汽车制造业正在萎缩,因此这些公司都有富余产能,可以将其转化并用于数据中心供电。你可以把这些往复式发动机都装上去。虽然不如联合循环那么清洁,但如果你愿意,也可以把它们从柴油机改装成燃气机。

那船用发动机呢?所有这些用于大型货船的发动机都很棒。Nebius 正在为新泽西州的一个微软数据中心做这件事。他们用船用发动机来发电。Bloom Energy 在做燃料电池。我们已经看好他们一年半了,因为他们有如此强大的产能提升能力。他们增产的投资回收期非常快,即使成本比联合循环(成本和效率最优的方案)略高一些。

还有太阳能加电池的方案,随着成本曲线持续下降,这些方案可以投入使用。还有风能,由于风力波动,你可能只能预期达到最大功率的 15%,但你可以加上电池。诸如此类的方案还有很多。

另一件事是,电网的规模设计是为了在夏天最热的那天高峰用电时不切断电源。但实际上,那是一个比平均水平高出 10-20% 的负荷尖峰。如果你只放置足够多的公用事业级电池,或者一年只运行一小部分的调峰电厂——这些可以是燃气、工业燃气轮机、联合循环、电池,或者我提到的任何其他来源——那么突然间,你就为数据中心解锁了美国电网 20% 的容量。大多数时候,这些容量是闲置的。它真的只是为了那个峰值而存在,而这个峰值一年中只有几天的几个小时。如果你有足够的容量来吸收那个峰值负荷,那么突然间你就把所有这些容量都转移过来了。

如今,数据中心只占美国电网电力的 3-4%,到 2028 年将达到 10%。但如果你能像这样解锁美国电网 20% 的容量,那就不算太疯狂了。美国电网是太瓦级别的,而不是几百吉瓦级别的。所以我们可以增加更多的能源。

我并不是说这很容易。这些事情会很困难。有很多艰巨的工程问题、人们必须承担的风险,以及人们必须使用的新技术。但埃隆是第一个在电表后端使用天然气的人,自那以后,我们看到人们为了获取电力而做的事情出现了爆炸式增长。这些都不容易,但人们将能够做到。供应链比芯片要简单得多。

有意思。他在采访中指出,就他正在关注的那台特定涡轮机的特定叶片而言,交货周期已经排到了2030年之后。你的意思是——

Dylan Patel

那很好。制造能源的方法还有很多。效率低一点也没关系。

目前,联合循环燃气轮机的资本支出是每千瓦1500美元。你的意思是,要么采用比这贵得多的技术,要么其他东西变得足够便宜,从而使其具备竞争力?

Dylan Patel

完全正确。它可以高达每千瓦3500美元。成本可能是联合循环的两倍,而从总拥有成本来看,GPU的每小时总成本只上涨了几美分。

因为我们一直在讨论Hopper的定价是1.40美元,假设电价翻倍。原本成本1.40美元的Hopper现在变成了1.50美元。我不在乎,因为模型改进的速度太快了,它们的边际效用远远超过了能源成本上涨的那10美分。

所以你的意思是,电网的20%——电网大约是1太瓦——可以仅通过公用事业规模的电池来供电,从而增加你愿意接入电网的容量。

Dylan Patel

不过,那里的监管机制并不容易。

但如果假设成真,那就是200吉瓦。仅从你提到的不同燃气发电来源——不同类型的发动机和涡轮机——来看,到本十年末,它们总共能释放出多少吉瓦的容量?

Dylan Patel

我们正在数据中追踪这一点。仅燃气发电设备就有超过16家不同的制造商。是的,联合循环只有三家涡轮机制造商,但我们追踪了16家不同的供应商,并且掌握了他们所有的订单。结果显示,各个数据中心有数百吉瓦的订单。

到本十年末,我们预计新增的电力容量中大约有一半将采用表后接入方式。表后接入通常比并网接入成本更高,但并网接入存在诸多问题:许可证、互联排队等等。因此,尽管成本更高,人们仍选择表后接入。

表后接入的具体方式多种多样。可以是往复式发动机、船用发动机或航改型燃气轮机。也可以是联合循环机组,尽管联合循环不太适合表后接入。还可以是布鲁姆能源的燃料电池,或者太阳能加储能。任何这些方式都有可能。

你是说,其中任何一种方式单独就能达到几十吉瓦的规模?

迪伦·帕特尔

其中任何一种方式单独都能达到几十吉瓦,而整体来看,它们将达到数百吉瓦。

好的。那么仅此一项就应该足以——

迪伦·帕特尔

电工的工资可能会再翻一番或两番。会有大量新人进入这个领域,很多人会赚钱,但我不认为这是主要的瓶颈。

目前,在阿比林,克鲁索公司正在为 OpenAI 建造的 1.2 吉瓦数据中心,我认为那里有 5000 人在工作,或者高峰期曾达到这个数字。如果把这个规模扩大到 100 吉瓦——而且我相信随着时间的推移效率会提高——那么建造 100 吉瓦的设施将需要 40 万人。

想想美国的劳动力,想想有多少电工和建筑工人……我猜大约有 80 万电工。我不知道他们是否都能以这种方式替代。建筑工人则有数百万。但如果我们处于每年新增 200 吉瓦的世界里,我们最终是否会面临劳动力短缺?还是你认为这实际上并不是一个真正的制约因素?

迪伦·帕特尔

劳动力是一个很大的制约因素。在这方面,这是一个巨大的制约因素。人员必须经过培训。同样,我们可能也会开始引进最高技能的劳动力。欧洲一位原本在拆除发电厂的高技能电工,现在来到美国,为数据中心建设高压输电线路,这是合乎逻辑的。

人形机器人,或者至少是机器人技术,可能会开始发挥作用,但减少人员数量的主要因素将是实现模块化,并在亚洲的工厂进行生产。对美国来说不幸的是,韩国、东南亚以及许多方面也包括中国,将越来越多地运送数据中心更完整的预制模块,这些模块将被运进来。目前,你运送的是服务器或机架,然后将其与你从不同地方运送来的不同部件进行连接。

但现在,你会将其运送到工厂,并整合整个系统。这可能是一个两兆瓦的模块,这个模块将高压交流电转换为输送到机架的直流电压,或者类似的东西。或者对于冷却系统,你运送一个完全集成的单元,其中许多冷却子系统已经组装好,因为水管工在这里也是一个很大的制约因素。

此外,不再只是单个机架需要人员用电缆连接所有这些机架,而是采用一个滑橇,将整排服务器放在上面,直接从工厂运出。目前,单个机架可能为120或140千瓦,但随着我们进入下一代Nvidia Kyber及类似产品,功率将接近一兆瓦。

此外,如果你做一整排,它将把机架、网络、冷却和电源全部集成在一起。现在当你进场时,需要布线的部分就少得多。网络光纤更少,电源连接更少,管道工程也更少。这可以大幅减少在数据中心工作的人员数量,因此我们建设数据中心的能力将大大增强。

在这个过程中,有些人会更快地转向新事物,有些人则会慢一些。Crusoe 和 Google 一直在大量讨论这种模块化,Meta 和许多其他公司也是如此。那些更快转向新事物的人可能会面临延迟,而较慢的人则会遇到劳动力问题。市场上总会出现错位,因为这是一个非常复杂的供应链。但归根结底,它仍然足够简单,我们能够通过资本主义和人类的聪明才智,在所需的时间尺度上解决它。

01:54:44 – 太空 GPU 在本十年内不会实现

说到需要解决的大问题,埃隆·马斯克非常看好太空 GPU。如果你说得对,电力在地球上并不是制约因素……我想它们之所以有意义的另一个原因是,即使地球上有足够的燃气轮机或其他设备,埃隆的下一个论点是,你无法获得在地球上建设数百吉瓦设施的许可。你认同这个论点吗?

迪伦·帕特尔

从土地来看,美国很大。数据中心实际上并不占用太多空间,所以这个问题可以解决。从许可来看,空气污染许可是一个挑战,但特朗普政府让事情变得容易多了。你去德克萨斯州,可以绕过很多这类繁琐手续。

埃隆在孟菲斯不得不处理很多这类复杂事务,然后还要为 Colossus 1 和 2 在边境对面建造一座发电厂。但归根结底,在德克萨斯州中部,你能绕开的事情要多得多。

既然埃隆住在德克萨斯州,他为什么不直接去德克萨斯州呢?

迪伦·帕特尔

我认为部分原因是他们在某个临时阶段过度依赖了电网电力。那只是他们当时认为自己更需要的东西。

因为那里有一个与电网相连的铝精炼厂。

迪伦·帕特尔

实际上那是一个闲置的家电工厂。但我认为他们可能更侧重于电网电力、水资源和天然气接入。我认为他们买下那里时就知道天然气管道就在旁边,他们打算接入。水资源也是如此。那是一整套不同的制约因素。那里可能也是一个更容易找到电工的区域。

说到底,我也不太确定他们为什么选了那个地点。我敢打赌,要是能重来一次,埃隆肯定会选德克萨斯州的某个地方,因为他遇到了监管方面的挑战。最终,审批许可是个难题,但美国幅员辽阔,有五十个州,事情总会有办法解决的。

有很多小型行政区域,你可以根据承包商的需求,在三个月到十二个月的临时期限内,把所有需要的工人运过去。你可以把他们安置在临时住所,并支付高额报酬,因为劳动力相对于 GPU、网络设备以及这些设备最终将产生的 token 价值来说非常便宜。所以,支付所有这些费用是绰绰有余的。

此外,人们现在也在进行多元化布局。澳大利亚、马来西亚、印度尼西亚和印度,这些地方的数据中心建设速度要快得多。但目前,超过 70% 的 AI 数据中心仍然在美国,并且这一趋势仍在持续。人们正在摸索如何建造这些东西。说到底,在德克萨斯州、怀俄明州或新墨西哥州的偏远地区处理审批和繁琐手续,可能比把东西送到太空要容易得多。

除了考虑到能源只占数据中心总拥有成本的一小部分,使得经济上的理由不那么充分之外,你持怀疑态度的其他原因是什么?

迪伦·帕特尔

显然,在太空中电力基本上是免费的。

这就是这么做的理由。

迪伦·帕特尔

是的,这就是这么做的理由。但所有其他的反对意见也同样存在。即使地球上的电力成本翻倍,它仍然只是 GPU 总成本的一小部分。

主要的挑战是……我们有一个名为 ClusterMAX 的平台,它对所有新型云服务进行评级。我们测试了超过 40 家云公司,包括超大规模云服务商和新型云服务商。除了软件之外,这些云服务之间最大的区别在于它们部署和管理故障的能力。

GPU 的可靠性极差。即使在今天,大约 15% 部署的 Blackwell GPU 都需要进行 RMA(退货授权)处理。你必须把它们取出来。有时你只需要重新插拔一下,但有时你必须把它们取出来,然后运回给英伟达或其负责 RMA 等业务的合作伙伴。

你怎么看马斯克的观点,即经过初始阶段后,它们(GPU)实际上并没有那么频繁地失效?

迪伦·帕特尔

没错,但你现在做了这些事:测试所有 GPU,拆解它们,装上飞船,发射到太空,然后再把它们重新联网上线。这需要好几个月。如果你的论点是 GPU 有五年的使用寿命,而这个过程多花了六个月,那就相当于你集群使用寿命的 10%。

因为我们算力严重受限,这些算力理论上在你拥有它的头六个月里价值最高。我们现在比未来更受限制。这些算力未来可以贡献给更好的模型,或者今天就能产生收入,让你能筹集更多资金。所有这些都让当下成为最重要的时刻,但你的算力部署可能因此延迟了六个月。

这些云服务商之间的区别在于……我们看到有些云服务商在地球上部署 GPU 就需要六个月。我们也看到有些云服务商所需时间远少于六个月。所以问题是,太空部署的优势在哪里?我看不出你怎么可能在地球上测试所有 GPU、拆解它们、再运到太空,而整个过程不会比直接把 GPU 留在你测试它们的设施里花费更长的时间。

我想问的是关于太空通信拓扑结构的问题。目前,星链卫星之间以每秒 100 吉比特的速度通信。可以想象,如果使用为此优化的光学星间激光链路,这个速度可以高得多。这实际上已经非常接近 InfiniBand 的带宽了,后者是每秒 400 吉字节。

迪伦·帕特尔

但那是每块 GPU 的带宽,不是每个机架的。所以得乘以 72。而且,这还是 Hopper 架构的情况。当你升级到 Blackwell 和 Rubin 架构时,这个数字会翻倍,然后再翻倍。

但推理过程中,每个……有多少计算在进行?不同的扩展域(scale-up domain)仍在协同工作,还是推理只是在一个单独的扩展域内以批次形式进行?

迪伦·帕特尔

很多模型都能适配在一个扩展域内,但很多时候你会把它们拆分到多个扩展域上。

随着模型变得越来越稀疏(这是总体趋势),你希望每个 GPU 只激活少数几个专家。如果当今的领先模型拥有数百甚至上千个专家,那么即使我们展望未来,也需要在数百或数千个芯片上运行这些模型。

于是,你最终会面临需要将所有卫星连接起来进行通信的问题。

这将会很困难。如果存在一种世界,你可以在单个扩展单元上完成一个批次的推理,那或许更可行。但如果不是这样,那就是另一回事了。

迪伦·帕特尔

将这些芯片联网是一个问题,而且你不能把卫星做得无限大。制造一颗非常大的卫星面临着许多物理挑战。这就是为什么需要在卫星之间建立这些互连。

这些互连的成本更高。在一个集群中,15-20% 的成本是网络。突然间,你使用的是太空激光器,而不是那些以百万计产量制造、带有可插拔收发器的普通激光器。

而且这些东西也非常不可靠,顺便说一句,比 GPU 还不可靠。在集群的整个生命周期中,你必须不断地拔掉它们并进行清洁。你常常会因为各种莫名其妙的原因拔掉它们再重新插上。这些东西就是没那么可靠。所以你也得面对这个问题。你用的是更昂贵、更复杂的太空激光器进行通信,而不是那种已经大规模生产的可插拔光收发器。

那么,总的来说,这对太空数据中心意味着什么?

迪伦·帕特尔

太空数据中心实际上并不受其能源优势的限制。它们受限于同样的竞争性资源。到本十年末,我们每年只能制造两千亿瓦的芯片。我们要怎么做才能获得那样的产能?无论是在陆地上还是在太空中,这都无关紧要。因为这并不重要,因为你可以建造那样的电力设施。人类的能力和产能可能会达到这样一个阶段:我们每年在全球范围内增加各种类型的太瓦级电力。

在某个时间点,我们确实会跨越鸿沟,让太空数据中心变得合理,但这不会发生在这十年内。那要遥远得多,只有当能源约束真正成为巨大瓶颈,并且随着数据中心占据经济更大份额,土地许可成为更大瓶颈时才会实现。关键是,当芯片不再是瓶颈时。

目前,芯片是最大的瓶颈。你希望它们一制造出来就立即部署并用于AI工作。人们正在做很多事情来加快这一速度。他们正在将数据中心模块化,甚至将机架模块化——在数据中心只放入芯片,而芯片之外的一切都已布线完毕、准备就绪。人们正在做诸如此类的事情来缩短时间,而这些在太空中是无法做到的。

归根结底,在一个受芯片约束的世界里,唯一重要的是尽快让这些芯片产出模型token。也许到2035年,半导体行业、ASML、蔡司,以及泛林集团、应用材料等供应商和其他晶圆厂制造商,会在钟摆摆回后迎头赶上,届时我们就能制造出足够的芯片。到那时,我们将优化每一个旋钮,优化那10-15%的能源成本也就变得合理了。随着我们可能转向ASIC,并且如果英伟达的利润率不再超过70%,也许能源成本会占到集群成本的30%。这些才是需要优化的东西。

但埃隆并非通过20%的增益取胜。他从不那样赢。埃隆赢的方式是全力出击,实现10倍的增益。这就是SpaceX的宗旨。这就是特斯拉的宗旨。他所有的成功都源于此,而不是追逐那20%的增益。我认为,随着地球资源竞争日益激烈,太空数据中心最终将实现10倍的增益,但这不会发生在这十年内。

只是为了让你对地球上有多少土地有个直观感受……显然,对于芯片本身而言,尤其是如果你进入一个拥有兆瓦级机架的世界——

迪伦·帕特尔

这是另一回事。如果制造是瓶颈,目前AI芯片大约是每平方毫米一瓦特。改进的一个简单方法是将它提升到每平方毫米两瓦特。你可能不会获得两倍的性能,可能只多出20%的性能,而这需要更特殊的冷却方式。它需要更复杂的冷板和复杂的液体冷却,甚至可能需要浸没式冷却之类的方法。

在太空中,提高每平方毫米的瓦特数非常困难,而在地球上,这些都是已经解决的问题。其中一项技术能让你从每片晶圆中获得更多模型 token,可能多出20%的模型 token,这是一个巨大的胜利。

每平方毫米,你指的是芯片面积吗?

迪伦·帕特尔

是的,芯片面积。

这对太空会更有利,因为每平方毫米瓦特数更高意味着芯片运行温度更高。我想这属于计算机芯片工程的问题,但根据斯特藩-玻尔兹曼定律,散热能力与温度的四次方成正比。如果你能让芯片运行在很高温度下,就能大幅提升——

迪伦·帕特尔

不,你不能让它运行得更热。你只能让它更密集。问题在于,要把热量从那个密集区域导出,意味着你必须从标准的空气和液体冷却转向更特殊的液体冷却形式,甚至浸没式冷却,才能达到更高的功率密度。这在太空中比在地球上困难得多。

也许现在值得解释一下,对于英伟达、Trainium 和 TPU 来说,所谓的“纵向扩展”到底是什么,以及它具体是怎样的。

迪伦·帕特尔

我之前提到过,芯片内部的通信速度极快。同一机架内芯片之间的通信也很快,但没那么快,速度在TB级别。距离很远时,比如跨区域通信,速度在百GB级别。随着距离增加,比如跨越大半个国家,数量级就降到了GB级别。

扩展域是一个紧密的领域,其中芯片之间的通信速度达到每秒太字节级别。对英伟达而言,此前这意味着 H100 服务器拥有八块 GPU,这八块 GPU 之间能以每秒太字节的速度相互通信。到了 Blackwell NVL72,他们实现了机架级扩展。这意味着机架内全部七十二块 GPU 都能以每秒太字节的速度相互连接。速度在代际间翻了一番,但最重要的创新是将域内规模从八块提升到了七十二块。

当我们看谷歌时,他们的扩展域则完全不同。其规模一直处于数千级别。在 TPU v4 上,他们的 Pod 拥有四千块芯片的规模。到了 v8 或 v7,他们的 Pod 规模在八千到九千块左右。这里的关键在于,这与英伟达并不相同。两者不能简单类比。

谷歌采用的拓扑结构是环形网格。每块芯片连接六个相邻芯片。英伟达的七十二块 GPU 则是全互联。它们可以向该扩展 Pod 内的任意其他芯片发送每秒太字节的数据。而谷歌这边,数据必须经过芯片跳转。如果 TPU 1 需要与 TPU 76 通信,它必须经过多个芯片跳转,并且在此过程中总会存在资源阻塞,因为那一块 TPU 只连接了另外六块 TPU。

因此,在拓扑结构和带宽上存在差异,两者各有取舍和优势。谷歌能够拥有大规模的扩展域,但代价是芯片之间需要跳转才能通信。你只能与六个直接相邻的芯片通信。

亚马逊则对其扩展域进行了改造。他们处于英伟达和谷歌之间。他们试图构建更大的扩展域。他们尝试在一定程度上使用交换机实现全互联——这也是英伟达的做法——但同时也在一定程度上采用类似谷歌的环形网格拓扑。

随着我们向下一代技术迈进,这三家公司都在更多地转向蜻蜓拓扑。这意味着存在一些全连接的元素,以及一些非全连接的元素。这样既能将扩展域规模做到数百或数千块芯片,又能在芯片间跳转时避免资源争用。

相关问题:我听到有人声称,参数规模扩展之所以缓慢——直到现在OpenAI和Anthropic才推出更大的模型——是因为……最初的GPT-4参数超过一万亿,而现在模型才重新接近这个规模。我听到一种理论,原因是英伟达的扩展方案内存容量一直不够大。假设你有一个5T参数的模型,以FP8精度运行,那就是五万亿GB。再加上KV缓存,假设它——

Dylan Patel

就按同样大小算吧。

好,假设单个批次也是同样大小。那么你需要十TB才能运行……

Dylan Patel

单次前向传播,没错。

而直到GB200和NVL72,英伟达的扩展方案才拥有二十TB,在此之前容量要小得多。反观谷歌,他们一直拥有巨大的TPU集群,虽然不是全互联,但单个扩展域内就有数百TB的容量。这能解释为什么参数规模扩展缓慢吗?

Dylan Patel

我认为部分原因是容量和带宽,但另一方面,模型越大,部署速度就越慢。对终端用户来说,推理速度其实并不重要。真正重要的是强化学习(RL)。

我们在这些模型以及实验室的算力分配上看到的情况是……算力主要有几种分配方式。你可以分配给推理,也就是创收。你可以分配给开发,也就是打造下一代模型。你可以分配给研究。具体到开发环节,又分为预训练和强化学习(RL)。

当你思考正在发生的事情时,你会发现从研究中获得的算力效率提升是如此巨大,以至于你实际上希望将大部分算力投入到研究而非开发中。所有这些研究人员都在产生新想法,尝试它们,测试它们,并不断将规模定律的帕累托最优曲线推得更远。根据经验,我们看到模型成本每年降低十倍,甚至更多。在同等规模下,成本降低十倍;而要达到新的前沿水平,成本则保持不变或更高。因此,你不希望将过多资源分配给预训练和强化学习。实际上,你希望将大部分资源分配给研究。

中间是开发阶段。如果你预训练一个五万亿参数的模型,在强化学习中你需要进行多少次 rollout?对于一个五万亿参数的模型,rollout 次数是对于一个一万亿参数模型的五倍。如果你想进行同样多的 rollout——也许更大的模型样本效率高出两倍——那么你需要 2.5 倍的强化学习时间才能让模型变得更智能。

或者,你可以对较小的模型进行两倍时间的强化学习。大模型仍然会有 25% 的差异,它的样本效率高出两倍,并且执行了 X 次 rollout。但较小的模型(一万亿参数)虽然样本效率较低,却执行了两倍的 rollout,并且仍然更快完成。你更早得到模型,进行了更多强化学习,然后你可以利用那个模型来帮助你构建下一个模型,帮助你的工程师进行训练,并实现所有这些研究想法。

这个反馈循环实际上在任何情况下都倾向于较小的模型,无论你的硬件是什么。看看谷歌,他们确实部署了所有主要实验室中最大的生产模型——Gemini Pro。它比 GPT-5.4 更大。它比 Opus 更大。谷歌这样做是因为他们拥有单极化的算力。几乎全是 TPU。

而 Anthropic 正在处理 H100、H200、Blackwell、Trainium 以及各代 TPU。OpenAI 目前主要使用英伟达,但也在向同时采用 AMD 和 Trainium 的方向发展。像 Google 这样的算力集群可以围绕更大的模型进行优化。它们可以在扩展域中利用上千颗芯片来大幅加快强化学习时间,从而使这个反馈循环变得更快。

但归根结底,孤立来看,你几乎总是倾向于选择更小的模型,因为它能更快地完成强化学习,更早地投入研发部署。你可以构建下一个版本,获得更多效率优势。这种复利效应体现在:打造一个更小的模型,就能更早地投入研发。我在训练上花费的算力更少,因为我能把更多算力分配给研究。这种能够越来越快地进行研究的复利效应,可能意味着更快的起飞速度。这正是所有公司想要的:尽可能最快的起飞。

02:14:07 – 为什么没有更多对冲基金参与 AGI 交易?

好,一个尖锐的问题。你之前说过,SemiAnalysis 在销售这些电子表格。你一直在指出,六个月或一年前,你就警告过人们内存短缺的问题。现在你又在告诉人们洁净室短缺的问题,未来还有工具短缺的问题。为什么只有 Leopold 一个人用你的电子表格赚得盆满钵满?其他人在干什么?

Dylan Patel

我认为有很多人通过各种方式在赚钱。Leopold 开玩笑说,他是唯一一个告诉我我们的数字太低的客户。其他所有人都告诉我我们的数字太高了,几乎到了令人厌烦的程度。无论是某个超大规模云厂商说:“嘿,那个其他超大规模云厂商,他们的数字太高了”,而我们回应:“不,就是那个数。”他们又说:“不,不,不,这不可能,”等等等等。最终,当我们与超大规模云厂商或 AI 实验室合作时,你不得不通过所有事实和数据来说服他们,实际上,不,那个数字并不高,它是正确的。最终,有时他们需要六个月或一年后才能意识到这一点。

在交易方面,其他客户也会使用我们的数据。我大约 60% 的业务来自行业客户,也就是 AI 实验室、数据中心公司、超大规模云服务商、半导体公司,以及整个 AI 基础设施供应链。但另外 40% 的收入来自对冲基金。我不会透露我们的客户具体是谁,但确实有很多人在使用这些数据。关键在于如何解读这些数据,以及如何看待数据之外的东西。

我得说,Leopold 几乎是唯一一个总嫌我给的数字太低的人。有时候他的预测偏高,有时候我的预测偏低。但总的来说,我认为其他人也在做类似的事。你可以看看整个对冲基金领域,翻翻他们的 13F 文件,就会发现他们持有的资产——可能不完全和 Leopold 一样,因为关键问题始终在于:什么是最受制约的因素?什么东西最有可能超出预期?

这才是你真正想要利用的东西:市场中的低效。从某种意义上说,我们的数据通过让市场的基础数据更加准确,从而让市场变得更高效。很多基金确实会根据已有的信息进行交易……我不认为 Leopold 是唯一这么做的人。不过,我认为他对 AGI 爆发的信念是最坚定的。

没错,但这些赌注赌的不是 2035 年会发生什么。你下的那些赌注——至少从包括 Leopold 在内的不同基金公开回报中能看出来的——赌的是过去一年发生了什么。过去一年发生的事情,用你的电子表格就能预测出来。关键在于买入下一年的电子表格。

Dylan Patel

那不仅仅是电子表格。还有报告,还有数据的 API 接口。数据量非常大。

但你明白我的意思吗?这跟什么疯狂的奇点论没关系。关键在于,你赌不赌内存短缺?

Dylan Patel

你只有在相信 AI 会大规模爆发的情况下,才会去赌内存短缺。内存短缺在很大程度上是建立在……至少对于湾区那些思考基础设施的人来说,这是显而易见的。随着上下文窗口越来越长,KV cache 会急剧膨胀,所以你需要更多的内存。然后你算一下账就知道了。

你还必须对供应链有深入了解,知道哪些晶圆厂在建、哪些数据中心在建、芯片数量是多少,以及诸如此类的事情。我们紧密追踪所有这些不同的数据集,但归根结底,需要有人完全相信这一切将会发生。

一年前,如果你告诉别人内存价格会翻两番,而智能手机销量在未来一两年内会下降40%,人们会说:“你疯了,这绝不可能。” 但确实有少数人相信这一点,而这些人真的去交易了内存。

而人们确实这么做了。我不认为 Leopold 是唯一一个收购内存公司的人。当然,他在规模、定位和操作方式上比一些人、甚至可能是大多数人做得更好。我不想评论谁的回报如何,但他确实做得很好。其他人也做得非常好。

哇,你让我有史以来第一次变得这么外交辞令。不,不,你没问题。我觉得这很有趣。我居然在当外交官,而我平时可是很犀利的。

02:18:30 – 台积电会把苹果从 N2 工艺上踢出去吗?

好的,最后来几个快问快答。按照你所说的,关于内存、逻辑芯片等等,N3 工艺大部分将用于 AI 加速器,但 N2 工艺目前主要是苹果在用……未来,我想 AI 也会想用上 N2 工艺。如果英伟达、亚马逊和谷歌说:“嘿,我们愿意为 N2 产能付很多钱”,台积电能因此把苹果踢出去吗?

Dylan Patel

我认为这其中的挑战在于芯片设计周期很长,所以那至少是一年以后的事情,而基于 2 纳米工艺的设计更是要一年多以后才能落地。

真正会发生的情况是,英伟达和其他公司会这样说:“嘿,我们愿意预付产能费用,你为我们扩建产能。” 也许台积电能从中赚取一点利润,但不会太多。他们不会完全把苹果踢出去。他们会做的是,当苹果下单 X 数量时,他们可能会说:“嘿,我们预估你只需要 X 减一的数量,所以我们给你的就是 X 减一。” 然后这部分弹性产能,苹果就没办法了。

传统上,苹果公司一直会在全年范围内多订购 10% 的产能,然后再削减 10%。有些年份他们会用满这整个 10% 的余量。具体数量会根据季节和宏观经济状况而变化。

我认为台积电不会把苹果踢出去。我认为苹果在台积电营收中的占比会越来越小,因此台积电满足其需求的意愿也会降低。台积电最终可能会开始说:“嘿,你必须提前预订明年的产能,甚至两年后的产能,而且你还得预付资本支出。”因为英伟达、亚马逊和谷歌已经在这么做了。

我在想是否有必要讨论具体数字。我手头没有这些数据。在未来几年里,苹果在 N2 工艺上占据的份额与 AI 领域相比如何?

迪伦·帕特尔

今年,苹果占据了 N2 工艺大部分即将生产的产能。AMD 也有一小部分。他们正尝试提前制造一些 AI 芯片和 CPU 芯片。份额很小,但绝大部分还是苹果的。

展望下一年,随着其他厂商开始提升产能,苹果的份额仍将接近一半,但之后会急剧下降,就像在 N3 工艺上那样,当时他们占了一半。我所说的 N2 包括 A16,它是 N2 的一个变体。随着时间的推移,这些节点将占据主导地位。

同样有趣的是,传统上苹果总是第一个采用新工艺节点的厂商。而 2 纳米实际上是他们第一次没有做到这一点。当然,华为除外。在 2020 年及之前,华为和苹果都是最早采用新节点的厂商,但当时他们都在制造智能手机。现在,在 2 纳米节点上,AMD 正试图在同一时间窗口内,制造一个 CPU 和一个 GPU 小芯片,并通过先进封装技术将它们封装在一起,这与苹果的时间线相同。这对 AMD 来说是一个巨大的风险,可能导致潜在的延迟,因为这是一项全新的工艺技术,难度很大。但归根结底,这是他们为了比英伟达更快地扩展规模并试图击败英伟达而押下的一注。

展望未来,当我们进入 A16 制程节点时,那里的第一个客户甚至不再是苹果,而是 AI。随着时间推移,这一趋势将愈发显著。苹果不仅不会成为新节点的首发客户,也不会占据新节点的大部分产能。届时,他们就会像其他普通客户一样。

由于台积电的资本支出规模持续膨胀,而苹果的业务并未以同样速度增长,他们正变得越来越不重要的客户。他们还会削减订单,因为供应链中的各个环节——无论是封装、材料、DRAM 还是 NAND——都在将他们挤出。这些环节的成本在不断上升。而由于消费者购买力并不强劲,他们很可能无法将所有成本转嫁给客户。最终就陷入了这样的困境:他们不再是台积电历史上那种最亲密的伙伴了。

你认为如果华为能获得 3 nm 制程,他们能造出比 Rubin 更好的加速器吗?

迪伦·帕特尔

有可能,是的。华为也是最早推出 7 nm AI 芯片的公司之一。他们最早推出了 5 nm 手机芯片,同时也是最早推出 7 nm AI 芯片的公司。我记得华为昇腾比 TPU 早了两个月,比英伟达的 A100 早了四个月。

这仅仅是制程节点的迁移,并不代表软件或硬件设计等其他方面。但华为可以说是全球唯一一家拥有所有关键能力的公司。华为攻克了软件工程人才。华为攻克了网络技术。事实上,这历来是他们最大的业务。他们还攻克了 AI 人才。

此外,在英伟达之外,他们实际上拥有更优秀的 AI 研究人员。在英伟达之外,他们拥有自己的晶圆厂。在英伟达之外,他们还拥有销售 token 等产品的终端市场。华为能够吸引到最顶尖、最顶尖的人才。英伟达也能,但没那么集中,而且华为在中国拥有更大的人才池。

很有理由认为,如果华为拥有台积电,他们可能会比英伟达更出色。在某些领域,中国拥有英伟达难以轻易触及的优势。不仅仅是规模,在某些光学技术方面,中国实际上非常擅长。

我认为非常合理的是,如果 2019 年华为没有被禁止使用台积电,华为很可能已经超越苹果,成为台积电最大的客户。华为在网络、计算、CPU 以及所有这些领域都占有巨大份额。它们会持续扩大份额,并且很可能成为台积电最大的客户。

02:24:16 – 机器人与台湾风险

哇,这太疯狂了。我有个随机的最后问题想问你。埃隆采访的另一部分是关于机器人的。如果人形机器人的发展速度超出人们预期,如果到 2030 年有数百万个人形机器人到处运行,每个都需要本地算力,你对这意味着什么有什么看法?这需要什么条件?

迪伦·帕特尔

人们部署在机器人上的视觉语言模型(VLM)和视觉语言动作模型(VLA)存在很多困难。但在某种程度上,你不需要把所有的智能都放在机器人上。不这样做会高效得多。因为在云端,你可以进行批处理等等。

你可能想做的是,让云端一个能力更强、以极高批量运行的模型来决定大部分规划和更长周期的任务。然后它将这些指令下发给机器人,由机器人在后续的每个动作之间进行插值。或者,机器人收到一个像“嘿,拿起那个杯子”这样的指令,然后机器人上的模型就可以拿起杯子。在拿起的过程中,像重量和力度这类信息可能需要由机器人上的模型来决定,但并非所有信息都需要。它可以识别出“嘿,那是个耳机”,然后云端的大模型可以说:“我知道这些耳机是索尼 XM6 的”——这可不是 Dwarkesh 的广告植入,但是……

我就纳闷,这家伙为什么这么卖力地推销这东西。它就在桌子上。我们俩一起采访 Satya 的时候,它就挂在他脖子上。他是不是收了索尼的钱?

迪伦·帕特尔

可惜并没有。但不管怎样,它可能会说:“嘿,头梁是软的,重量是这个”,诸如此类。然后机器人上的模型可以智能程度低一些,接收这些输入,并执行动作。它可能每秒钟,或者根据动作频率每秒十次,从云端模型那里接收指令。但其中很大一部分可以卸载到云端处理。

否则,如果你在设备端完成所有处理,我认为成本会更高,因为你无法进行批处理。第二,你无法拥有像云端那样多的智能,因为云端的模型只会更大。第三,我们正处于半导体短缺的时代,任何部署的机器人都需要尖端芯片,因为机器人的功耗表现非常糟糕。你需要它低功耗且高效,而这样一来,你就要把原本用于AI数据中心的电力和芯片,转而投入到机器人中。所以,如果你部署数百万台人形机器人,那200吉瓦的电力就会减少。

我认为这非常有趣,因为人们可能没有意识到未来的一点:智能在物理意义上将变得多么集中。现在,有八十亿人类,他们的算力就在自己的头脑里,随身携带。

在未来,即使有机器人实际存在于物理世界中——显然,知识工作将以集中的方式,从拥有数十万甚至数百万实例的数据中心完成——你所暗示的未来,是一个由更集中的思考和更集中的计算驱动着世界上数百万台机器人的未来。这是关于未来的一个有趣事实,我认为人们可能没有意识到。

迪伦·帕特尔

我认为埃隆意识到了这一点,这就是为什么他要去不同的地方采购他的芯片。他与三星签署了一项大规模协议,在得克萨斯州制造他的机器人芯片,因为我个人认为他认为台湾的风险巨大。

正因如此,加上资源集中在台湾,在得克萨斯州制造他的机器人芯片意味着拥有一个不受同样限制的独立供应链。除了英伟达新推出的LPU(他们下周发布,但我们录制这期节目时是发布前一周),目前没有人在三星大规模制造AI芯片。

这期节目将在周五上线。

迪伦·帕特尔

哦,这期节目提前发布了。太棒了。他们下周要推出一款基于三星工艺的新AI芯片,不过这是英伟达最近才有的动作。那是目前唯一的另一处AI需求来源,而在台积电这边,所有东西都在争抢。他既获得了地缘政治上的多元化布局,也为自己的机器人业务实现了供应链多样性,而且他不需要像那些数据中心天才们那样,去面对无限度的支付意愿竞争。

最后一个问题,关于台湾。如果我们相信工具才是最终的瓶颈,那么,仅仅通过制定一个计划——一旦台积电遭到封锁或其他情况,就把每一位工艺工程师空运出来——我们能在多大程度上降低台湾在AI半导体供应链中的地位风险?还是说,你仍然需要把EUV光刻机也运出来,而单单一台设备就需要多架飞机运输,这根本不现实?

迪伦·帕特尔

如果你把所有工艺工程师都运出来,并且假设情况严重到要摧毁晶圆厂,那么现在就没有人能在台湾拥有全部晶圆厂了,这是一个巨大的风险。

这些光刻工具本身其实使用了大量在台湾制造的半导体。这就像一条蛇咬自己尾巴的梗——因为没有台湾的芯片你就造不出这些工具,而没有这些工具你又用不了台湾的芯片。当然,这方面也有一些多元化布局。光刻工具并不使用超先进的芯片,但说到底,这还是有些像龙咬自己尾巴的情况。

仅仅把所有工程师运出来并炸毁晶圆厂,意味着在垂直整合方面,中国大陆将拥有比世界其他地区更强的半导体供应链,因为你已经移除了台湾这个环节。你掌握了所有技术诀窍,但你必须在美国亚利桑那州或其他地方为台积电重建这一切。要复制出台积电多年来积累的全部产能,需要很长时间。

这样一来,你将会严重拖慢美国和全球的GDP。不仅仅是增长放缓,而是GDP大幅萎缩,而且你会面临大得多的麻烦。你新增算力的能力几乎降为零。到本十年末,原本每年能增加数百吉瓦的算力,假如台湾出了什么事,那么你在英特尔和三星那里可能只剩下10吉瓦,或者20吉瓦。这点量根本不算什么。

突然间,你确实在 AI 领域引发了一些疯狂的动态。当然,你拥有所有现有的算力,但现有的算力与正在扩张的算力相比,简直相形见绌。

好的。Dylan,这次访谈非常精彩。非常感谢你来做客播客。

Dylan Patel

感谢你的邀请。今晚见。

来源:Dwarkesh Patel:Podcast & Blog(RSS) · dwarkesh.com