跳到正文
北京时间
原文
Epoch AI:Gradient Updates· Venkat Somala·· 11 天前精选AI 评分65

Epoch AI 分析:华为 AI 芯片到 2030 年仍落后 Nvidia 约 4 年

How far behind Nvidia is Huawei?

AI 导读

Epoch AI 报告估算,2026 年华为总 AI 算力产出约为 Nvidia 的 1/25,Ascend 950 性能约为 B300 的 1/7、2022 年 H100 的一半。报告认为即便华为路线图全部兑现并计入走私 HBM 情景,到 2030 年其在芯片性能和算力产出上仍落后 Nvidia 约 4 年,出口管制是主要制约因素。

推荐理由

报告用量化估算比较双方芯片性能、产量和 HBM 供给,读者可以据此理解出口管制下差距的成因与走向。

正文 · AI 翻译

这是一份更详细报告的摘要,可在我们的网站上获取。


中美AI竞争涵盖从模型、数据中心到芯片及制造设备的方方面面。芯片和制造设备构成了这一技术栈的基础,决定了双方能部署多少算力。

这就是为什么半导体出口管制一直是美国AI政策的核心,也是为什么中国的国产芯片产业与美国相比如何如此重要。

华为,中国领先的AI芯片设计商,去年公布了其芯片路线图,并在上周的年度大会上展示了加速版本。该路线图雄心勃勃:计划在每颗芯片中集成更多算力,将更多芯片连接成单一高速系统,并成熟软件以决定实际能利用多少硬件。

但华为目前在单芯片性能和芯片产量上都落后于Nvidia。将两者相乘,华为在2026年的总算力产出将比Nvidia少约25倍。美国出口管制限制了其提升任一因素的能力,而Nvidia则继续推进前沿。

随着Nvidia取得进展,华为能缩小差距吗?

经过计算,我们认为几乎肯定不能。从现在到2030年,华为在芯片性能和算力生产方面可能仍将落后约四年。

华为2026年的起点

2026年,华为显著落后于Nvidia。要了解华为需要走多远才能赶上,我们可以比较华为和Nvidia各自的总算力产出,即各自制造的芯片数量乘以这些芯片的性能。我们将所有性能测量值转换为等效的Nvidia H100芯片数量,称为H100等效(H100e)。

性能:华为2026年的旗舰AI芯片Ascend 950,其计算吞吐量比Nvidia的B300少约7倍,仅为Nvidia 2022年H100的一半。换句话说,华为最新最强大的GPU性能仅相当于两代前、2022年开始出货的Nvidia芯片的一半,表明华为的芯片性能目前落后Nvidia四年。1

产量:对于2026年,我们估计华为将生产150万颗芯片——是Nvidia约600万颗的四分之一。

总算力:芯片数量为四分之一,每颗芯片性能为七分之一,华为2026年的算力产出将比Nvidia少约25倍。

华为到2030年提升性能的路线图

缩小这一差距需要在单个芯片和连接它们的系统上取得重大进展——华为已经制定了一个雄心勃勃的路线图来提升这两方面。

芯片性能

华为在芯片性能上起步就处于劣势,因为华为的代工合作伙伴中芯国际无法像英伟达的合作伙伴台积电那样密集地封装晶体管。晶体管是芯片性能的基石,因此更高的晶体管密度允许工程师在单颗芯片上集成更多算力。

美国出口管制限制向中国销售生产最密集芯片所需的先进光刻机,而中国在国内生产这些机器的努力可能要到2030年之后才能实现。

华为的路线图目标是在两代昇腾芯片上实现7倍的性能提升。由于昇腾芯片无法足够快地提升晶体管密度,它必须从其他方法中获得性能提升。

更大的芯片:首先,华为可以通过将芯片做得更大,并在每颗芯片中封装更多或更大的逻辑裸片(执行计算的部分)来使其芯片更强大,但代价是更高的成本和更多的缺陷。与此同时,英伟达也在扩大其封装,鉴于其更成熟的工艺,可能缺陷更少。

芯片架构:华为更新的昇腾路线图针对更低精度格式优化了性能,这很可能与前沿工作负载的发展方向相匹配。这一架构更新将使昇腾芯片在相同硅面积下执行更多计算,显著提升昇腾运行前沿AI工作负载的性能。

垂直堆叠:华为的长期重大押注是垂直堆叠逻辑裸片,以便在给定面积内装入远超中芯国际工艺单层所能印刷的晶体管数量。堆叠还能缩短芯片内部的通信时间,从而使芯片以更低功耗运行得更快。然而,这项华为称之为LogicFolding的技术要到2030年才会应用于昇腾产品线。英伟达预计于2028年推出的Feynman代产品,据报道将至少堆叠两层其更优越的逻辑裸片,比首款昇腾尝试这样做早两年。这将把晶体管密度带来的2倍优势叠加为4倍优势。

更快的系统

与所有主要芯片设计商一样,华为专注于优化整个计算系统,而不仅仅是单个芯片。

十年前,前沿模型可以在少量GPU上训练。如今,训练前沿模型需要数万颗AI芯片。在这种规模下,性能在很大程度上取决于芯片之间的通信速度以及软件协调它们工作的效率。华为正在同时推进这两方面。

更大的系统:华为计划在单个域内连接更多芯片。域是一组紧密连接在一起的芯片,使它们的行为更像一个巨大的系统,从而减少等待系统其他部分通信所花费的时间。

英伟达的域侧重于在一个72颗芯片的机架内实现极快的链路。在机架内部,任何芯片都可以全速与任何其他芯片通信。由于英伟达更优越的芯片可以将通信密集型工作保持在较少的芯片内,它无需为了更大的域规模而在通信速度上妥协。

华为走的是另一条路,用更大的域来弥补较弱的芯片;其规划的“SuperPoDs”将连接8,192颗芯片。然而,维持数千颗芯片之间的高带宽同时通信会带来难以承受的陡峭权衡。因此,华为实现了一种通信层级:距离更近的芯片拥有更高带宽,而距离更远的芯片则必须经过多跳。这是否能表现良好,取决于华为的软件能否更好地让通信保持在本地。遗憾的是,很难说SuperPoD在实践中会有多好,因为华为尚未公布关键性能指标。

更好的软件:协调跨芯片工作负载的软件可以让性能提升超过10倍,而这目前是英伟达最强的杠杆之一。华为对标英伟达CUDA的产品名为CANN,它于2018年首次发布,使得使用昇腾芯片变得困难。当DeepSeek尝试在昇腾芯片上训练其R2模型时,华为派出了自己的工程师,但仍无法完成一次训练运行,促使DeepSeek重新使用英伟达。然而,如果华为能够通过让中国实验室使用其芯片而非英伟达芯片来捕获反馈循环,软件差距可能会迅速缩小。不过就目前而言,这种可能性仍处于萌芽阶段:CANN仍落后CUDA数年,而尽管中国实验室正 越来越多地 使用国产芯片,只要能拿到英伟达硬件,他们仍然会去用。

华为在芯片性能上将落后三到四年

从纸面上看,英伟达的B300提供的计算性能大约是华为昇腾950系列的7倍。随着英伟达从Blackwell芯片转向Rubin和Rubin Ultra,到2027年,两家公司各自最好芯片之间的差距将扩大到约9倍。预计首款在峰值性能上接近B300的昇腾芯片是970,计划于2028年末出货。考虑到B300于2025年推出,这意味着即便到2029年,华为在芯片层面也将落后英伟达大约三到四年。

华为能否在数量上弥补差距?

假设华为把这一切都兑现:昇腾系列达到其路线图目标,SuperPoD在扩展到8,000颗芯片时表现良好,并且CANN成熟。即便如此,其芯片性能仍将落后英伟达数年,因为英伟达是在更先进的基础上拉动同样的杠杆。

如果华为无法在性能上匹敌英伟达,无论是芯片对芯片还是系统对系统,它能否通过生产更多芯片来弥补?

使用国产HBM:华为目前受制于高带宽内存(HBM),因为中国领先的存储制造商CXMT和规模较小的XMC才刚刚开始提升HBM产量,其供应尚无法满足中国芯片设计者的需求。

在 2026 至 2028 年间,我们估计 Nvidia 每年可生产数千万个 H100 等效算力,到 2028 年将增至近 1 亿个。华为以 CXMT 和 XMC 作为其唯一的 HBM 来源,到 2028 年可将产量提升至每年约 150 万个 H100e,约为 Nvidia 产量的 1.5%。

到 2030 年,中国国产 HBM 产量预计将大幅攀升——乐观情况下可达其 2026 年产量的 18 倍。然而,我们的粗略计算表明,华为 2030 年乐观的算力产量大约相当于 Nvidia 今年的产量。换言之,华为的算力产出将继续落后 Nvidia 约 4 年。

计入走私 HBM:2025 年,这一缺口由非法获取的组件以及中国企业在 2024 年 12 月出口管制生效前囤积的超过 1000 万个外国 HBM 堆栈所填补。2预计这批库存将在 2026 年耗尽,迫使中国 AI 芯片产量回落至 CXMT 的产能加上中国能够走私的数量。

那么,更多走私能否成为解决方案?假设华为在 2028 年走私的 HBM 达到其国产量的十倍——这是一个大到不切实际的规模,即便按 2025 年的 HBM 价格计算,成本也将超过 400 亿美元。在这种情况下,华为的产量将从 150 万 H100e 增至约 1600 万,仍仅约为 Nvidia 当年产量的 16%。

更多的 HBM 供应,无论是走私还是国产,都能提升华为的产量,但无法弥合差距。

出口管制正在发挥作用

2026 年初,华为生产的 AI 算力大约比 Nvidia 少 25 倍。其芯片大约落后三到四年,而生产这些芯片的供应链也无法与 Nvidia 匹敌。

从现在到 2030 年,华为在芯片性能和算力产量方面可能都将保持约四年的落后。出口管制在很大程度上造成了这一劣势,同时打击了产量和性能。出口管制虽未完全阻止华为的进步,却使华为的竞争变得困难得多、缓慢得多、昂贵得多。

与此同时,Nvidia 正在不断巩固其领先优势。Nvidia 的 HBM 供应商——SK Hynix、三星和美光——将在 2030 年前投入数千亿美元建设晶圆厂。Nvidia 的 Feynman 很可能较 Rubin 带来显著的性能提升,而到 2030 年,Nvidia 甚至可能开始出货 Feynman 的继任者。

华为是世界上最强大的工程组织之一,它最终或许能够迎头赶上——通过在垂直堆叠上超越 Nvidia、大幅改进其软件以缩小与 CUDA 的差距、获得尖端光刻机,以及大幅扩大生产规模。但克服这些劣势需要时间,而现有信息强烈表明,这不会在 2030 年前实现。

本文是一份更详细报告的摘要,可在我们的网站上查阅。

1

Nvidia 的真实领先优势很可能比这一比较所显示的还要大,因为华为的 CANN 软件栈远不如 Nvidia 的 CUDA 成熟,因此每颗昇腾芯片的潜力被利用的比例更低。

2

迄今为止,昇腾的大部分生产都依赖外国组件。据拆解报道,昇腾 910C 部件使用的是台积电的逻辑芯片以及三星或 SK 海力士的 HBM,而非完全国产的硅片。即便华为在其未来的昇腾路线图上达到了性能目标,中国的国内供应链能否以生产数百万颗昇腾单元所需的规模提供关键组件,仍是一个未解的问题。

来源:Epoch AI:Gradient Updates · epochai.substack.com