SemiAnalysis· @SemiAnalysis_ · X·· 2026-05-05精选AI 评分71
AI 导读
在行业标准推理引擎vLLM上的测试显示,NVIDIA GB300 NVL72的实测端到端性能已达GB200 NVL72的2.7倍。尽管其纸面参数仅显示NVFP4算力提升约1.5倍、HBM容量增加1.5倍且带宽相同,但在大多数服务商实际运行的中段负载区间,凭借全栈优化的复合增益,GB300实现了远超理论算力提升的性能飞跃。此次测试基于NVIDIA、Inferact和CoreWeave为开源项目提供的临时GB300系统完成,结果印证了端到端实测性能才是衡量硬件效能的黄金标准,而非单纯的纸面理论算力。
推荐理由
纸面 FP4 算力只多 50% 的 GB300,实际推理却快了 2.7 倍,全栈优化的复合增益比参数表好看太多,做推理服务的该重新算算 TCO 了。
正文 · AI 翻译
MINECRAFT STEVE 警报:GB300 ultra NVL72 在行业标准推理引擎之一 @vllm_project 上,已经比 GB200 NVL72 快 2.7 倍 🚀。从纸面上看,GB300 相比 GB200 仅拥有约 1.5 倍更快的 NVFP4 FLOP 和 1.5 倍更高的 HBM 容量,以及相同的 HBM 带宽;但由于全栈优化带来的复合增益,在大多数服务商所处的曲线中间段,GB300 最高可快 2.7 倍。端到端性能才是性能的黄金标准,而不是纸面上的理论算力。
感谢 NVIDIA、@inferact 和 @coreweave 的 10 倍工程师们,为我们提供了这个用于开源项目的临时 GB300!
来源:SemiAnalysis · x.com