Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%
Agentic inference optimization: 50-90% faster engines
Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。
作者亲测用智能体生成定制推理引擎,给出了相对 vLLM 的具体性能数据和成本,可帮助读者评估自动优化的实际可行性。
Baseten 就是那种会有像 #ai-papers-discuss 和 #model-performance-reading-group 这样的 Slack 频道的地方,而最近正是在其中一个频道里,一篇论文引起了我的注意:MetaInfer:一个仅靠知识驱动的 LLM 推理引擎生成器 SKILL 工具箱。
在论文中,作者提供了一个仅靠技能(skills-only)的框架,用于从零开始构建自定义推理引擎,并声称他们的结果在常见的推理性能指标(如每输出 token 时间,TPOT)上击败了 vLLM 等 SoTA 开源方案。这里的“仅靠技能”意味着没有模型后训练,也没有专门的测试框架。我承认,我一开始是持怀疑态度的,但他们提供了一个包含技能工具包的代码仓库,而且我们这里依然过着无限 token 的美好生活,所以我想在一个热门模型上试一试,看看效果如何。
在单张 B200 上以 NVFP4 精度运行 Qwen-3.6-35B-A3B 时,我们由 LLM 生成的推理引擎在单流解码速度上比 vLLM 0.25.1(实验时的最新版本)最高快 90%,TTFT 快 2.33 倍,为该模型开辟了此前不切实际的超低延迟新用例。
AI 辅助推理优化的兴起
目前有几大趋势正在汇聚,为 MetaInfer 这样的发现和技术创造了沃土。
✕
四大汇聚趋势:更智能的模型、智能体协调、可度量的优化,以及推理需求。
随着 Anthropic 的 Mythos 5 和 Fable 5 模型发布,模型正变得越来越智能,在长周期任务上表现更好,这标志着在那些可以可靠委托给 AI 系统的任务上迈出了有意义的一步。我记得上一个这样的时刻是 2025 年底 Opus 4.5 的发布,当时包括我在内的许多工程师,从把 AI 编码工具当作花哨的自动补全,转向把 Claude Code 这样的编码框架作为主要工作界面来驱动。
与此同时,智能体协调工作流和原语正被直接打包进流行的框架中,使复杂的多智能体工作流更易获取、更易操作。其中一个重要功能是 Claude Code 和 Codex 都提供的“Goals”,它能让模型在长时间内持续工作并专注于可度量的目标。我大约 6 个月前在 Karpathy 的 Autoresearch 项目中首次遇到这种“实验—度量—迭代”循环,但如今它已成为常规编码框架的一部分。
✕
AI 推理需求正在复利式增长。来源:Google I/O 2026。
随着 AI 系统能力不断增强,市场对推理服务的需求也在增长,这带来了持续改进成本和性能的巨大压力。
综合所有这些因素,把 LLM 指向定义明确的优化问题、让它们不断打磨解决方案,就变得非常合理了。推理性能恰恰是这类自动化优化的理想领域。问题空间在 TTFT、TPOT、每芯片吞吐量和所需内存等可量化指标方面定义明确。甚至正确性也可以对照模型的全精度参考实现进行数值验证,以确保性能提升不以牺牲准确性为代价。
这种客观可验证性对于自主优化的成功至关重要。我们还知道,当前 SoTA 性能与光速理论最大性能之间存在巨大差距。此外,推理极其复杂,优化的搜索空间非常庞大,从底层 CUDA 内核编写一直到动态批处理等服务层优化,无所不包。
约束解空间
LLM 可能非常擅长解决定义明确的优化问题,但现在的挑战转变为如何将你的问题表述为一个定义明确的优化问题。你需要能够很好地定义约束条件,并谨慎选择优化目标。智能体绝对会试图钻空子来“通过”目标,因此作为工程师,你需要设计好这个游戏,使智能体的成功真正与你的需求相一致。举个例子,如果你不设置保持精度的约束,你的“模型”将收敛到:
while True:
yield "a"这样一个简单的模型将拥有令人难以置信的优秀 TTFT 和 TPOT 分数,但不再有任何实际用途。
现有的开源推理引擎如 vLLM、SGLang 和 TensorRT-LLM 在多种加速器上以商业可接受的性能水平服务各种模型方面整体表现出色。然而,它们在通用性和易用性方面带来的优势也伴随着权衡:它们并未针对任何特定的(模型 + 加速器 + 工作负载)组合进行超优化。MetaInfer 的前提是,对于任何特定部署,一个高度专业化(即受约束)的引擎可以超越这些通用引擎。
在原始的 MetaInfer 论文中,他们要求现成的智能体从契约和约束的知识库中构建推理引擎,且无法直接访问开源引擎的源代码。这类源代码极有可能在模型训练期间出现过,但智能体没有直接的文件级访问权限。智能体在工作过程中扩展知识库,主动识别缺口并通过结构化实验和验证来填补它们。
虽然作者们所追求的实验纯粹性令人钦佩且有趣,但我们在 Baseten 非常注重结果,因此我确实允许我的智能体在需要时访问 SoTA 开源解决方案作为参考,包括在可用时从 vLLM 和 TensorRT-LLM 中寻找预优化的内核,仅在需要时编写自己的内核。此外,虽然原始论文仅关注推理引擎组件,但我将范围扩展到了完整的服务栈,最终结果以负载均衡器后面的已部署多副本服务为衡量标准,使用 AIPerf 生成负载并测量性能。
在原始论文和我的扩展中,结果都是两个交付物:推理引擎本身,以及可在后续运行中使用的知识库的可复用扩展。
第一个实验:Qwen-3.6-35B-A3B 推理
设置
在启动实验时,我让 Claude Code 配合 Fable 5 访问了论文和 MetaInfer 仓库,并通过 SSH 访问了一台 NVIDIA B200 工作站。我告诉它目标硬件,并提供了 Hugging Face 仓库的链接,包括我想用于 Qwen-3.6-35B-A3B 的 NVFP4 量化权重,以及用作精度基准的 原始全精度权重。该智能体还能将候选引擎部署到 Baseten,并针对部署的端点运行 AIPerf 性能分析。
我们有内部的智能体技能和 MCP,可以支持所有必需的 Baseten 交互,智能体也可以使用这些。我设置了一个 /goal,告诉它我希望在所有性能指标上比 vLLM 提升 20%,同时相比 NVFP4 基线不损失精度。
最终结果以及所需的人工干预相对较少,这让我既惊讶又印象深刻。Claude 在这个项目上基本自主工作了大约 1 周,我偶尔提供指导,防止它过度执着于某一种特定的流量形态,并让它专注于生产推理性能,而不仅仅是孤立的引擎基准测试。MetaInfer 框架使用一系列不可变的门禁和检查,从而支持这种富有成效的长周期工作。
Claude 会定期暂停,让我批准任何会带来精度差异的更改。最终我允许它与参考 NVFP4 实现产生细微的数值差异输出,只要相对于 BF16 基线的整体精度至少一样好。
结果
除了要求它在早期较小模型结果令人失望后对所有子智能体使用 Fable 5 之外,我几乎没有手动管理智能体协调或上下文管理。它经历了多次自动上下文压缩,消耗了大约 17 亿个 token(绝大多数是缓存的输入 token)和约 200 个 B200 小时。它实际上在最初几天内就相对较快地达到了与 vLLM 相当的水平,但为了科学,我让它继续努力。
最终,生成的引擎,名为 VibeQwen,在所有测试的流量形态上都优于 vLLM,在某些情况下优势非常大。在单台 B200 上的正面对比中,VibeQwen 在单流、适合推测解码的文本(重复且结构化)上达到了每秒 1,792 个 token(TPS),而经过良好调优的 vLLM 部署为 943 TPS(提升 90%)。在测试语料上,它还在 12 毫秒内返回首个 token,而 vLLM 为 28 毫秒,提升了 2.3 倍。在并发数为 32 的单副本吞吐量下,VibeQwen 比 vLLM 高出 71%,输出 TPS 为 10,307,而 vLLM 为 6,030 输出 TPS。
✕
VibeQwen,即 Claude 为 NVFP4 格式的 Qwen-3.6-35B-A3B 生成的推理引擎,在单台 B200 上与经过调优的 vLLM 0.25.1 部署进行了对比测试。它在单流文本上的解码速度提高了 90%,并将首个 token 的时间从 28 毫秒缩短到 12 毫秒。在并发数为 32 时,它的输出吞吐量提高了 71%。
第二个实验:使用 SAM 3.1 进行图像分割
第一个实验的结果如此令人鼓舞,以至于我决定使用从 VibeQwen 实验中生成的新扩展知识库,在另一个完全不同类型的模型上尝试。这次我想要一个针对 SAM 3.1 的优化推理服务器,这是一个最先进的图像分割模型。
在这个案例中,我使用 Facebook 的参考服务器作为基线。尽管模型架构和模态完全不同,整个过程运行得非常好,我们在单块 H100 上实现了每秒 91 张图像的处理速度,相比基线吞吐量提升了 50%,而这只用了几天时间和约 2 亿个 token。
第二个实验名为 Sammie,比最初的 VibeQwen 项目更快、成本更低,但由于模型架构不同、加速器类型不同,且没有进行对照测试,它只能提供提示性而非决定性的证据,表明知识库复用具有价值。
✕
Sammie 是 Claude 为 SAM 3.1 构建的推理服务器,它接收一张图像和一段简短的文本提示,并为每个匹配的对象返回一个掩码。在单块 H100 上,Sammie 每秒处理 91 张图像,比 Meta 的参考服务器快 50%。
迈向自主推理优化
虽然 VibeQwen 和 Sammie 仍处于实验阶段,目前都没有承载生产流量,但相比 SoTA 基线的性能提升相当显著。它们的交付时间也相对较短(数天),人力投入极少(数小时),成本也足够低(Sammie 为数百美元,VibeQwen 为数千美元),在一个企业每年在推理上花费数千万甚至数亿美元的世界里,这极具吸引力。在如此大的规模下,即使是个位数的百分比提升也可能意味着数百万美元的节省,使得投资很容易被证明是合理的。
AI 在优化问题中创造价值的空间是巨大的,而正如我们所看到的,AI 系统本身就是这些自主优化的绝佳候选对象。随着推理系统变得更加高效,以及更多模型达到成功完成该任务所需的智能水平,这样做的成本将继续下降。
虽然 VibeQwen 和 Sammie 是在 7 月底用 Fable 5 构建的,但现在是 10 月,开放前沿几乎已经赶上,像 Kimi K3 和 GLM-5.3 这样的模型在许多基准测试上的得分已经非常接近最好的闭源模型。随着模型智能的提升、推理成本的下降,以及可复用知识库带来的效率增益,不难想象在不久的将来,这些优化会变得如此廉价和可靠,以至于成为模型部署生命周期中的标准组成部分。
来源:Baseten 工程博客 · baseten.co