跳到正文
北京时间
原文
LMSYS:Blog(Chatbot Arena 团队)· Meta Superintelligence Labs and the SGLang Team·· 2026-08-10精选AI 评分72

SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

Blog SGLang Adds Day-0 Support for Muse Glimmer, a Multimodal Model Built for Local Agentic Workflows We're excited to partner with Meta Superintelligence Labs to bring Day-0 support for Muse Glimmer to SGLang, with dedicated optimizations tailored for high-performance inference of agentic workflows o... Meta Superintelligence Labs and the SGLang Team

AI 导读

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。

推荐理由

SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。

正文 · AI 翻译

我们很高兴与 Meta Superintelligence Labs 合作,为 Muse Glimmer 在 SGLang 上带来 Day-0 支持,并针对本地硬件上的智能体工作流高性能推理做了专门优化。

亮点

  • 模型: Muse Glimmer 是一个 30B 参数的多模态稠密模型,拥有 128k+ token 的上下文窗口,在本地硬件上运行端到端智能体工作流时能提供极具竞争力的性能。
  • 性能: 在 NVIDIA GeForce RTX 5090 上,SGLang 可提供高达 1,452 tok/s 的总输出吞吐量,以及 236 tok/s 的单用户解码速度(NVFP4 搭配 DFlash),这得益于针对 SGLang 的 SM120 后端所做的专门优化。
  • 特性: SGLang 为 Muse Glimmer 原生提供广泛的功能支持,包括 DFlash 投机解码、RadixAttention 前缀缓存以及可中断的 CUDA graphs。
  • 硬件: 开发者可以在多种消费级和工作站硬件上部署 Muse Glimmer——通过 SM120 后端支持 NVIDIA GeForce RTX 5090、RTX PRO 6000 和 DGX Spark,并通过 MLX 后端支持 Apple Silicon。

Muse Glimmer 模型架构

Muse Glimmer 是一个 30B 模型,由一个 27.9B 的稠密文本解码器、一个 1.9B 的 ViT,以及一个基于 GELU 的多模态投影器组成。文本解码器有 52 个 Transformer 层。每一层包含分组查询注意力,其中 32 个查询头、两个键值头,随后是一个 SwiGLU 前馈网络。

滑动窗口注意力

解码器采用混合注意力模式,为提升效率,将三个 2,048 token 的滑动窗口层与每第四步出现一次的全序列层交替排列。在局部窗口上使用 RoPE、在全注意力层上使用 NoPE,使模型能够将上下文长度扩展到超出其训练限制。

功能支持

对本地 AI 硬件的广泛后端支持

Muse Glimmer 可通过 SGLang 部署在开发者本地构建和运行 AI 智能体时常用的各类硬件上,包括 Apple Silicon 设备(Mac mini 和 M 系列 MacBook Pro)、NVIDIA GeForce RTX 5090 GPU,以及 NVIDIA DGX Spark。在 NVIDIA SM120 平台上,SGLang 利用其优化的 GEMM 和 FlashInfer 后端实现高吞吐推理,而 Apple Silicon 设备则使用原生 MLX 后端来提供高性能本地服务。

使用 DFlash 的投机解码

为实现低延迟推理,请使用 SGLang 的 DFlash 实现:

--speculative-algorithm DFLASH

SGLang 原生优化

Muse Glimmer 与 SGLang 的众多原生优化兼容,包括低开销调度器、RadixAttention 前缀缓存以及可中断 CUDA 图。我们还将其中若干优化(包括前缀缓存)引入 SGLang MLX 后端,使 Apple Silicon 上运行智能体工作负载也能获得有竞争力的性能。

BF16、NVFP4、GGUF 和 MLX 4-bit Checkpoint

我们提供多种格式的 Muse Glimmer checkpoint,以满足不同硬件、保真度和系统性能需求的用户。

需要最高模型保真度的开发者可以在单张 H100 GPU 上运行原生 BF16 checkpoint。SM120 路径包含约 19.5 GB 的 NVFP4+MXFP8 混合量化方案。18 GB 的 NVFP4 checkpoint 搭配 5 GB 的 BF16 DFlash 推测器,可轻松装入单张 RTX 5090,从而在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上实现高性能部署。

我们还提供两个 GGUF checkpoint。其中较小的一个采用 Q4KM 格式,group size 为 128。该 checkpoint 可实现更快的推理速度,并可在内存限制更紧的硬件上部署。Q4K-Dynamic 则提供更好的模型质量。对于在 Apple Silicon 设备上工作的开发者,我们以 MLX 格式提供前述 GGUF checkpoint。

性能结果

我们在七个平台上使用 SGLang 对 Muse Glimmer 进行了测量,batch size 从 1 扫描到 8。下面报告的是 batch-1 交互性(tok/s/user)和 batch-8 聚合输出吞吐量(tok/s)。

平台精度解码tok/s/user(batch 1)输出 tok/s(batch 8)
NVIDIA B300bf16Standard91.7721
NVIDIA B300bf16DFlash308.51261
NVIDIA B300nvfp4Standard83.9841
NVIDIA B300nvfp4DFlash290.01295
NVIDIA RTX PRO 6000bf16Standard25.7200
NVIDIA RTX PRO 6000bf16DFlash108.0833
NVIDIA RTX PRO 6000nvfp4Standard58.0451
NVIDIA RTX PRO 6000nvfp4DFlash214.11403
NVIDIA DGX Sparkbf16Standard4.435
NVIDIA DGX Sparkbf16DFlash19.1134
NVIDIA DGX Sparknvfp4Standard12.192
NVIDIA DGX Sparknvfp4DFlash36.4301
NVIDIA RTX 5090nvfp4Standard63.9501
NVIDIA RTX 5090nvfp4DFlash236.41452
NVIDIA RTX 5090q4_k_mStandard72.6230
NVIDIA RTX 5090q4_k_mDFlash140.7332
Apple M5 Proq4_k_mStandard15.352.6
Apple M5 Proq4Standard17.656.9
Apple M5 Proq4k-dynamicStandard12.649.1

DFlash 将 batch-1 交互性提升了 1.9–4.3 倍,具体取决于平台和精度:除 RTX 5090 上的 GGUF 路径提升 1.9 倍外,其余每种配置均达到 3.0 倍或更高。batch-8 的增益较小且波动更大,范围在 1.4 倍到 4.2 倍之间。MLX 后端不支持投机解码。

致谢

我们感谢 Meta Superintelligence Labs 团队和 SGLang 社区的合作,让 Muse Glimmer 在 SGLang 上实现了 Day-0 支持。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org

相关事件