SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理
Blog SGLang Adds Day-0 Support for Muse Glimmer, a Multimodal Model Built for Local Agentic Workflows We're excited to partner with Meta Superintelligence Labs to bring Day-0 support for Muse Glimmer to SGLang, with dedicated optimizations tailored for high-performance inference of agentic workflows o... Meta Superintelligence Labs and the SGLang Team
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。
我们很高兴与 Meta Superintelligence Labs 合作,为 Muse Glimmer 在 SGLang 上带来 Day-0 支持,并针对本地硬件上的智能体工作流高性能推理做了专门优化。
亮点
- 模型: Muse Glimmer 是一个 30B 参数的多模态稠密模型,拥有 128k+ token 的上下文窗口,在本地硬件上运行端到端智能体工作流时能提供极具竞争力的性能。
- 性能: 在 NVIDIA GeForce RTX 5090 上,SGLang 可提供高达 1,452 tok/s 的总输出吞吐量,以及 236 tok/s 的单用户解码速度(NVFP4 搭配 DFlash),这得益于针对 SGLang 的 SM120 后端所做的专门优化。
- 特性: SGLang 为 Muse Glimmer 原生提供广泛的功能支持,包括 DFlash 投机解码、RadixAttention 前缀缓存以及可中断的 CUDA graphs。
- 硬件: 开发者可以在多种消费级和工作站硬件上部署 Muse Glimmer——通过 SM120 后端支持 NVIDIA GeForce RTX 5090、RTX PRO 6000 和 DGX Spark,并通过 MLX 后端支持 Apple Silicon。
Muse Glimmer 模型架构
Muse Glimmer 是一个 30B 模型,由一个 27.9B 的稠密文本解码器、一个 1.9B 的 ViT,以及一个基于 GELU 的多模态投影器组成。文本解码器有 52 个 Transformer 层。每一层包含分组查询注意力,其中 32 个查询头、两个键值头,随后是一个 SwiGLU 前馈网络。
滑动窗口注意力
解码器采用混合注意力模式,为提升效率,将三个 2,048 token 的滑动窗口层与每第四步出现一次的全序列层交替排列。在局部窗口上使用 RoPE、在全注意力层上使用 NoPE,使模型能够将上下文长度扩展到超出其训练限制。
功能支持
对本地 AI 硬件的广泛后端支持
Muse Glimmer 可通过 SGLang 部署在开发者本地构建和运行 AI 智能体时常用的各类硬件上,包括 Apple Silicon 设备(Mac mini 和 M 系列 MacBook Pro)、NVIDIA GeForce RTX 5090 GPU,以及 NVIDIA DGX Spark。在 NVIDIA SM120 平台上,SGLang 利用其优化的 GEMM 和 FlashInfer 后端实现高吞吐推理,而 Apple Silicon 设备则使用原生 MLX 后端来提供高性能本地服务。
使用 DFlash 的投机解码
为实现低延迟推理,请使用 SGLang 的 DFlash 实现:
--speculative-algorithm DFLASH
SGLang 原生优化
Muse Glimmer 与 SGLang 的众多原生优化兼容,包括低开销调度器、RadixAttention 前缀缓存以及可中断 CUDA 图。我们还将其中若干优化(包括前缀缓存)引入 SGLang MLX 后端,使 Apple Silicon 上运行智能体工作负载也能获得有竞争力的性能。
BF16、NVFP4、GGUF 和 MLX 4-bit Checkpoint
我们提供多种格式的 Muse Glimmer checkpoint,以满足不同硬件、保真度和系统性能需求的用户。
需要最高模型保真度的开发者可以在单张 H100 GPU 上运行原生 BF16 checkpoint。SM120 路径包含约 19.5 GB 的 NVFP4+MXFP8 混合量化方案。18 GB 的 NVFP4 checkpoint 搭配 5 GB 的 BF16 DFlash 推测器,可轻松装入单张 RTX 5090,从而在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上实现高性能部署。
我们还提供两个 GGUF checkpoint。其中较小的一个采用 Q4KM 格式,group size 为 128。该 checkpoint 可实现更快的推理速度,并可在内存限制更紧的硬件上部署。Q4K-Dynamic 则提供更好的模型质量。对于在 Apple Silicon 设备上工作的开发者,我们以 MLX 格式提供前述 GGUF checkpoint。
性能结果
我们在七个平台上使用 SGLang 对 Muse Glimmer 进行了测量,batch size 从 1 扫描到 8。下面报告的是 batch-1 交互性(tok/s/user)和 batch-8 聚合输出吞吐量(tok/s)。
| 平台 | 精度 | 解码 | tok/s/user(batch 1) | 输出 tok/s(batch 8) |
|---|---|---|---|---|
| NVIDIA B300 | bf16 | Standard | 91.77 | 21 |
| NVIDIA B300 | bf16 | DFlash | 308.51 | 261 |
| NVIDIA B300 | nvfp4 | Standard | 83.98 | 41 |
| NVIDIA B300 | nvfp4 | DFlash | 290.01 | 295 |
| NVIDIA RTX PRO 6000 | bf16 | Standard | 25.7 | 200 |
| NVIDIA RTX PRO 6000 | bf16 | DFlash | 108.08 | 33 |
| NVIDIA RTX PRO 6000 | nvfp4 | Standard | 58.04 | 51 |
| NVIDIA RTX PRO 6000 | nvfp4 | DFlash | 214.11 | 403 |
| NVIDIA DGX Spark | bf16 | Standard | 4.4 | 35 |
| NVIDIA DGX Spark | bf16 | DFlash | 19.1 | 134 |
| NVIDIA DGX Spark | nvfp4 | Standard | 12.1 | 92 |
| NVIDIA DGX Spark | nvfp4 | DFlash | 36.4 | 301 |
| NVIDIA RTX 5090 | nvfp4 | Standard | 63.9 | 501 |
| NVIDIA RTX 5090 | nvfp4 | DFlash | 236.4 | 1452 |
| NVIDIA RTX 5090 | q4_k_m | Standard | 72.6 | 230 |
| NVIDIA RTX 5090 | q4_k_m | DFlash | 140.7 | 332 |
| Apple M5 Pro | q4_k_m | Standard | 15.3 | 52.6 |
| Apple M5 Pro | q4 | Standard | 17.6 | 56.9 |
| Apple M5 Pro | q4k-dynamic | Standard | 12.6 | 49.1 |
DFlash 将 batch-1 交互性提升了 1.9–4.3 倍,具体取决于平台和精度:除 RTX 5090 上的 GGUF 路径提升 1.9 倍外,其余每种配置均达到 3.0 倍或更高。batch-8 的增益较小且波动更大,范围在 1.4 倍到 4.2 倍之间。MLX 后端不支持投机解码。
致谢
我们感谢 Meta Superintelligence Labs 团队和 SGLang 社区的合作,让 Muse Glimmer 在 SGLang 上实现了 Day-0 支持。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org