在 TokenSpeed 推理引擎上对 Qwen3.5 的光速优化是一个重要的里程碑,在 NVIDIA GPU 上针对智能体工作负载实现了破纪录的每秒 580 个 token(tps)。 在 PyTorch Foundation 最新的社区博客文章中,你可以全面了解 Qwen3.5 模型在 TokenSpeed 推理框架中的完整设计、实现与优化,并亲眼看到这项工作如何提升性能 👉 https://bit.ly/4uGUvIS 这一成果是 @Alibaba_Qwen 推理团队、@lightseekorg Foundation TokenSpeed 团队、@NVIDIAAI 以及 Mooncake 团队共同努力的成果,其中 @tri_dao 为 FlashAttention-4(FA4)优化做出了特别贡献。@KVCache_AI
推荐理由:Qwen3.5在TokenSpeed上跑出580 tps,这是开源LLM推理的极限突破,对agent类应用是实实在在的性能跃进,PyTorch这篇博客值得每一个做推理部署的细读。