跳到正文
北京时间
原文
公众号:智谱(GLM)· 智谱·· 2026-05-22精选AI 评分64

GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

GLM-5.1高速版:400 tokens/s,顶尖模型跑出最快速度

AI 导读

智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。

推荐理由

在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。

来源:公众号:智谱(GLM) · mp.weixin.qq.com