Unsloth 宣布通过优化解码和新增 MTP 支持,让 GLM-5.3-Flash 的本地 GGUF 推理提速 1.6 至 3.4 倍,长上下文下最高达 3.3 倍。
GLM-5.3-Flash 正式发布 - 以极具竞争力的价格提供领先性能 - 原生多模态,支持 1M token 上下文窗口 - 320B-A18B 参数模型,采用 MIT 许可证发布 - 此前以 Ox Alpha 名义预览,完全运行在中国 AI 芯片上 博客:http://z.ai/blog/glm-5.3-flash 现已在所有官方平台上线: 模型权重:http://huggingface.co/zai-org/GLM-5.3-Flash API:http://docs.z.ai/guides/llm/glm-5.3-flash 编程套餐:http://z.ai/subscribe ZCode:http://zcode.z.ai/en 对话:http://chat.z.ai AutoClaw:http://autoclaw.z.ai
推荐理由:原文给出本地运行 GLM-5.3-Flash 的具体加速倍数、显存需求表和现成 GGUF 资源,方法可直接复用。

