AntLingAGI与SGLang团队合作,正式推出Ling-2.6-flash(亦称Elephant-alpha)即时指令模型,并在SGLang平台上实现了首发支持。该模型总参数量达104B,但活跃参数仅7.4B,专为低延迟的智能体工作流优化,能够实现即时响应。它在编码、文档处理和智能体任务中展现出极高的token效率,所用token数量显著减少。尽管活跃参数较少,其模型质量仍与当前SOTA水平相当,兼具速度与执行力,适合需要快速响应的生产级智能体应用。团队强调,快速且稳定的推理是提升用户体验的关键。
104B 总参但只激活 7.4B,蚂蚁这步棋是冲着 Agent 场景的低延迟去的,做 Agent 产品的人值得跑一下看看实际体感。
🥳 能与 SGLang 团队合作一直是我们莫大的荣幸,因为我们都相信快速且稳定的推理是我们宝贵用户体验的关键。🫡
希望大家都喜欢 Ling-2.6-flash(即 Elephant-alpha)🐘⚡️⚡️
打满~ 打满~~ 😝
🎉 认识来自 @AntLingAGI 的 Ling-2.6-flash,一个即时指令模型,总参数 104B(激活 7.4B)。SGLang 现已提供 Day-0 支持! 1️⃣ 即时响应:针对低延迟智能体工作流进行调优 2️⃣ 以远更少的激活参数达到与 SOTA 相当的质量 3️⃣ 高 token 效率:在编码、文档处理和智能体任务中显著使用更少 token 4️⃣ 生产就绪,适用于需要速度 + 强大执行的智能体 立即用 SGLang 运行它!
原文
🎉 Meet Ling-2.6-flash from @AntLingAGI, an instant instruct model with 104B total params (7.4B active). Day-0 support is now live in SGLang! 1️⃣ Instant responses: tuned for low-latency agent workflows 2️⃣ SOTA-comparable quality with way fewer active params 3️⃣ High token efficiency: significantly fewer tokens used across coding, doc processing & agent tasks 4️⃣ Production-ready for agents that need speed + strong execution Run it now with SGLang!
来源:Ant Ling · x.com