蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。
推荐理由:把训练中间态作为可下载 checkpoint 开放,配合 WSM 合并替代学习率衰减,做继续预训练或 MoE 研究时可从中间阶段开始,省去重复前置训练成本。