inclusionAI发布新一代即时大模型Ling-2.5-1T
inclusionAI/Ling-V2.5
inclusionAI推出新一代旗舰即时模型Ling-2.5-1T,其总参数量达1T,活跃参数为63B,预训练语料扩展至29T tokens。该模型采用混合线性注意力架构,支持1M tokens上下文长度,并通过结合“正确性”与“过程冗余”的复合奖励机制,在相近的token效率下,其推理能力显著超越前代,接近前沿思维模型水平。经双向RL反馈和智能体验证等对齐策略优化,模型在创意写作和指令遵循任务上表现提升。它已兼容主流智能体平台,并在通用工具调用基准BFCL-V4上取得领先的开源性能。
蚂蚁把 1T 参数的即时模型开源了,63B 活跃参数加 1M 上下文,主打效率而非堆算力,对国内做开源推理模型的团队来说是个值得对标的基线。

🤗 Hugging Face | 🤖 ModelScope
引言
Ling-2.5-1T,普惠智能,即刻见效。
思考型模型抬高了智能的上限,而即时型模型则通过平衡效率与性能来拓展其覆盖范围——让 AGI 不仅更强大,也更易获取。作为 Ling 家族最新的旗舰即时型模型,Ling-2.5-1T 在模型架构、token 效率和偏好对齐方面实现了全面升级,旨在将普惠 AI 的质量提升到全新水平。
- Ling-2.5-1T 拥有 1T 总参数量(激活参数 63B)。相比上一代,其预训练语料从 20T tokens 扩展至 29T tokens。借助高效的混合线性注意力架构和精细化的数据策略,该模型在处理高达 1M tokens 的上下文长度时,仍能实现极高的吞吐量。
- 通过引入结合“正确性”与“过程冗余”的复合奖励机制,Ling-2.5-1T 进一步推动了即时型模型在效率与性能平衡方面的前沿。在相当的 token 效率水平下,Ling-2.5-1T 的推理能力显著超越其前代,接近通常消耗约 4 倍输出 tokens 的前沿“思考型模型”的水平。
- 通过精细化的对齐策略——例如双向 RL 反馈和基于 Agent 的指令约束验证——Ling-2.5-1T 在偏好对齐任务上相较上一代取得了显著提升,包括创意写作和指令遵循。
- Ling-2.5-1T 在大规模高保真交互环境中采用 Agentic RL 训练,兼容 Claude Code、OpenCode 和 OpenClaw 等主流 agent 平台。它在通用工具调用基准 BFCL-V4 上取得了领先的开源性能。
模型下载
| 模型 | 上下文长度 | 下载 |
|---|---|---|
| Ling-2.5-1T | 256K -> 1M (YaRN) | 🤗 HuggingFace 🤖 ModelScope |
注意:如果你对之前的版本感兴趣,请访问 Huggingface 或 ModelScope 中过往的模型合集。
部署
SGLang
环境准备
我们稍后会将模型提交至 SGLang 官方发布,现在我们可以按照以下步骤准备环境:
git clone -b ling_2_5 git@github.com:antgroup/sglang.git
cd sglang
# Install the python packages
pip install --upgrade pip
pip install -e "python"
运行推理
SGLang 目前同时支持 BF16 和 FP8 模型。这取决于 ${MODEL_PATH} 中模型的 dtype。
以下是在多 GPU 节点上运行 Ling-1T 的示例,其中主节点 IP 为 ${MASTER_IP},服务器端口为 ${PORT}:
- 启动服务器:
# Node 0:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 0
# Node 1:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 1
# Node 2:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 2
# Node 3:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 3
# This is only an example. Please adjust arguments according to your actual environment.
- 客户端:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'
更多用法可参见此处
微调
我们推荐你使用 Llama-Factory 来微调 Ling-1T。
许可证
本代码仓库基于 MIT 许可证 授权。
来源:蚂蚁 inclusionAI:GitHub 新仓库 · github.com