inclusionAI发布全球首个开源万亿参数思维模型Ring-2.5-1T
inclusionAI/Ring-V2.5
inclusionAI发布了全球首个基于混合线性注意力架构的开源万亿参数思维模型Ring-2.5-1T。该模型通过高效的1:7 MLA与闪电线性注意力提升了推理速度与探索能力,并借助扩展的强化学习训练增强了深度思考和长程任务执行能力。其在IMO 2025和CMO 2025数学竞赛中均达到了金牌级别的性能。模型支持128K上下文长度,并可通过YaRN技术扩展至256K,现已于Hugging Face和ModelScope平台开源。部署方面,已支持SGLang,并提供了多GPU节点的服务器启动示例。
蚂蚁把万亿参数的开源 thinking model 放出来了,混合线性注意力架构是真新路线而非换皮,IMO/CMO 金牌级数学推理说明这不是纯堆参数。做开源大模型部署的团队值得认真看看它的架构选择。

🤗 Hugging Face | 🤖 ModelScope
引言
隆重推出 Ring-2.5-1T:全球首个基于混合线性注意力架构的开源万亿参数思考型模型。
在迈向通用 AI 智能体的重要一步中,我们正在将混合线性注意力扩展至预训练和 RL 阶段。我们高效的 1:7 MLA + Lightning Linear Attention 提升了推理速度与探索能力,而扩展后的 RL 训练则增强了深度思考与长时程任务执行能力。
性能
Ring-2.5-1T 模型在 IMO 2025 和 CMO 2025 上均达到金牌🏅水平的表现。关于我们模型的详细解题过程,请参见示例。
模型下载
| 模型 | 上下文长度 | 下载 |
|---|---|---|
| Ring-2.5-1T | 128K -> 256K (YaRN) | 🤗 HuggingFace 🤖 ModelScope |
注意:如果你对之前的版本感兴趣,请访问 Huggingface 或 ModelScope 中过往的模型合集。
部署
SGLang
环境准备
我们后续会将模型提交至 SGLang 官方发布,现在我们可以按照以下步骤准备环境:
git clone -b ling_2_5 git@github.com:antgroup/sglang.git
cd sglang
# Install the python packages
pip install --upgrade pip
pip install -e "python"
运行推理
SGLang 目前同时支持 BF16 和 FP8 模型。这取决于 ${MODEL_PATH} 中模型的 dtype。
以下是在多 GPU 节点上运行 Ring-1T 的示例,其中主节点 IP 为 ${MASTER_IP},服务器端口为 ${PORT}:
- 启动服务器:
# Node 0:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 0
# Node 1:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 1
# Node 2:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 2
# Node 3:
python -m sglang.launch_server --model-path $MODEL_PATH --tp-size 8 --pp-size 4 --dp-size 1 --trust-remote-code --dist-init-addr $MASTER_IP:2345 --port $PORT --nnodes 4 --node-rank 3
# This is only an example. Please adjust arguments according to your actual environment.
- 客户端:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'
更多用法可参见此处
许可证
本代码仓库依据MIT 许可证授权。
来源:蚂蚁 inclusionAI:GitHub 新仓库 · github.com