ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。
首个开源的1.58-bit三元LLM,直接在昇腾芯片上原生训练,内存压缩到BF16的六分之一,8B模型就能跑在手机上,做端侧部署的可以立刻上手试试了。
BitCPM-CANN 刚刚成为全球首个完全基于中国自主研发AI基础设施训练的开源1.58位三元大语言模型。
由 ModelBest、清华大学和 OpenBMB 社区共同开发,整个训练流程——从量化算子、算法到全栈框架——都在华为昇腾910B NPU上原生执行。
1.58位三元权重仅使用3种权重状态,因此该模型在手机、PC、汽车以及本地工业设备上部署时所需内存大幅减少。
更难的成就是其背后的训练系统:QAT、STE、低位算子、算法、框架工作以及可复现的训练脚本,全部必须在昇腾910B上协同运行。
当硬件成本攀升时,胜出的模型不仅仅是排行榜上得分更高的那个,而是能够在真实约束条件下被训练、复现、部署和持续改进的那个。
🚀 ModelBest × @Tsinghua_Uni × OpenBMB 的 BitCPM-CANN 来了——而且它并不是在堆参数。 内存成本飞涨。硬件限制日益收紧。边缘 AI 需要更智能的解决方案——而 BitCPM-CANN 做到了!🎉 ✅ 边缘就绪:8B 模型可在手机、PC 和车载设备上流畅运行。结合 MoE,甚至 100B->60B 规模的模型也能装进终端硬件。 ✅ 内存高效:相比 BF16,内存占用降低约 6 倍——无需增加物理 RAM 即可解锁显著更多的模型容量。无需新芯片。 ✅ 原生构建于昇腾:首个 1.58-bit 训练流水线在华为昇腾 910B 上端到端完成——从量化内核到完整训练栈。不是移植。从第一天起就原生构建于昇腾。 ✅ 完整模型家族,全面验证,0.5B–8B:每个模型都与其全精度对应版本完全对齐,覆盖 11 项基准任务,相比全精度 MiniCPM4 保持 95–97%(1B-8B)的性能。开源且完全可复现——从研究到部署,你可以放心运行任何规模。 BitCPM-CANN 不只是一个模型——它是多年工程严谨性的成果,将复杂研究转化为你真正可以部署的东西。 开源,0.5B 到 8B。立即试用!👇 🤗 Hugging Face: https://huggingface.openbmb.com/collections/openbmb/bitcpm4-cann 🔭 ModelScope: https://www.modelscope.cn/collections/OpenBMB/BitCPM4-CANN
原文
🚀 BitCPM-CANN by ModelBest × @Tsinghua_Uni × OpenBMB is here — and it's not about stacking parameters. Memory costs are skyrocketing. Hardware constraints are tightening. Edge AI needs smarter solutions — and BitCPM-CANN delivers!🎉 ✅ Edge-ready: 8B model runs smoothly on mobile, PC, and automotive devices. Combined with MoE, even 100B->60B scale models could fit on terminal hardware. ✅ Memory-efficient: ~6× lower memory footprint vs. BF16 — unlock significantly more model capacity without adding physical RAM. No new chips required. ✅ Natively built on Ascend: The first 1.58-bit training pipeline completed end-to-end on Huawei Ascend 910B — from quantization kernels to the full training stack. Not a port. Built natively on Ascend from day one. ✅ Full model family, fully verified, 0.5B–8B: Each model is fully aligned with its full-precision counterpart, covering 11 benchmark tasks with 95–97% (1B-8B) retention compared to full-precision MiniCPM4. Open-source and fully reproducible — from research to deployment, you can run any size confidently. BitCPM-CANN isn’t just a model — it’s the result of years of engineering rigor, turning complex research into something you can actually deploy. Open-source, 0.5B to 8B. Try it now!👇 🤗 Hugging Face: https://huggingface.openbmb.com/collections/openbmb/bitcpm4-cann 🔭 ModelScope: https://www.modelscope.cn/collections/OpenBMB/BitCPM4-CANN
来源:Rohan Paul · x.com