Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失
LFM2.5 Q4\_0 Checkpoints from Quantization-Aware Distillation
Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。
QAD 量化蒸馏恢复 Q4_0 模型九成六以上 BF16 精度,对应树莓派和手机等边缘设备,在保持低内存与高吞吐的同时缩小与全精度模型的差距。
今天,我们发布 QAD Q4_0 GGUF。这些是 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 的更新版 4-bit checkpoint。它们让开发者能够在 Q4_0 的内存占用和速度下运行 LFM2.5 模型,而不必承受通常的质量下降:
- 采用量化感知蒸馏(QAD)训练:将高精度教师模型蒸馏到量化学生模型中
- 与原生 Q4_0 相同的内存占用和速度:它们保留了 Q4_0 GGUF 的低内存占用和高吞吐量
- 恢复程度:量化所损失的 BF16 平均准确率恢复了 97%
基准测试结果
对于全部四个模型,我们在涵盖推理、指令遵循、工具使用和智能体能力的基准套件上,将采用训练后量化(PTQ)生成的已发布 GGUF 与经过训练的 QAD Q4_0 checkpoint 进行对比:GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4。BF16 GGUF 作为同格式下的上限。我们还加入了一项与规模相称的数学评测:LFM2.5-230M 和 LFM2.5-350M 使用 GSM8K,LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 使用 AIME25。我们报告五次重复的平均值。
在全部四个模型中,QAD 大幅提升了 Q4_0 checkpoint。QAD checkpoint 分别保留了各自 BF16 基线性能的 97.1%、96.5%、97.4% 和 96.6%。
真实边缘硬件上的速度与体积
我们测量了四款模型 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 在四个目标平台上的解码吞吐量:MacBook Pro、NucBox EVO-X2、Samsung Galaxy S26 Ultra 和 Raspberry Pi 5。MacBook Pro 和 NucBox 使用 GPU 推理,而 Samsung 和 Raspberry Pi 使用 Arm CPU 推理。在进行了性能分析的情况下,BF16 和 F16 作为全精度参考一并展示。
230M 和 350M 的 QAD Q4_0 checkpoint 在评估方差范围内达到了与 Q5_K_M 相当的质量,同时解码吞吐量高出 4-33%。1.2B 和 2.6B 的 QAD Q4_0 checkpoint 达到了与 Q4_K_M 相当的质量,吞吐量高出 3-14%。QAD Q4_0 checkpoint 在适用情况下(即 230M 和 1.2B)也达到了与 Unsloth 的 UD-Q4_K_XL 相当的水平,后者是一个强大的外部训练后量化 checkpoint。
如何使用 QAD GGUF
将这些文件与 llama.cpp 或任何支持 GGUF Q4_0 产物的运行时配合使用。
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
开始使用 QAD GGUF
QAD GGUF 现已在 Hugging Face 上线:LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B。
我们迫不及待想看到你构建的作品。
引用
如需引用,请使用以下参考文献或 BibTeX:
Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.
或使用 BibTeX 引用
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}
来源:Hugging Face:Blog(RSS) · huggingface.co