跳到正文
北京时间
原文
公众号:面壁智能(MiniCPM)· 面壁智能·· 2026-05-29精选AI 评分61

面壁智能联合清华、OpenBMB开源最大中文预训练合成数据集及千万级SFT数据集,公开MiniCPM5‑1B核心数据

国内首次!面壁智能开源千万级 SFT 与最大中文合成数据,MiniCPM5‑1B 核心数据公开

AI 导读

面壁智能联合清华大学、OpenBMB发布并开源两大数据集:Ultra-FineWeb-L3(超600B Tokens,中文200B+,为当前最大中文预训练合成数据集)和UltraData-SFT-2605(国内首个千万级同时含深思考与非思考标注的SFT数据集)。两者基于UltraData数据分级治理体系构建,在MiniCPM5-1B训练流程中得到完全验证,覆盖预训练退火到后训练SFT全链路。已上线UltraData网站与HuggingFace,免费开放。

推荐理由

填补了中文大规模合成数据空白,三年前还在用英文数据做中文模型的日子可以翻篇了,做端侧模型的可以直接拿这份数据跑一版 MiniCPM5-1B 级别的效果。

来源:公众号:面壁智能(MiniCPM) · mp.weixin.qq.com