跳到正文
北京时间
原文
公众号:蚂蚁百灵(Ling)· 百灵大模型·· 2026-06-02精选AI 评分68

KPop:用对称二元KL散度解决大模型强化学习的训练推理不一致问题

解决大模型的"人格分裂":KPop 如何应对强化学习的训练推理不一致问题

AI 导读

蚂蚁百灵团队提出KPop方法,应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值,仅需一个超参数,对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0(总参100B)上支撑800+步稳定RL训练,SWE-bench Verified从70.8%提升至76.28%。

推荐理由

解释固定屏蔽比为何误杀稀有token,并给出用对称二元KL散度自适应调整的方法,有助于理解RL训练不稳定并指导稳定训练实践。

来源:公众号:蚂蚁百灵(Ling) · mp.weixin.qq.com