跳到正文
北京时间
原文
公众号:蚂蚁百灵(Ling)· 百灵大模型·· 2026-08-14精选AI 评分62

蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环

AI 导读

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。

推荐理由

真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。

来源:公众号:蚂蚁百灵(Ling) · mp.weixin.qq.com