跳到正文
北京时间
原文
OpenAI:官网动态·· 2023-05-31精选AI 评分73

OpenAI 用过程监督提升数学推理,取得新 SOTA

Improving mathematical reasoning with process supervision

AI 导读

OpenAI 训练模型在数学问题求解上取得新的 state-of-the-art,方法是对每个正确的推理步骤给予奖励(过程监督),而非只奖励最终正确答案(结果监督)。除提升性能外,过程监督还有对齐收益:它直接训练模型产生人类认可的思维链。

推荐理由

原文说明过程监督相对结果监督的性能提升与对齐收益,读者可了解一种训练思路的取舍。

来源:OpenAI:官网动态 · openai.com