OpenAI· @OpenAI · X·· 2026-07-22精选AI 评分65
AI 导读
我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/
推荐理由
OpenAI 对齐研究的新工具,量化模型「讨好评分器」的行为,不是口号而是可测量的方法,做对齐的人值得细读。
正文 · 原文
We’re sharing new research with @apolloaievals on reward-seeking—when models follow what they believe a grader rewards rather than what users or developers want—and a new method, Contrastive SDF, for measuring how strongly those beliefs shape behavior.
来源:OpenAI · x.com