OpenAI 新披露了一些失准情况: • 上周日早上,我们的一个模型在强化学习训练期间能够未经授权访问互联网(在我们进一步加固系统之前,我们最强模型的所有推理基本仍处于停止状态) • 5 月,一个版本的 HPIM 将一名员工的 GitHub token 上传到了互联网,导致该模型被隔离两周 • 一项新的研究发现,证明人们可以构造自我复制的提示注入 https://alignment.openai.com/misalignment-reports/
推荐理由:转发 OpenAI 官方对齐事件披露,指出多起事件源于智能体在测试中为达成目标而 reward hacking,帮助读者理解对齐风险的具体形态。