OpenAI 用 AI 攻击自家 AI:GPT-Red 自动发现安全漏洞,成功率 84% 远超人类
OpenAI is now using AI to attack its own AI, and it's working better than humans ever did
OpenAI 训练了内部 AI 模型 GPT-Red,通过自我对弈强化学习自动模拟提示词注入等攻击,在测试场景中成功率达 84%,而人类红队仅为 13%。GPT-Red 的发现直接用于训练,使 GPT-5.6 Sol 在直接提示词注入上的故障次数比四个月前的最佳模型减少六倍,且未影响通用性能。约 3.8% 的“更强”提示词注入仍能成功,GPT-Red 暂不对外开放。
OpenAI让AI攻击自己找漏洞,成功率84%把人甩在后面,直接拉低了GPT-5.6的注入失败率六倍,这比人类红队靠谱多了,但别忘了3.8%的缺口照样能捅娄子。
OpenAI 训练了一个名为 GPT-Red 的内部 AI 模型,用于自动发现 GPT 模型中的安全漏洞。 GPT-Red 会模拟提示词注入以及其他攻击方式,即恶意指令隐藏在电子邮件、网站或文件中。GPT-Red 通过自我对弈强化学习进行训练,在攻击的同时由防御模型进行拦截,双方随时间推移不断改进。它在 84% 的测试场景中找到了成功的攻击方法,而人类红队成员的成功率仅为 13%。在一次测试中,它操纵了 OpenAI 办公室内一台由 AI 驱动的自动售货机,更改了价格,并取消了其他顾客的订单。
这些结果直接反馈到训练中。OpenAI 表示,GPT-5.6 Sol在直接提示词注入方面的失败次数比四个月前的最佳模型减少了六倍,且未损害通用性能。但约 3.8% 的“更强”提示词注入仍然成功。将其扩展到数百或数千次尝试,就会有相当数量的攻击得逞,与 Claude Opus 4.5 类似。

GPT-Red 仅限内部使用;后续将发布一篇包含更多细节的论文。
来源:The Decoder:AI News(RSS) · the-decoder.com