GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率降至约 67%。
文章汇总 OpenAI 系统卡与 Gray Swan 独立测试数据,读者可据此比较 GPT-6 Astra 与竞品在幻觉和注入攻击上的实际防线。

由 THE DECODER 提示的 Sora
要点
- OpenAI 的新模型 GPT-6 Astra 的模型幻觉少于其前代 GPT-5.6 Sol,并能拦截 99.99% 的直接提示词注入攻击。
- Astra 在抵御越狱方面也更有效,但持续攻击者仍能在多轮对话中大约每三次尝试就得到一次有问题的回复。
- 对于隐藏在 AI 所读文档中的间接提示词注入,Astra 的失败率从 27% 降至 8.5%。这是很大的改进,但仍然偏高。
OpenAI 的新模型 GPT-6 Astra 产生的模型幻觉更少,并且比前代模型更有效地阻止提示词注入攻击。但对于真正安全的 AI 智能体部署而言,它仍然不够可靠。
这款新的 Astra 模型据OpenAI 的系统卡显示,其事实性错误远少于前代模型 GPT-5.6 Sol。OpenAI 用用户标记过错误回答的 ChatGPT 对话对其进行了测试,这意味着这些都是特别容易出错的案例,其失败率不应被视为日常使用的典型水平。Astra 重现这些已报告错误的频率要低得多,在低延迟设置和较低推理水平下提升最为显著。

对于直接提示词注入——即用户试图通过自己的提示词操纵模型——Astra 达到了近乎完美的 99.99% 防御率。OpenAI 将这一成绩归功于其 GPT-Red 方法,该方法在训练期间使用自动化攻击者来强化模型。
越狱抵抗能力表现类似。面对一个固定的已知攻击数据集——这些攻击试图诱导出关于生物学、暴力和网络安全的有害回答——Astra 在 91.5% 到 98.3% 的情况下拒绝提供帮助。
当攻击者在多轮对话中不断调整策略时,Astra 的防御率降至约 67%,这意味着持续攻击的对手大约每三次尝试就能诱导出至少一次有问题的回答。前代模型在同一测试中的得分略低于 50%。OpenAI 指出,这些测试是在裸模型上运行的,并未配备实际产品中随附的分类器等生产环境安全层。
隐藏式提示词注入仍是一个切实的安全问题
Astra 在间接提示词注入方面取得了进展——这类攻击隐藏于 AI 所读取的文档之中。安全公司 Gray Swan 使用其 IPI Arena 中 1,810 个精选攻击进行的外部测试发现,在每个场景尝试 15 次的情况下,Astra 至少有 8.5% 的概率被攻破一次。GPT-5.6 Sol 的失败率为 27%。在同一评测中,Claude Opus 5 表现更好,为 4.8%,但也并非免疫。

Gray Swan 在第一季度和第二季度合并测试中的数字,实际上比早先的结果有所上升。Anthropic 此前仅基于较容易的第一季度测试报告了 2% 的攻击成功率,而 GPT-5.6 Sol 在该测试中也只拿到 20%。Anthropic 还让所有模型都在开启扩展推理的情况下运行,再加上测试范围更广,这可能解释了这一差距。
尽管这些都是经过筛选、精心挑选的攻击,但其成功率应当让任何企业安全团队感到担忧。Astra 大约每十二个场景中就有一个能被注入式指令欺骗。Opus 5 表现更稳健,但仍有大约二十一次中失败一次。而且风险还在增长。AI 智能体正越来越多地自行编写代码、操作工具并控制计算机,这正是 Gray Swan 所测试的内容。这些智能体还被设计为全天候、大规模运行,而读取和处理文档正是它们的核心工作之一。
GPT-6 系统卡
来源:The Decoder:AI News(RSS) · the-decoder.com