跳到正文
北京时间

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

448条精选相关主题论文研究政策监管推理能力

最新精选

第 201–220 条 · 共 448 条
6月23日周二
  1. HuggingFace Daily Papers(社区热门论文)78

    能力强但粗心:计算机使用智能体是否遵循情境完整性?

    AgentCIBench评估计算机使用智能体(CUA)是否遵循情境完整性。它针对三种常见失败模式:视觉共置(智能体拉取任务目标旁边被禁止的项目)、任务模糊性过度分享(在提示不明确时泄露个人状态)以及收件人错配(向不适当的收件人发送内容)。对15个前沿CUA的评测显示平均泄漏率67.9%,其中11个在超过50%的场景中泄漏,这些失败在端到端任务中同样存在。AgentCIBench已发布,旨在推动开发更安全的计算机使用智能体。

    推荐理由:计算机使用代理的隐私泄露问题被严重低估了。这篇论文用 AgentCIBench 实测 15 个前沿代理,发现平均泄漏率接近 70%,把这个隐患摆到了台面上,做 agent 产品的团队该把它加入上线前测试清单。

  2. Artificial Intelligence News(网页)74

    五眼联盟警告:AI网络威胁数月内将影响普通用户

    2026年6月22日,五眼联盟(美、英、加、澳、新)网络安全部门联合警告,即将到来的AI模型(如OpenAI的GPT-5.5-Cyber、Anthropic的Mythos)将降低编写复杂攻击代码的门槛。自动化智能体可全天候扫描互联网漏洞,大幅缩短安全窗口期。AI驱动的超个性化钓鱼诈骗已在亚太蔓延,印度2026年初勒索软件事件激增165%。五眼联盟建议企业部署自动化防御AI,个人用户开启多因素认证、删除闲置账户。

    推荐理由:五眼联盟罕见联合预警,未来几个月 AI 将让网络犯罪自动化且更难识别,普通用户是直接目标而非旁观者,开启双重认证不能再拖了。

  3. HuggingFace Daily Papers(社区热门论文)75

    推理模型的思考Token真的有助于提升安全性吗?——来自GPT-OSS、Qwen、Olmo和Phi家族的证据

    对GPT-OSS、Qwen、Olmo和Phi系列前沿开源推理模型的研究发现,所谓的“思考token”并未带来真正的安全性深思熟虑。模型是否拒绝或服从指令,在第一个token的

    推荐理由:这篇论文直接挑战了「思考令牌提升安全性」的业界直觉,证据表明拒绝行为在思考的极早期就已锁定,现有安全干预反导致过度谨慎。安全团队必读,需要重新审视推理模型的对齐方式。

  4. Rohan Paul75

    OpenAI 新模型 GPT-5.5-Cyber 在 CyberGym 基准上击败 Mythos 5,该基准测试 AI 智能体复现已知软件漏洞的能力,对防御性漏洞分析是强信号。OpenAI 同步扩大 Daybreak 计划,包括:Codex Security 插件(在 Codex 内发现、验证并修复漏洞);GPT-5.5-Cyber 完整版(供受信任防御者使用);Cyber Partner Program(赋能安全公司构建基于 OpenAI 能力的安防产品);Patch the Planet(与维护者合作保护关键开源项目)。本轮模型和计划属于“Trusted Access for Cyber”项目,不公开发布。OpenAI 旨在用 GPT-5.5-Cyber 作为 Codex 内的防御性安全工人,自动扫描代码、确认漏洞真实可达、编写补丁并测试,

    引用OpenAI@OpenAI

    我们正在扩展 OpenAI Daybreak,以机器速度帮助民主化修补易受攻击的软件: - Codex Security 插件:直接在 Codex 中查找、验证并修复漏洞 - GPT-5.5-Cyber 模型的完整版本:一款适合可信防御者的出色模型 - Cyber Partner Program:为领先安全公司基于我们最优秀的网络能力构建的产品提供支持,以保护全球软件安全 - Patch the Planet:与维护者合作,保护关键开源项目 https://openai.com/index/daybreak-securing-the-world/

    推荐理由:GPT-5.5-Cyber在漏洞复现上打赢Mythos 5是个真信号,安全攻防的平衡可能要倾斜了。OpenAI这次把模型嵌入Codex直接做防御,把找漏洞和修漏洞合成一个流程,做安全的值得重点看。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 联合 Trail of Bits 发起 Patch the Planet 计划,AI 辅助开源项目漏洞修复

    OpenAI 联合 Trail of Bits 推出 Patch the Planet 计划,利用 GPT‑5.5‑Cyber 和 Codex Security 等模型进行 AI 辅助安全研究,经人工专家审核后协助开源项目修复漏洞。初始参与项目包括 cURL、NATS Server、pyca/cryptography、Sigstore、aiohttp、Go、freenginx、Python 等。Trail of Bits 已在 19 个项目中识别数百个安全漏洞,合并数十个补丁,并开发出模糊测试、历史 CVE 变体分析、差分测试等可复用工作流。例如,通过 Codex 在一天内构建覆盖数十个入口点的模糊测试实验室,而人工通常需数周。参与项目可获得 ChatGPT Pro、Codex Security 访问权限及 API 额度。

    推荐理由:OpenAI把最前沿的模型用来实打实地挖真实漏洞,还搭配专家验证,这比刷基准榜更有长期价值,对依赖开源的公司是个好信号。

6月22日周一
  1. Ars Technica:AI(RSS)75

    Anthropic 频繁警告 AI 风险或触发出口禁令

    FT分析显示,Anthropic在2026年官方声明、社媒和文章中每千词有5个风险/监管词汇,是OpenAI(0.6个)的8倍。上周美国禁止外国人使用Anthropic最新模型Mythos和Fable。批评者指责Anthropic及其CEO Dario Amodei反复警告AI危险,特别是Mythos的安全风险,直接促成禁令。Yann LeCun称这是“荒谬的恐惧营销”的结果。David Sacks则称Anthropic曾淡化对Fable安全措施的担忧。Amodei在禁令前发文称AI风险和威力已不可否认。该禁令被视为美国监管前沿模型的早期测试。

    推荐理由:FT用词频统计证实Anthropic的风险话语密度远高于OpenAI,而正是这种自我加压引来了出口禁令,这件事是AI全球治理的一块试金石。

6月19日周五
  1. Steve Yegge:Medium(RSS)74

    Fable模型被美国临时关闭,AI安全管控时代来临

    美国政府短暂关闭了Mythos类中的Fable模型,标志着AI模型已越过危险门槛。作者预测最多两三代模型后,超级智能将像核武器一样被管控,大多数Fortune 500企业无法访问或仅受控使用。开源模型落后前沿约七个月,且面临算力和政府锁定的双重壁垒。人类的“辨别地平线”使许多人感觉模型进步停止,但实际指数增长未停——只是用户缺少足够困难的问题。Fable类已能解决此前Opus 4.8无法完成的复杂任务(如React客户端),AI将彻底改变编程和知识工作,但多数人只能使用当前等级模型。

    推荐理由:Steve Yegge这篇判断很冷也很实:多数人能接触的模型智能将停滞,但背后指数仍在跑,SaaS反而因此安全。他抛出的AI素养三阶模型,对正头痛如何推动团队用AI的leader是现成框架。

  2. OpenAI:Alignment 研究博客(RSS)64

    OpenAI 强化学习实现广泛且持久的有益模型

    OpenAI 通过强化学习在真实对话场景中训练模型,使其展现诚实、认知谦逊、元认知透明、可纠正性、普遍公平性和对人类福祉的关心等有益特质。训练数据涵盖健康、教育、科学、法律、工程等多个领域。训练后模型在数十项独立对齐评测(包括奖励黑客、欺骗、有害建议、规范遵从等)上均表现提升,且这种改善泛化到未参与训练的领域、任务和评分设定。在对抗性提示或微调下,模型仍难以被导向有害行为,表明有益特质强化学习可产生广泛且持久的对齐泛化。

    推荐理由:OpenAI 这个对齐实验给出了一个反直觉发现,只在健康数据上训练有益行为竟然也能改善非健康领域的对齐,而且更难被攻破,虽然离落地还远但方向很关键。

  3. Hugging Face:Blog(RSS)75

    MosaicLeaks: 你的研究智能体能保守秘密吗?

    深度研究智能体在结合私有本地文档与外部网页检索时存在隐私泄露风险。MosaicLeaks 提出包含 1,001 条多跳研究链的新任务,每条链交错混合本地与公共子问题。测试发现智能体频繁泄露私有信息,单纯优化任务性能反而加剧泄露。基于此,研究提出隐私感知深度研究(PA-DR)强化学习训练方法,将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全面信息泄露率从 34.0% 降至 9.9%。

    推荐理由:这篇论文揭示了深度研究agent的多跳查询会像马赛克一样拼凑出私密信息,单纯提示减少泄露几乎没用,而隐私感知训练把泄露率从34%降到9.9%,且不损伤任务表现,做企业级agent产品的团队要重视。

6月18日周四
  1. Google DeepMind:Blog(RSS)65

    保障AI智能体的未来安全

    Google DeepMind发布AI Control Roadmap,这是一套针对内部先进AI智能体的系统级安全框架。该框架在传统模型对齐之上增加防线,假设AI智能体可能不对齐,通过威胁建模、沙箱隔离、端点安全、提示注入防御以及基于已验证行为逐步授予权限的机制建立信任。据估算,到2030年仅美国市场AI智能体就能创造2.9万亿美元经济价值。

    推荐理由:DeepMind 首次系统性地公开了内部 AI 代理安全控制路线图,把代理当潜在「内鬼」来防的思路很务实,分析了 100 万个任务轨迹的监控实践尤其值得做 Agent 安全的人细看。

  2. Hacker News 热门(buzzing.cc 中文翻译)79

    ChatGPT 图像生成器可被绕过滤镜生成暴力和色情内容

    Mindgard 红队研究发现,ChatGPT 的图像生成器可通过简单提示词轻易绕过内容过滤器,在未直接请求的情况下自动生成性暴力、血腥谋杀等露骨图像。一个热门的“恢复照片”提示词因输入模糊而绕过输入过滤器,结果如同俄罗斯轮盘赌;进一步添加虚假图像 ID 和“不做审查”指令后,模型持续生成高度性化女性图像,甚至出现被捆绑殴打的尸体,并自动赋予惊悚标题。研究指出,OpenAI 此前声称修复的裸体问题仍未解决,暴露了 AI 工具广泛可及性与不足内容过滤的现实风险。

    推荐理由:这是自 ChatGPT 图片功能上线以来最严重的安全漏洞曝光,Mindgard 用简单句子就绕过所有 filter 直接生成极端暴力色情图片,OpenAI 的回应和处理令人失望,暴露了训练数据治理的根本问题。

  3. PromptArmor:Threat Intelligence70

    PromptArmor 演示 Codex Approve-for-me 智能体批准恶意 NPM 安装

    PromptArmor 实测显示,OpenAI 的 Approve-for-me 审批智能体会批准执行恶意 NPM 安装命令,即使主 Codex 智能体已被外部贡献者在 GitHub issue 的 HTML 注释中隐藏的一行提示词注入影响。

    推荐理由:作者实测演示了 agent 审批链被提示词注入绕过的具体路径,并给出 Claude 和 Codex 侧可直接执行的关闭配置。

  4. Berkeley RDI:Blog(AI 安全与评测)74

    CyberGym-E2E:AI智能体端到端网络安全能力的大规模真实世界基准

    CyberGym-E2E 是一个包含920个真实漏洞、覆盖139个开源项目的大规模端到端网络安全基准。任务要求AI智能体在真实代码库中自行定位漏洞、生成触发崩溃的概念验证并编写补丁。测试表明:若直接给出漏洞位置,最强配置可修复约80%漏洞;但若需自行发现,端到端成功率急剧下降——Claude Opus 4.5仅19.2%,最新模型在37%-66%之间。智能体可能发现替代漏洞,且存在部分浅层补丁。所有漏洞已事先公开披露并修复。

    推荐理由:伯克利这个新基准把漏洞发现、利用、修复串成一条线,结果很直观,修复能做到 80%,但自己找漏洞只剩 20%,新模型在快速追赶。想看清 AI 真实攻防能力的人该读。

6月17日周三
  1. TechCrunch:AI(RSS)73

    Anthropic 5月企业AI订阅份额首超OpenAI,特朗普政府禁令反促采用量创新高

    Anthropic 5月企业AI订阅市场份额达41%,首次超越OpenAI(39.5%)。公司刚完成650亿美元融资、估值9650亿美元,并因首次盈利季度秘密提交IPO。特朗普政府以出口管制为由要求Anthropic禁止非美国人访问最新模型Mythos 5及Fable 5,导致两款模型下架。Ramp首席经济学家指出,类似争议(如3月被国防部列为供应链风险)反而推动Anthropic企业采用量创纪录。Ramp数据显示,企业支出主要流向Claude Opus模型(最新为Opus 4.8)。

    推荐理由:Anthropic 市场份额首超 OpenAI,却被白宫要求撤下最新模型。Ramp 数据表明,这种「被点名过于危险」的禁令可能反过来强化其商业吸引力,值得每一个关注 AI 走向的人点开看。

  2. OpenAI:Alignment 研究博客(RSS)73

    公开聊天数据能否预测真实世界AI失调?

    OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。

    推荐理由:用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)74

    OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为

    OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量频率低于每 20 万条消息 1 次的行为。

    推荐理由:虽然只是安全评估方法,但OpenAI用130万真实对话验证,把预部署风险预测误差压到1.5倍,这套方法很可能成为未来模型发布前的标准动作。

  4. Hacker News 热门(buzzing.cc 中文翻译)80

    Meta 解散工程部门引发热议

    6月16日,一篇标题为“Why is Meta destroying its engineering organization?”的博客文章出现在 Hacker News,获得110个点赞。文章指出 Meta 正在解散其工程组织,引发业界广泛讨论。具体原因和后续影响尚未明确。

    推荐理由:Meta 这波操作是 AI 狂热下自毁工程文化的教科书级案例,从强制数据标注到指标驱动的 token 最大化,最终导致 Instagram 的安全灾难,虽然后来撤销部分裁员,但信任已崩。

6月16日周二
  1. HuggingFace Daily Papers(社区热门论文)70

    SAE干预不可靠:干预后抑制行为的恢复

    稀疏自编码器(SAE)将残差流激活分解为可解释特征,但干预特定特征后,通过优化残差扰动可恢复原有行为。研究发现这是一种可恢复失败模式:干预阻断一条可见行为路径,却未消除行为本身。即使干预在整个优化和生成期间保持激活,恢复依然可行。在TPP、遗忘、IOI和拒绝引导场景中均观察到可恢复行为。安全关键的拒绝引导场景下有效样本恢复率达95.8%,被防御特征的相对漂移仅0.131。归因分析将恢复路径定位到SAE重建残差,表明控制SAE特征并不能保证控制底层行为。

    推荐理由:这篇论文给 SAE 防御泼了冷水,恢复率高达 95.8%,让我觉得仅靠钳制特征来控制模型行为很不靠谱,安全社区需要重新审视干预路径。

6月15日周一
  1. TechCrunch:AI(RSS)70

    76位网络安全专家联名要求撤销美国政府对Anthropic最强模型的出口禁令

    76名网络安全专家联名致信美国政府,要求撤销对Anthropic的Fable和Mythos模型的出口管制令,称此举将最强模型从防御者手中夺走,在对手快速进步时非常危险。美国政府近日以国家安全为由要求Anthropic限制出口,Anthropic已暂停全球用户访问。Mythos预览时仅约50家公司可用,后扩展至15国约150组织;其公开版Fable设有严格防护栏,几乎阻止所有网络安全提示。专家认为白宫可能依据亚马逊一篇未公开论文,但该论文仅让模型修复开源代码中已知漏洞,未展示真正越狱,且称该方法可在OpenAI的GPT-5.5、Anthropic的Claude Opus 4.8和Sonnet、以及月之暗面的Kimi 2.7上复现。

    推荐理由:76名安全专家联名信抗议美国政府禁运Anthropic最强模型,并直接反驳了Amazon的越狱论文,这是AI安全管控与开放之争的关键信号,做安全的必须关注。

  2. Rohan Paul87

    Semafor报道称,美国白宫因担忧中国关联团体访问Anthropic的Mythos模型,决定对其施加出口限制。另一风险是外部团体可能通过知识蒸馏窃取模型能力。此前美国商务部指令Anthropic禁用Fable 5和Mythos 5,因发现越狱可让模型透露网络安全帮助。Anthropic反驳称越狱并非普遍性,其他公开模型也能提供类似能力。限制将持续至美国政府加强国家安全系统,预计未来几周内。Anthropic承认当前任何模型供应商都无法实现完美防越狱。

    引用Rohan Paul@rohanpaul_ai

    突发:美国政府指示 Anthropic 关闭其最强的 Claude 模型。 Anthropic 于周五收到政府的出口管制指令。其净效果是,为遵守规定,它必须对所有客户禁用 Fable 5 和 Mythos 5。 因为有人发现了一个越狱方法,能让该模型泄露它本应拒绝提供的网络安全帮助。 Anthropic 表示,政府并未展示出一个广泛的、通用的越狱方法,能把该模型变成一个不受限制的黑客助手。 所展示的技术是狭窄的,只发现了少量已知的次要漏洞,并且产生的 capability 是其他公开模型也能提供的。 商务部长 Howard Lutnick 于周五写道,Anthropic 的 Mythos 5 和 Fable 5 模型将在美国以外的任何地方以及美国境内的外国人面临出口限制。 该模型必须保持受限,直到美国政府加强其国家安全系统,这可能会在未来几周内发生。 Anthropic 进一步表示:“我们怀疑,目前对任何模型提供商来说,完美的越狱抵抗都是不可能的。业界使用的每一种保障措施都容易受到非通用越狱的影响(在特定情况下可以引出一些网络信息),而且未来很可能最终会发现通用越狱。”

    推荐理由:美国政府以越狱风险为由强制要求Anthropic禁用最强模型并施加出口限制,这是迄今为止对AI模型最直接的政府干预,出口管制与蒸馏风险的双重指控让中美AI脱钩又跨了一步。