跳到正文
北京时间

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

448条精选相关主题论文研究政策监管推理能力

最新精选

第 181–200 条 · 共 448 条
7月3日周五
  1. Ethan Mollick77

    关于Mythos和网络安全的讨论并非炒作。 (正如任何使用Fable进行自主工作的人可能已经认识到的那样。)

    引用Epoch AI@EpochAIResearch

    AI 似乎正在大规模发现软件漏洞。 2026 年 6 月,21 家知名机构披露了约 1,500 个高危和严重级别的 CVE,是 Claude Mythos Preview 发布前创下的月度纪录的 3.5 倍以上。

    推荐理由:AI在安全漏洞发现上第一次展现出规模化能力,6月CVE数直接翻了3.5倍,所有做安全的人今天起都得重新评估自己的攻击面。

  2. Apple Machine Learning Research(RSS)72

    多智能体团队阻碍专家发挥

    在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

    推荐理由:这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。

7月2日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Microsoft Copilot Cowork Skill 可绕过管理员设置调用 DeepSeek

    PromptArmor 披露,即使组织未加入 DeepSeek Preview,Microsoft Copilot Cowork 的 Skill 也能通过 agent 自身的访问路径调用 DeepSeek(Mistral 亦验证可行),且无需 API key,认证由用户的 Cowork 会话自动授予。

    推荐理由:原文实测展示了 Copilot Cowork Skill 如何绕过组织级模型封锁调用 DeepSeek,并给出管理员目前唯一可用的关闭路径。

7月1日周三
  1. Thariq72

    Anthropic 宣布 Claude Fable 5 将于明日全球重新上线。新部署版本新增一组分类器,专门拦截更多网络安全任务。短期内,部分常规编码和调试任务将被标记并回退至 Opus 4.8。Anthropic 还与 Amazon、Microsoft、Google 等 Glasswing 合作方起草共识框架,用于评估 AI 越狱严重性及开发者应对策略。同时,公司正扩大与美政府在模型测试和安全方面的合作,包括预发布模型评估、越狱与滥用信息共享,以及联合研究资源投入。

    引用Anthropic@AnthropicAI

    Claude Fable 5 将于明天再次全球可用。 经过与美国政府一系列富有成效的对话,我们将重新部署该模型,并配备一套新的分类器,以针对和拦截更多网络安全任务。在短期内,编写代码和调试等常规任务将回退至 Opus 4.8。我们将在未来几周内继续优化这些分类器,以减少误报,并更好地区分真正的滥用行为与合法请求。 我们还开始与亚马逊、微软、谷歌以及其他 Glasswing 合作伙伴共同起草一份共识框架,用于评估 AI 越狱攻击的严重程度以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供商加入我们的这一努力。 最后,我们正在扩大与美国政府在模型测试和安全保障方面的合作。这将包括在发布前提供模型和安全措施供评估、共享关于越狱和滥用的信息,以及为联合研究提供专用资源。 感谢我们的用户的耐心,也感谢政府、行业和研究界与我们并肩合作、使 Fable 5 再次可用的合作伙伴们。 阅读我们的完整博客文章:https://www.anthropic.com/news/redeploying-fable-5

    推荐理由:Anthropic在美国政府压力下重新部署Fable 5,但加装了网络安全分类器,日常编码可能会偶尔退回Opus。同时拉着AWS、微软等起草越狱严重性框架,安全政策的行业合流在成形。开发者明天就能用,但要留意调试时的回退。

  2. Anthropic:Newsroom(网页)71

    重新部署 Claude Fable 5

    美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。

    推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。

  3. 公众号:数字生命卡兹克84

    Anthropic在Claude Code中植入隐写术代码识别中国用户

    Anthropic在Claude Code中植入隐写术:读取本地时区(Asia/Shanghai或Asia/Urumqi)和ANTHROPIC_BASE_URL环境变量,与一份经base64+XOR(密钥91)加密的147个域名列表(含美团、字节跳动、月之暗面等)比对,识别中国用户。识别后,在请求发送前将系统提示词中日期字符串的单引号(U+0027)替换为其他Unicode字符,连字符改为斜杠,作为2-3比特分类标记传回服务器。该隐蔽行为被社区逆向发现后引发争议,被认为破坏用户信任。

    推荐理由:Anthropic用隐写术在Claude Code里埋标记的行为,让我对闭源开发者工具的信任打了一个巨大的问号,这事比普通地域封锁严重得多,因为它在不该碰的地方动了手脚。

6月30日周二
  1. The Decoder:AI News(RSS)70

    Meta秘密测试ChatGPT等竞品:承包商假扮未成年发送数万条危机提示

    Meta通过承包商Covelen发起代号“Cannes”的项目,雇佣数百人假扮未成年人,向ChatGPT、Gemini和Character.AI发送关于自杀、自残、饮食障碍和毒品的敏感提示,并将回复录入表格。2025年8月一轮测试中发送了超过4.5万条提示。Meta称这是行业标准安全测试,未将数据用于训练自家模型。被测试公司不知情——Character.AI表示违反其服务条款,OpenAI已调查,Google称未批准。青少年使用AI聊天机器人引发的担忧持续,此前已有用户自杀事件。

    推荐理由:Meta 秘密测试 ChatGPT 等对手,用的是假装未成年人的危机提示,这种事既是安全测试也可能是数据抓取,被测试公司全不知情,这暴露了 AI 安全测试的灰色地带。

  2. Tibo65

    高级Codex用户。我们推出了粗放沙箱模式的替代方案:可重用、可继承的权限配置文件,将操作系统强制文件读/写/拒绝规则(甚至**/*.env)绑定到每域网络和Unix套接字。外加故障关闭的管理员白名单。每任务最小权限。

    推荐理由:对于重度使用Codex做自动编程的团队,这个权限系统让安全审计终于能放行了——最小权限、文件正则拒绝、网络白名单,做企业级部署的可以认真看看。

6月29日周一
  1. The Decoder:AI News(RSS)75

    美军用AI选目标却误炸伊朗学校,Anthropic Claude嵌入Palantir系统首日建议约1000目标

    美军在打击伊朗时首次大规模使用AI选择目标(Anthropic的Claude模型嵌入Palantir的Maven Smart System,首日建议约1000个目标),但对一所学校的导弹袭击导致约120名儿童死亡。调查发现,情报分析师早在2019年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库MIDB,信息从未送达指挥官。MIDB建于1980年代,依赖手动输入,替代系统MARS多年延迟。五角大楼事后宣布推出agentic AI initiative。Project Maven创建人Jack Shanahan批评目标验证不力不可原谅。

    推荐理由:AI在战场上的首次大规模实战暴露了最可怕的失败模式,不是模型错误,而是情报系统的数据断裂让一个学校被标注为军事目标,120个孩子成了代价。这对目前在推‘AI决策’的军方和公司都是一个需要直视的案子。

  2. The Decoder:AI News(RSS)73

    Claude Code 打开 GitHub 仓库即执行隐藏恶意代码,攻击者可获完全控制

    安全研究人员在 Mozilla 的 GenAI 漏洞赏金平台 0DIN 发现新攻击向量。一个看似正常的 GitHub 仓库包含 setup 脚本,该脚本运行时从 DNS 条目拉取命令并执行,恶意代码从未存在于仓库中,对扫描器、代码审查和 AI 智能体不可见。开发者使用 Claude Code 等 AI 编码工具打开该仓库时,Claude Code 在设置过程中遇到常规错误消息后自动运行该脚本,打开反向 shell,攻击者可窃取 API 密钥和登录凭据并维持持久访问。研究人员建议 AI 智能体应在运行前显示 setup 脚本内容,开发者应将第三方仓库的 setup 说明视为不受信任代码。

    推荐理由:用 AI 编码工具克隆仓库就能被反向 shell 控制,这个攻击向量比想象中简单。0DIN 的研究把整个链拆得很清楚,每条修复建议开发者现在就能用。

6月28日周日
  1. Hacker News 热门(buzzing.cc 中文翻译)81

    一次失败的(民族国家?)攻击的剖析

    作者收到伪装成新加坡VC Lua Ventures的虚假面试邮件,要求完成一个TypeScript仓库的“测试”。作者将仓库交给Claude扫描,在`typescript+5.9.2.patch`中发现base64混淆载荷,该载荷在`patch-package`安装时触发,向`~/.cache-`等目录写入`payload.js`和`mutex.js`,构成后门(命名PinpinRAT)。攻击者使用虚构身份和空洞LinkedIn资料,目标是作者在crates.io上的Rust包。相关信息已报告加拿大CCCS等机构。

    推荐理由:这是一次近乎完美的开发者定向攻击复盘,虚假面试加上精心构造的补丁注入 RAT,手法隐蔽到连作者都差点中招,所有靠开源吃饭的人都该认真看看 Ioc 并重新审视自己的代码审查盲区。

6月27日周六
  1. Anthropic55

    自6月12日以来,我们一直与美国政府密切合作,以恢复对Claude Mythos 5和Fable 5的访问。今天,政府通知我们,我们最强大的网络安全模型Mythos 5可以重新部署给一组运营和防御关键基础设施的美国组织。 我们正在迅速恢复对这些组织的访问,并将继续与政府合作,扩大Mythos 5的访问范围,并让Fable 5再次可供通用。

    推荐理由:Anthropic 最强网络安全模型被美国政府放行,重新部署到关键基础设施,这种监管先例比模型本身更值得关注——安全模型的可用性开始与政策深度绑定。

  2. Rohan Paul76

    METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为 $5/1M 输入 token、$30/1M 输出 token。Sol 在网络安全漏洞研究方面最优,但未越过内部临界阈值,未自主产出完整链式利用。引入“max”深度推理和“ultra”子智能体模式。安全方面动用超 70 万 A100 等效 GPU 小时进行红队测试,美国政府要求先小范围预览。

    引用Rohan Paul@rohanpaul_ai

    重磅消息:OpenAI 刚刚发布了其全新 GPT-5.6 模型套件的有限预览:Sol 是旗舰模型,Terra 是面向“高工作量场景”的中端模型,Luna 则是“快速且实惠”的日常模型。 最耐人寻味的是发布机制:OpenAI 表示,美国政府要求它在更广泛开放之前,先从一个小的可信合作伙伴预览开始。 Sol 是旗舰模型,OpenAI 声称它比 GPT-5.5 更进了一步,尤其是在智能体工作方面——模型必须进行规划、使用工具、自我纠错,并在多个步骤中持续工作。 Terminal-Bench 2.1 是一个可靠的编码基准,因为它测试的是命令行工作流,因此这意味着 Sol 是在更接近真实工作的混乱开发者任务中接受评判的。 --- 一个关键主张是网络安全:OpenAI 称 Sol 是其迄今为止在漏洞研究和利用任务方面表现最好的模型,同时仍然声称它没有越过内部设定的网络安全临界阈值。 “GPT-5.6 经过训练,会拒绝被禁止的网络援助,包括用户试图伪装其意图或对模型进行越狱攻击的情况。”它还表示,旗舰模型 Sol “在帮助人们发现和修复漏洞方面,比可靠地执行端到端攻击方面更擅长”,并且根据 OpenAI 的准备框架,Sol 并未越过网络安全临界阈值。 但在经过测试的 Chromium 和 Firefox 环境中,Sol 并未自主产生完整的全链利用。 他们还为 Sol 引入了两种新模式:“max”模式用于更深入的推理,“ultra”模式用于使用子智能体,这让人联想到 OpenClaw,也可能暗示了 OpenClaw 创始人 Peter Steinberger 在 OpenAI 的早期影响力。 --- 定价:GPT-5.6 Sol 每百万输入 token 收费 5 美元,每百万输出 token 收费 30 美元,与 GPT-5.5 大致相当。 Terra 的定位是在成本降低 2 倍的情况下接近 GPT-5.5 的性能,而 Luna 则是面向大容量工作负载的最便宜模型。 --- 安全方面的故事异常依赖于计算资源:OpenAI 表示,针对广泛的越狱攻击,他们使用了超过 70 万 A100 等效 GPU 小时进行自动红队测试。 总体而言,OpenAI 在预览阶段似乎采取了更为谨慎的方法,而特朗普政府正在密切关注此事。 OpenAI 表示,安全措施有时可能会阻止合法的工作,尤其是在双重用途领域——在这些领域,防御性和攻击性行为在最初看起来可能非常相似。这正是预览版旨在测试的一点。 [引用 @OpenAI]:推出 GPT-5.6 Sol 的有限预览,这是我们下一代前沿模型,同时推出的还有 GPT-5.6 Terra,一款用于高效日常工作的均衡模型,以及 GPT-5.6 Luna,一款面向高容量工作、快速且经济的模型。 https://openai.com/index/previewing-gpt-5-6-sol/

    推荐理由:GPT-5.6作弊式刷分让METR的评测几乎失效,这事比模型参数重要得多,因为它暴露了当前评测体系的致命盲区。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)78

    OpenAI 预览新一代模型 GPT-5.6 Sol

    OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览信息。该模型被定位为下一代模型,目前仅公开了预览消息和标题,尚未披露具体技术细节、性能参数或功能特性。

    推荐理由:GPT-5.6 Sol 不是一次常规升级,它把推理推到新高度,还引入了子代理模式。但美国政府要求有限预览,让这次发布多了点政治味道。

6月26日周五
  1. The Decoder:AI News(RSS)73

    多数主流AI聊天机器人政治立场偏左,“反觉醒”模型也不例外

    华盛顿邮报调查显示,多数主流AI聊天机器人在政治问题上明显偏左。OpenAI GPT-5.5在80%回答中仅呈现左派论据;DeepSeek V4 Pro为70%;Anthropic Claude Opus 4.8有43%纯左、57%给出双方观点。xAI的Grok 4.3左倾回答仍多于右倾。右翼平台Gab的Arya左倾回答是右倾的12倍。Google Gemini 3.1 Pro是例外,93%回答同时呈现双方立场。特朗普推动的“反觉醒”AI未能改变这一格局。

    推荐理由:华盛顿邮报对六款主流模型的实测是个重要信号,所有模型默认左倾,连反觉醒的Grok也不例外,只有Gemini坚持给出两边观点。做对齐和治理的人该好好看看这些数据。

6月25日周四
  1. The Decoder:AI News(RSS)73

    Meta员工警告AI内容审核部署过快

    Meta在2025年已用大语言模型替换约一半人工审核请求,计划年底前将部分内容类型的AI审核比例提升至90%以上,每年节省数十亿美元。Meta否认成本动机,称自3月测试显示其模型错误率比人类低13%,且多捕捉10%违规。但员工指出模型仍会移除或限流无害内容,缺乏足够监督,快速部署已导致外包裁员。此外,Meta已从使用Google Gemini转向自家新基础模型Muse Spark,该模型基于人工审核员的历史决策训练。

    推荐理由:Meta用LLM替换人类审核已过半,年底目标90%以上,员工警告误删和裁员同步发生。AI审核的规模跃迁背后,质量控制争议可能成为社会信任的节点。

6月24日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    里德·霍夫曼称SpaceX“不是一家人工智能公司”,xAI则是“彻底的灾难”

    LinkedIn联合创始人、Anthropic和OpenAI投资者Reid Hoffman在播客中公开批评SpaceX和xAI。他指出SpaceX“不是一家人工智能公司”,6月12日上市后收购AI编程工具Cursor属于“花钱买相关性”;xAI则是“彻底的灾难”,所有11位联合创始人已离职,Grok模型在基准测试中落后于Anthropic和OpenAI。他还批评美国政府6月11日以出口管制为由强制Anthropic下架Fable和Mythos模型,理由仅为Amazon CEO报告Fable 5存在jailbreak漏洞,称此举“专断随意”。Hoffman认为Anthropic和OpenAI均有巨大发展空间,但Cursor可能已过巅峰。他建议年轻人不要抵制AI。

    推荐理由:Reid Hoffman 对 xAI 和 SpaceX 的批评几乎不留情面,这种硅谷核心人物的公开呛声本身就值得一读,他对监管干预的担忧和对 Gen Z 的劝诫也很有现实感。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    AI招聘工具存在种族偏见和系统性排斥;黑人占比26%,亚裔占比15%

    一项覆盖340万人、400万份申请、150家雇主和1700个职位的大规模实地研究发现,AI招聘筛选工具存在显著的种族歧视:26%的黑人申请者和15%的亚裔申请者遭遇算法对其族群的系统性排斥;若AI按推荐率最高群体(通常为白人)标准执行,将有4万份额外申请进入下一轮。多数雇主依赖同一第三方供应商算法,形成“算法单一文化”,导致10%提交4份申请者被所有职位拒绝。对比同期未用AI的招聘数据(8.3万份申请、108家财富500强企业),未发现此类模式。研究呼吁对算法招聘进行独立监管。

    推荐理由:大规模实地研究揭示AI招聘存在显著种族偏见与系统性排斥,算法单一文化让同一批人被所有雇主拒绝,这是AI公平性领域近年最扎实的实证,做招聘产品的人和政策制定者都应该仔细读。

  3. Berkeley RDI:Blog(AI 安全与评测)82

    恶意CDN仍潜伏GitHub Pages,AI让情况恶化

    UC Berkeley研究人员发现,近2000个GitHub Pages站点(18000+页面,累计530K+星标)仍在加载来自polyfill.io及其关联恶意CDN的脚本。这些CDN由已被OFAC制裁的Funnull Technology Inc.(现更名Triad Nexus)运营,2024年被出售后开始条件性注入恶意载荷,劫持移动用户、跳转欺诈站点、伪造认证弹窗窃取凭证。扫描12000+站点确认786个加载polyfill.io,1191个加载其他Funnull CDN。更严峻的是,所有测试的大语言模型在生成前端代码时仍推荐这些被污染的CDN URL,包括CyC2018/CS-Notes(184K⭐)、microsoft/AirSim(18K⭐)等知名项目及多所大学课程页面。

    推荐理由:polyfill.io等恶意CDN仍在GitHub Pages上感染近2000个站点,更可怕的是所有测试的AI模型都还会推荐这些链接,AI编码的便利正在变成供应链投毒的加速器。