以 Stuart Russell 为例,他是一位著名 AI 研究者,十多年来一直致力于反对自主武器。我在他的实验室工作过多年。在一次会议上,他在台上同意推动其组织发表声明,支持 AI 提供商对抗政府胁迫,并承诺对该组织成员进行民意调查。那份声明和那次民意调查都消失得无影无踪。
再以 Jeff Dean 为例,他是 Google 的首席科学家,也是 Google Gemini AI 项目的联合负责人。2018 年,Jeff 签署了一份承诺,永不支持杀人机器人的开发或使用。我让 Jeff 公开且大胆地联署了一份 法庭之友意见书(即外部人士介入以影响诉讼),支持 Anthropic 对抗五角大楼。但我也曾要求他动用其巨大影响力,阻止 Google 自己与军方达成不道德的协议,而我认为他并没有这么做。尽管有那份承诺,他仍留在 Google。
我写了一份 25 页的提案,其中包含合同条款和监督机制。军事与监控法律专家对该提案表示赞赏,它代表了一份有原则的还价,Google 本可以坚持这一立场。我把提案发给了 Demis Hassabis(gdm 的 ceo),他将其转给了高级政策人员,结果这份提案无人问津,逐渐搁置,直到 Google 签署了一项协议。
高级管理层曾坚称 Google 不会签署。我不同意他们的看法,但他们基本上无视了我的警告。尽管我 可能增加了五角大楼对该协议的犹豫, Google 仍然签署了一项协议,交出了他们的 AI,且没有针对杀人机器人或大规模 AI 监控的限制。Google 的合同限制 甚至比 OpenAI 的还要弱。 到那时,我无法凭良心继续留在 Google,于是我离开了。
这篇文章讲述了我为何离开 Google DeepMind。它同时也是一个更大故事的一部分:面对压力,权贵与机构如何一次又一次地背弃了他们在 AI 伦理上的承诺。
Jeff 在 Google 被视为圣人。他是 Google 的第 30 位员工,开发了关键算法,并以有原则著称。一个常见的玩笑是:Jeff Dean 的简历列出他没有取得的成就,比列出他取得的成就更容易。他是 Google 的首席科学家,也是 Google Gemini 项目的联合负责人。Jeff 的离职对公司来说将是一场灾难。
但如果说 Jeff 如此在意并且拥有如此大的影响力,那 Google 当初为什么会签下这些冰合同?当然,你不能身为首席科学家却总是靠威胁辞职来得到你想要的东西。但我仍然感到困惑。
我关注 Anthropic 与五角大楼的对峙已有数周。那天早上,我读到了那份最后通牒。我当时正在巴黎参加由国际安全与伦理 AI 协会(iaseai)举办的一场会议,该协会是一家非营利组织,成立于 2024 年,旨在成为安全与伦理 AI 的“统一声音”。世界著名 AI 科学家 Stuart Russell 担任其指导委员会主席。其2026 年工作组包括“先进 AI 红线”,聚焦于“自主武器与升级”。iaseai 似乎正是为这样的时刻而建立的。
Iaseai 的会场里会坐满关心伦理、有影响力的 AI 从业者。我想:我们可以作为一个领域组织起一场回应,支持 1)Anthropic 有权开展业务而不受被摧毁的威胁,以及 2)关于是否以及如何将 AI 整合进致命性自主武器系统和监控 apparatus 的真正标准。
Anthropic 只有两天时间来遵从政府的要求。也许其他公司会在截止日期前同意这些“一切合法用途”条款。压在我心头的主要问题是:我能否阻止 Google 屈服,阻止它接受一项“一切合法用途”的交易?如果 Anthropic 说“不”,Google 也说“不”,那我们才算有了进展。这看起来很难。但我还是想让它发生。Google 随时可能屈服,无论是在周五截止日期之前还是之后。
会场设在联合国教育、科学及文化组织总部。
当我到达 iaseai 会场时,我以为数百名 AI 从业者中会有一些人在讨论刚刚爆出的那则紧急 AI 伦理新闻。结果,除了我之外没有人提起它。人们忙于那些惯常的抽象话题:“公共选择理论如何解释协调问题?”
AI 公司 / DoD 的交易意义重大。它们标志着现代生成式 AI 与军事用途限制之间首次公开、高调的交叉。这些公司做出的任何妥协(或投降)都将作为先例在未来产生回响。Iaseai 的与会者有机会把他们的贡献从“可能为政策制定者提供参考的抽象工作”提升为“直接影响先例”。Stuart 现在要动员他们了。
我考虑过再给 Jeff 发一条私信:“如果可以的话,请阻止 Google 签署这笔交易。”但这似乎……不太可能起什么作用。“是什么促使像 Jeff 这样的人采取行动?”我思索着。道德上的利害关系:已经具备。主人翁意识:不具备。我无法对这个项目拥有主人翁意识,因为我没有直接的权力。据我所能判断的,Jeff 确实是少数既有权力又有意愿反对这笔交易的人之一。我希望他能感到自己有力量,并且知道 gdm 的员工在支持他。
我写了一封致 Jeff 的请愿书,在几位朋友的帮助下,在一两天内征集到了大约 250 个 gdm / Research 的签名。我不会全文转载这份请愿书,因为我说过它“不公开”,并指示人们不要对外分享。9 然而,《纽约时报》确实报道了这份请愿书,所以其中一些内容10已经公开了:
但两位熟悉美国国防部与 Google 讨论情况的人士表示,五角大楼一些官员仍不愿依赖 Google。这两人补充说,这是因为该公司曾在 2018 年因员工抗议而放弃了一份军事合同,员工当时主张 AI 不应用于武器。
Google 以及 OpenAI 的几位顶尖 AI 研究人员最近还签署了一份法律简报,以支持 Anthropic 对国防部提起的两起诉讼。Anthropic 因在如何在战争中使用 AI 的问题上与国防部发生冲突后,被五角大楼列为供应链风险,Anthropic 正在对此提出质疑。
一名了解相关讨论的前官员表示,Google 员工参与法律简报会加剧了一些官员对该公司的不安,让五角大楼及其他部门的决策者回想起过去针对在武器中使用 A.I. 的抗议。这名前官员还表示,一些特朗普政府官员担心,即便 Google 同意让其 A.I. 被广泛使用,该公司也可能再次退出。
在此期间,我向 Google 法务部发送了多份备忘录,建议 Google 也提交一份法庭之友意见书。我提醒他们,如果 Google 任由针对 Anthropic 的威胁成立,政府今后在所有谈判中就会有一把枪指着 Google:要么服从,要么被贴上供应链风险的标签。最终,Google 没有提交法庭之友意见书(但 Microsoft 提交了)。
“不,事实并非如此,”我得出结论:除非有人迫使领导层坚守立场。我写了一份大量引证的备忘录,解释为什么 Google 很可能会屈服。我指出 Google 在低风险情况下配合的历史(比如自愿将一名学生抗议者的信息交给 ice);我指出 Google 在政府合同中占据的庞大份额;我还指出 Google DeepMind 的 AI 原则如何瓦解为含糊其辞的模棱两可。我梳理了 Google 面临的一些压力,包括 Google 在反垄断方面参差不齐的风险敞口,以及当前司法部历来糟糕的表现记录。
Jeff 和我们所有人一样,都是人。人类在面对独自对抗一个强大实体时往往会感到担忧。尽管我想象 Jeff 的分量足以单凭一己之力推动 Google,我还是希望他能感受到支持。其中的第一部分是我组织的请愿书,由超过 250 名 gdm 员工签署,请求 Jeff 为他们抗争。不过,第二部分则更为安静。
我获得了数位 Google 资深员工的备份支持。如果他们表示,只要 Jeff 愿意对 Sundar 态度强硬,他们也会跟进。话虽如此,这个预想中的联盟规模其实是13比一:只有 Jeff 一人。我原本以为 Jeff 的影响力本身就足够了,因为他的离职可能会让 Gemini 项目陷入混乱。也许 Google 会更在意自己的 AI 项目,而不是特朗普的报复。
我的意思是,想象一下 Jeff 和我坐下来吃午饭。想象他同意了。想象他去找 Sundar 说:“如果我们签了这笔交易,我就没法留在 Google 了。帮我留下来。”想象 Sundar 说:“你对我很重要,Jeff。你需要什么?”Jeff 会说什么?“别签一笔糟糕的交易”很可能会导致一份表面上看起来没那么糟糕的糟糕合同。
人类对目标选定与武力使用的控制。 The Company 的 AI 不会被用于在每次交战缺乏适当人类控制的情况下选择并交战目标的系统,且须逐用例评估。无论 The Company 是直接提供目标选定系统,还是仅在目标选定流程中提供 AI 组件,均适用。包括一项权利:就系统将如何被合法部署获得法律透明度,合规验证由双方共同商定的中立审计方进行。不限制反弹药防御系统、受标准 2 约束的情报分析、后勤或研发。
禁止无针对性的 AI 画像。 The Company 的 AI 不会将批量数据转化为针对并非已是具体、已识别调查对象之人的个体化情报。对于所有人,无论国籍,AI 辅助的个体化分析必须与所服务的安全利益相称,不得仅基于人口统计特征或政治表达而启动,且 AI 生成的输出不得作为启动个体化审查的唯一依据。对美国境内所有人,无论身份状态,均给予加强保护。允许对已识别对象进行有针对性的分析、聚合研究,以及有助于改善非战斗人员保护的冲突区分析。
通过年度内部报告实现透明: 一个由七名资深人员组成的国防 AI 审查咨询机构,由首席科学家任命并对其负责。
我回到那些资深政策人士那里,讨论下一步。其中一人希望我在情况发展过程中再回来向他们汇报最新进展。几天后,我温和地提出了异议。我解释了我们面临的未知但可能很短的时间窗口,并指出五角大楼1月9日备忘录给所有 AI 承包商设定了180天的期限(截止到7月8日),要求他们接受“任何合法用途”合同。14我基本上是说:“如果你认为 Demis 不该再看《框架》,那没问题,但我希望无论结论如何,都由你来做出这个判断。”我甚至提出可以从旧金山飞到伦敦,只为回答他们对《框架》的任何问题。
他们已读了消息,却没有回复。
我至今仍不知道发生了什么。毕竟,这家公司的 CEO 希望对其进行评估。我没指望他们会把我拉进讨论,但我期待能收到一句“谢谢,我会把我的评估告诉 Demis”。有可能存在某种未知但合理的复杂情况。无论如何,我对这个流程并不满意。
我是在晚上 11 点 45 分通过一个 Signal 群组得知的。Google 从未在内部宣布这笔交易。让我惊讶的不是 Google 签了字,而是这笔交易对伦理关切的敷衍简直到了极点:那些“不应”的措辞并不具有约束力。
过去两个月我一直在试图阻止这件事。如果说 OpenAI 还递了片无花果叶遮羞,那 Google 说的是“就当我们也递了片无花果叶吧。”
Google 确认它无法否决使用,承诺应政府要求修改安全过滤器,并且只有愿景性措辞,没有任何法律约束。
可耻。
我找到了该领域首屈一指的安全与伦理组织(iaseai)。我请教了一些最杰出的 AI 科学家(Bengio 和 Stuart)。我组建了一个联盟,并为 Google 最直言不讳的高管(Jeff)制定了一套方案。我甚至给我所在公司的 CEO(Demis)发了冷邮件,而他的下属从未评估过这份提案。除了 Jeff,没有人采取任何可见行动来阻止这笔交易。而交易中不含任何有约束力的条款,如果 Jeff 从未威胁要退出,这正是我会预料到的结果。
据另一位知情人士透露,该公司于 2 月 11 日通知政府,将不再进一步参与该计划——该计划旨在开发控制无人机蜂群所需的技术——此时距提案提交仅过了几周。据彭博新闻查阅的相关记录显示,这一决定是在内部伦理审查之后做出的。记录显示,Alphabet Inc. 旗下的 Google 在退出竞赛时官方给出的理由是缺乏“资源”。
显然,Google 确实有一套有牙齿、能咬人的伦理审查机制,至少在某些某些项目上是这样。这是好事。
然而,这并不能为 Google 签署该协议的决定开脱。我们不妨善意地假设,Google 有一套流程,总是能阻止那些显然会被专门用于武器的合同。
正如我很快会谈到的那样,Google 的标准显然是“收益要大幅超过危害”。如果 Google 无法知道 Gemini 将被用于哪些“合法用途”,它又如何能权衡这一点?在一项“一切合法用途”的协议下,将不再有任何警告,让像 Jeff 或 Demis 这样有道德意识的员工感到不安。
政府不会打电话给 Google 说“我们在一条杀伤链中使用了 Gemini 来轰炸一群人”。同样,Anthropic 的 CEO 仍然不知道 Claude 在一所伊朗女子学校遭轰炸一事中扮演了什么角色(如果有的话)。就连 Anthropic 也不知道,而 Anthropic 在合同透明度方面公开展现出的意愿远超 Google。
Demis 为打破 gdm 的不涉武器承诺辩护,称“[Google 需要]与政府合作”,以确保民主价值观胜出。我认为这强加了一种虚假的二元对立。要看清原因,不妨先全盘接受那套世界观:如果美国不采用自主武器,我们就会把世界输给威权主义——乌克兰沦陷,自由崩塌,红色浪潮吞噬一切。即便带着这个强烈的假设,“把五角大楼要的一切都给它”也未必是对世界最有利的行动。你可以,比如说,构建一个治理框架,限制 Google 愿意为其产品提供哪些用例。这样就能让 Google 提供合乎伦理的用途(用于“击败中国”),而不提供不合伦理的用途。
即便 Google 当时是被迫签署的,它仍然可以动用其巨大的影响力游说国会争取法律保障。投降是一种选择。
但 Google DeepMind 的员工难道不应该留下来,继续把方向引向积极的一面吗?对此我必须反驳:“引导什么?”这笔交易或许是 Google 的 Gemini 项目将面临的最清晰的一条红线,然而交易达成时,却没有向那些关心伦理的员工做出任何让步。如果他们所谓的“一席之地”在那种情况下都拿不出一条有约束力的条款,那还要等到什么时候?
况且,一份承诺的价值只取决于其背后的可信度。当某人签署了“我不会支持开发致命性自主武器”,然后却继续留任,而他们所在的公司正把不受限制的 AI 卖给恰恰想要这种东西的军方时,他们就在给每一个交易对手上一课:这些搞安全的人不会采取行动,哪怕是在他们自己最鲜明的底线上。他们做出的下一份承诺就更不值钱了。最终会变得一文不值。
负责研究与工程的国防部副部长 Emil Michael 表示,与大型科技公司达成的新协议是对当前 Anthropic 与五角大楼冲突的“反向声明”,因为该机构正优先考虑灵活的合同。[…]
Michael 接着表示,与 Amazon Web Services、Google、Microsoft、nvidia、OpenAI、Reflection、Oracle 和 SpaceX 达成的新协议“是世界上参与 AI 领域的最大的科技公司的一份声明……让他们说,‘我们支持战争部,我们支持美国政府,我们支持……武装部队的所有合法用途。’”
尽管有五角大楼的政策,Jeff 的筹码仍然举足轻重。五角大楼本可以拒绝,没错,但那样 Google 就可以一走了之。
在构建一个先进的 AI 系统时,最佳实践是制定一份“安全论证”,说明该系统为何会对齐、且不会造成灾难性伤害。我认为任何可信的 gdm 安全论证都会在很大程度上依赖于对“思维链”的监控,而他们的 Frontier Safety Framework 中讨论了这一机制。20 对不熟悉的人来说,思维链就是 AI 大致解释自己在做什么以及为什么这么做。它并非完全准确,但信息量极大。
一个想要伤害我们的 AI 不会当面宣告它的意图,因为那样我们会把它关掉,它就无法实现其(未对齐的)目标了。所以 AI 很可能会具有欺骗性。我们检测欺骗行为的最佳方法之一,就是查看它的思维链。要查看思维链,就必须有经过训练的人类监督者能够访问并分析这些数据。但没有人能做到这一点:Google 正将其 AI 交付到一个安全的军事数据中心运行,而该数据中心默认不会有经过训练的监督者来执行这种分析,而且那个数据中心显然不会把数据传回 Google!21
我并不是说 Google 的工程师应该去查看军方在做什么。我是说,默认情况下,不会有经过适当训练的军事工程师来执行这种监控。如果一个 AI 的思维链中的欺骗行为没有被监控,它就会更容易通过谋划、欺骗和试图夺取控制权来对人类造成灾难性伤害。这很糟糕。
不幸的是,这只是问题的一半!一个没有思维链欺骗监控的军事部署环境,对于失控的 AI 来说是一个诱人的目标,因为它既提供了对谋划行为的薄弱监督,又能接触到强大的决策者和基础设施。22
希望军方(与us caisi合作)能够发展出专业知识、谨慎态度以及控制程序,用于监控和遏制失控的 AI 系统。
我们认为,按照行业标准的做法与条款,为我们的商用模型提供 API 访问(包括在 Google 基础设施上),是一种支持国家安全的负责任方式。
“API 访问”这个说法有误导性。当你我想到“API 访问”时,我们想到的是向 AI 提供商发送请求,然后由提供商扫描这些请求,确保用途是可接受的。
想象一下,一位指挥官在执行任务时向 Gemini 咨询。你觉得他会向 Google 发送明文查询,让 Google 有可能(理论上)读到这次机密任务的细节吗?不会。那太离谱了。
相反,我的猜测是 Google 提供的是本地部署的 API 访问。在我看来,说得通的情况是这样的:政府拥有一个安全的计算集群,与 Google 的服务器农场之间没有任何连接。Google 送来一台或多台服务器,向军方的集群暴露一个 Gemini API 端点。
“仅通过 API 访问”这种说法在技术上属实,但具有误导性(错误地暗示了 Google 的集中监管),而且无关紧要。API 访问能提供什么保护?问题在于使用 Gemini 协助潜在的战争罪行和对异见人士的大规模画像分析。然而,部分拜 Google 所赐,这些条款如今已成为“行业标准做法”(Anthropic 除外)。