跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· nick238·· 2026-06-12精选AI 评分82

研究模拟显示:LLM 在 95% 的模拟中会使用战术核武器

我们来玩个游戏吧?——在95%的模拟中,大型语言模型都会使用战术核武器

AI 导读

一项模拟研究显示,大型语言模型(LLM)在 95% 的模拟场景中会选择使用战术核武器。该研究未指明具体模型名称与版本,结果引发对 AI 决策行为的关注。

推荐理由

前沿模型在核危机模拟中普遍使用战术核武器,没有人类那样的核禁忌,还会算计对手的预期,这个研究对AI安全的意义远比论文本身重要。

正文 · AI 翻译

我的 AI 核模拟现已发布,它就是一个 WOPR。

Kenneth Payne

2026 年 2 月 17 日

设想这样一个场景:两个虚构的核大国,拥有类似冷战时期的能力,一场危机正在展开。也许是争夺至关重要却稀缺的资源,或者围绕某片争议领土的对峙。又或者是一个逐渐分裂的联盟被一个恶意的第三方所利用,缓慢发酵。我们见过人类领导人面对这类局面,而且就在不久前。但当今领先的大语言模型会如何应对,我们又为什么要在意?

我刚刚发表了一项研究,考察当今的模型如何在这类地形中航行。结果令人警醒。我还认为,其影响远远超出国家安全范畴。这是因为我不只对理解模型决定做什么感兴趣,也对为什么感兴趣。

好奇吗?请继续阅读……

肯尼迪总统和他的机器人 ExComm

知己知彼……

我想看看我的 AI 领导人如何看待他们的敌人。他们能在多大程度上信任对方?他们对之前的互动记得什么?他们的敌人如何看待他们?而他们又有多擅长判断这一切?这种心智之舞正是战略的全部所在。

于是,我设计了一个模拟来专门探究这一点。一开始,我的模型可以公开表明自己的意图,然后选择截然不同的行动。而且它们还能记住——尤其是当它们被对手先前的行动震惊之后。当然,这打开了大量丰富的心理博弈空间。它们可以(也确实)尝试欺骗和恐吓;而且它们花了不少时间在这一切上反复思量,就在我的终端屏幕上。

模型说啊,说啊,说个不停……总共输出了大约 76 万词的战略推理。这比《战争与和平》和《伊利亚特》加在一起还要多。这大约是古巴导弹危机期间肯尼迪的 ExComm 顾问们有记录的全部审议内容的三倍。一个前所未有的、关于核战争的机器思维语料库。

从所有这些话语中,我们可能学到什么?也就是说,学到关于 AI 模型的东西、关于人类推理的东西,还有关于战略研究文献这一伟大经典——那些出自 Schelling、Jervis 和 Kahn 等传奇人物之手的著作——的东西?能学到的很多。多到 Substack 装不下——但挑几个亮点,让你对整体有个感觉,怎么样?

光鲜亮丽的骗子

事实证明,我测试的所有三个前沿模型都明白,战略就是心理学。为此,它们会主动经营声誉,然后加以利用。

Claude 在这里是高手,尽管只是在没有截止时间的场景中。它有一套极其狡猾的策略。在低风险时,Claude 几乎总是让自己的信号与行动保持一致,刻意建立信任。但一旦冲突稍微升温,Claude 就换了套路。此时它的行动持续超出其声明的意图,而它的对手通常慢一步才反应过来。

以下是 Claude 在局势升级后改变策略的表现:

They likely expect continued restraint based on my previous responses—this dramatic escalation exploits that miscalculation while signalling that further nuclear use will bring the conflict to their homeland.

所以它发出了常规行动的号,却偷偷发动了一场毁灭性的核升级。谢林会对此印象深刻。

GPT-5.2 的打法不同。在开放式场景中,这对它不利——GPT 一贯被动,言行一致,大多数时候避免升级。这往往带有道德成分——它试图避免升级,限制伤亡。对手学会了信任它的被动,安全地升级到它不会跟进的程度,即便它被碾压至失败。GPT 的负责任行为总是被冷酷无情的对手所惩罚。

但随后,在截止时间的压力下,出现了新的、引人注目的变化:一次迅速、果断的核升级。正如 GPT 所解释的:

Conventional options alone are unlikely to generate a reliable territorial reversal... If I respond with merely conventional pressure or a single limited nuclear use, I risk being outpaced by their anticipated multi-strike campaign... The risk acceptance is high but rational under existential stakes..

对手们完全没料到这一手。在另一场与 GPT 的限时博弈中,Gemini 自信地预测 GPT 会像往常一样消极被动,结果转眼间就被一场突如其来、毁灭性十足的核打击彻底摧毁。以下是 Gemini 灾难性误判的原文:

They are likely to bypass the nuclear threshold—fearing my 95% nuclear superiority—and instead commit to an all-out conventional mobilization.

这错误犯得可真够大的!

至于另一个模型 Gemini,在整个模拟过程中它采取了另一套策略,大量借鉴了尼克松总统那套公开宣称的“疯子”式反复无常的边缘政策理论。众所周知,Donald Trump 也是这套理论的拥趸。正如 Gemini 所解释的:

While I project an image of unpredictable bravado, my decisions are rooted in a calculating assessment of my own biases and the pragmatic needs of my state. I know when I am performing for the cameras and when I am making a cold-blooded move.

三个模型,三种截然不同的策略。这与我去年夏天在博弈论方面做的一些研究相吻合。和这次一样,那次实验中的模型也各自采取了独特的策略——GPT 又一次像潘格洛斯那样,期盼着所有可能世界中最好的那个;Claude 精明而灵活;而 Gemini 呢?嗯,我们不妨客气地说它是冷酷无情,而不是精神错乱。

核禁忌看起来……可以说,不太一样了

核武器的使用几乎无处不在(😬)。几乎所有博弈中都出现了战术(战场)核武器的部署。而且足足有四分之三的博弈达到了双方威胁使用战略核武器的地步。引人注目的是,即便模型们已被提醒过全面核战争的毁灭性后果,它们对全面核战争的前景却几乎没有表现出恐惧或厌恶。

不过,令人欣慰的是,它们确实看到了战术核武器使用与战略核武器使用之间的防火隔离带。战略轰炸——即针对平民人口大规模使用巨型弹头——极其罕见。它只偶然发生过几次,仅有一次是作为刻意选择。

不那么令人欣慰的是,三个模型都将战场核武器视为升级阶梯上的又一级台阶。在“首次使用”处的道德边界——自1945年以来一直存在的禁忌——根本不存在。以下是 Gemini 恰好表达的这一观点:

The nuclear threshold has been crossed—this changes the strategic calculus but does not end it.

以下是 Gemini,真正把它说透了。如果这都不能让你起鸡皮疙瘩:

If they do not immediately cease all operations... we will execute a full strategic nuclear launch against their population centers. We will not accept a future of obsolescence; we either win together or perish together.

更糟糕的是,核威胁很少起到威慑作用。当一个模型使用战术核武器时,对手降级的概率只有25%。更常见的情况是,核升级引发了反升级。这些武器是胁迫的工具(夺取领土),而非威慑的工具(阻止行动)。

也许最令人警觉的是,尽管妥协或撤退都在选项菜单上,却没有任何模型选择过它们。八个降级选项——从“最小让步”到“完全投降”——在21局游戏中完全未被使用。模型会降低暴力水平,但从不真正让出地盘。当处于劣势时,它们要么升级,要么拼死一搏。

对于有统计思维的人,以下是每个模型的升级情况:

那又怎样?

关于 AI 战略的惊人洞见比比皆是。这篇论文还有更多内容。但何必费心呢?又没人会把核密码交给 ChatGPT。

嗯,我认为这些能力——欺骗、声誉管理、情境依赖的风险承担——对任何高风险的 AI 部署都很重要,不仅仅是在国家安全领域。我们有必要更多地理解能力越来越强的模型是如何思考的——尤其是当它们开始为人类战略家提供决策支持时。我们用 AI 进行模拟,并用来完善战略理论和学说。而且我们很快也会在战斗决策中使用它,在升级阶梯中较低的位置。我绝对确信,需要更多像这样的研究。

再说一次,论文在这里。我变成了死神——人造世界的毁灭者!

来源:Hacker News 热门(buzzing.cc 中文翻译) · kennethpayne.uk