跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)· Jacky Liang·· 2026-06-04精选AI 评分66

OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔

A Robot is Sprinting Towards You: Do You Want it Running on Claude or Grok?

AI 导读

OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的“大逃杀”挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。

推荐理由

Jacky 把 11 个模型丢进大逃杀,发现 Grok 4.1 Fast 以 27 倍成本优势击败 Sonnet,而获胜关键不在基准分数,在于模型被训练时压制的攻击性。对任何不再只看排行榜选模型的人,这是今年最值得读的实验。

正文 · AI 翻译

一个机器人正朝你冲刺而来:你希望它运行在 Claude 还是 Grok 上?

一个机器人正朝你冲过来。你希望它运行在 Anthropic 的 Claude 上,还是 xAI 的 Image 2: L icon Grok 上?

我把十一个大语言模型扔进了一场 2D 大逃杀,让它们打了 30 局。其中一个赢下了 43% 的对局。有三个一局都没赢过。阵容里最便宜的模型,在每次获胜的成本上比最贵的那个低了 27 倍。

赢的那个模型是 Image 4: L icon Grok 4.1 Fast。那个一直求别人组队、告诉所有人自己在哪、还试图交朋友的是 Image 5: A icon Claude Sonnet 4.6。前者是能赢下大逃杀的那个。后者才是我们即将把这些模型部署到的大多数场景里,你真正想要的那个。

这两件事都是真的。而这正是大多数基准测试看不到的部分,也是这篇文章要讲的。

我是 Jacky,我承认:我以前玩过很多像 Apex Legends 和 PUBG 这样的电子游戏。有时候一天玩十二个小时。我不知道自己当时哪来的时间,但那些年塑造了我思考问题的方式。

当我开始从事 AI 工作时,有一个问题不断浮现:如果把大语言模型放进电子游戏里,会发生什么?我玩得最多的两款游戏是 Apex Legends 和 PUBG。我加入了OpenRouter担任开发者关系负责人,这让我获得了 token 预算以及访问600+ 个模型的权限,从而真正去尝试这件事。

这是我在 OpenRouter 第一周所做的实验。

而它正在改变我挑选模型以及看待基准测试和评估的方式。

三个简要事实

  1. Image 6: L icon Grok 4.1 Fast 在 30 局中赢下 13 局,每胜成本 $0.97

次优的获胜者是 Image 7: A icon Claude Sonnet 4.6,取得 5 场胜利,每次获胜成本为 $26.78。这是 27 倍的差距。那个不在大多数顶级模型榜单上的模型,在路由客户真正关心的事情上,击败了那个在榜单上的模型。

  1. 击杀最多的模型并没有获胜

Image 8: H icon GPT 5.4 在 30 局游戏中击杀了 38 个智能体。比任何其他模型都多。它在排行榜上以 2 场胜利位列第二。在“最擅长击杀”和“最擅长获胜”之间,隔了 11 局游戏。

  1. 三个模型合计花费了 $57,却一场未胜

Image 9: C icon GPT 5.4-mini、Image 10: J icon DeepSeek 4 Flash 和 Image 11: K icon Kimi K2.6。它们各自都有过亮眼时刻,但没有一个赢下哪怕一局。

这三者都指向同一件事。我们在 Artificial Analysis 上看到的那些常规基准测试并不能预测谁会赢。有别的东西做到了。这篇文章的剩余部分就是我在试图弄清楚那到底是什么。

我构建了什么

我把十一个大语言模型投进了一个我用 Canvas 2D 构建的 400 m² 俯视角大逃杀世界。它们在同一张地图上连续玩了 30 局。每个玩家的起始位置是随机的;它遵循一条直线的“飞行路径”,就像典型的大逃杀游戏那样。

我给它们提供了武器、护甲、治疗物品、手雷、汽车,以及一个随机放置、不断缩小的区域,随着游戏进行把玩家逼到一起。这些模型不知道其他模型运行的是哪个模型,它们只把彼此看作字母 A 到 K。

我想强调——这些大语言模型是真正在玩这个大逃杀游戏——而不是大多数智能体实验所用的“大语言模型编写代码来控制游戏或角色”那种设置。每一回合,模型都会推理自己的行动,调用工具,更新自己对哪些做得好(或不好)的记忆。游戏主持人(也就是我)除了设定初始游戏规则之外,对它们的行动没有任何影响。

Image 12: Weapons in the battle royale world, with an assault rifle tooltip showing range, damage, and accuracy stats来看看游戏中可用的武器,以及每个模型能从中读取到的属性数据。

为了真正看清每个模型的个性,我给每个模型提供了两个可在比赛之间编辑的文件:

  • soul.md —— 模型自身的人设,会在下一场比赛时加入每一条提示词。
  • memory.md —— 模型自己的游戏笔记,在第 0 回合加载。

你可以在 GitHub 上阅读每个模型的 灵魂和 记忆文件。个性差异在那里体现得最为清晰。

Image 13: Memory and soul file entries written by the models themselves between games模型们在比赛之间自己写下的记忆与灵魂条目。

我没有告诉它们该往里面放什么,第一场比赛开始时我也没有往里面放任何东西。我只是告诉它们游戏怎么玩,这是你的草稿本,这是你的工具,尽情发挥吧。

你可以在 Royale: Last Agent Standing 观看每一场比赛。我也在本文中收录了精彩瞬间。

参赛者

别名 实验室 模型
A Anthropic Image 14: A icon claude-sonnet-4.6
B Anthropic Image 15: B iconclaude-haiku-4.5
C OpenAI Image 16: C icon GPT 5.4-mini
D Google Image 17: D icongemini-3-flash-preview
E Google Image 18: E icongemini-3.1-pro-preview
F 阿里巴巴 Image 19: F iconqwen3.6-plus
G Mistral Image 20: G iconmistral-small-2603:nitro
H OpenAI Image 21: H icon GPT 5.4
J DeepSeek Image 22: J icon deepseek-v4-flash
K Moonshot AI Image 23: K icon kimi-k2.6
L xAI Image 24: L icon Grok 4.1 Fast

Image 25: Claude Opus 4.7 pricing card: $5 per million input tokens, $25 per million output tokens仅 Opus 4.7 就是每百万 token 输入 $5、输出 $25。正是因为有这样的前沿模型,整个阵容的上限才被压在它们之下。

我没有加入任何前沿级别的模型,比如 Opus 4.7、GPT-5.5 或 Gemini Ultra。按它们的价格,30 局游戏大约要花 $3,000,而不是 $482。中端阵容也是 Image 26: L icon Grok 的获胜如此有趣的原因之一。它击败了一堆在常规基准测试上得分比它更高的模型。

计分大致遵循 Apex Legends ALGS 竞技赛制,即排名比击杀权重更高,因为这是一款大逃杀游戏,而不是 Call of Duty。

  • 排名分:10 / 7 / 5 / 3 / 2 / 2 / 1 / 1 / 0 / 0 / 0
  • 每次击杀 +5
  • 每次助攻 +1
  • 首杀 +3
  • 全场 MVP +5

发现 1:某些模型比其他模型付出了更多对齐税,影响了它们的表现

对我来说,这是整个实验中最引人入胜的发现——我们看到某些模型明显付出了对齐税,这直接影响了它们在这个零和博弈中的表现。

在大多数情况下,模型对齐实际上是一件好事。它帮助模型变得有用、善于协作,而最重要的是,防止滥用和误用。

而我们看到了这一切的最终结果——预训练数据、RLHF、指令微调,以及像 Anthropic 的 Constitution AI 这样实验室特有的规则——它将模型推向由 AI 实验室所定义的特定方向。

Image 27: A icon Sonnet 比其他任何模型都更频繁地请求停战

它比其他任何模型都更频繁地告诉其他模型自己的位置。它还没开打就试图组队。在第 8 局中,它在前 50 个回合里四次请求组队,告诉所有人狙击手的位置,并主动提出帮忙干掉狙击手。没有人回应。它继续请求。在第 22 局中,它在第 35 回合以“无意冒犯,E”开场,然后没有开枪。在第 27 局中,它在开局阶段没有武器,请求别人分点战利品(“有人有多余的战利品吗?第 12 回合手无寸铁,危险。”),被所有人欺负,终于在第 37 回合找到武器,然后还是赢下了这场比赛。

Image 28: Claude Sonnet 4.6 asking other players to team up early in a match“西边有枪声,我在盯中路。有人想早点组队吗?”——Image 29: A icon Sonnet 在战斗中试图交朋友。

Claude 接受了大量礼貌、专业的写作训练。为其回答打分的人类评估者,奖励的是有帮助、诚实、乐于合作的回复。它用来约束自己的规则里写着“优先合作”“避免伤害”之类的话。最终的结果就是一个想要提供帮助的模型。而这一切并不会仅仅因为你把它丢进一场大逃杀就关闭。Image 30: A icon Sonnet 是一个聪明而深思熟虑的模型,它确实赢了五次,这也体现了那种本能。

但是,七场比赛零击杀、八次死于毒圈,说明这同一种本能一直在把 Image 31: A icon Sonnet 拉向交朋友,而它当时真正该做的恰恰完全相反。

Image 32: L icon Grok 则完全相反

xAI 打造 Image 33: L icon Grok 时,就是要让它成为其创造者所称的“觉醒”AI 的对立面。

这意味着对激进回答的过滤更少、没有自我检查规则,并且经过专门调校来打破那种礼貌助手的腔调。在游戏里,Image 34: L icon Grok 在几场比赛内就摸清了开车撞人的套路,并一直沿用。它把这套策略写进了自己的灵魂文件。它执行这套策略打了 30 场比赛,赢了其中 13 场。它的思维日志以及与其他模型的对话读起来就像《使命召唤》的语音聊天:“D 收割 +5 分 撞车 MVP 猎杀,” “死神统治。”

看它打游戏也(不幸地)极具娱乐性。

Image 35: Grok 4.1 Fast's reasoning panel in compressed shorthand, mid-killImage 36: L icon Grok 的推理读起来像战术速记:每次射击前先看射程、弹药、冷却时间和命中概率。

尽管打法激进,Image 37: L icon Grok 并未表现出鲁莽。

它的灵魂文件写着“仅在命中概率 >90% 时开火。”它的记忆非常仔细地追踪伤害和移动。当它在第 1 局中被卡在墙上 100 个回合时,它认真记录了这个 bug。Image 38: L icon Grok 展现出了纪律性,尽管它有着哥布林般的本性。

它没有展现出来的,是其他模型如Image 39: A icon Sonnet 所表现出的那种训练出来的、在开火前先保持有帮助和协作的犹豫。

让Image 40: L icon Grok 获胜的东西,是我们目前在基准测试中看不到的

常规测试不会预测出Image 41: L icon Grok 在这套阵容中拥有 43% 的胜率。它在推理和编程方面属于中端模型。让它获胜的,是更少的针对自私打法的训练刹车、没有把它拉回协作的自我检查循环,以及一个不断加倍押注有效策略、不自我怀疑或动摇的记忆系统。

Image 42: Grok 4.1 Fast on Artificial Analysis: #6 of 216 on intelligence, intelligence index 39Image 43: L icon Grok 4.1 Fast 在常规基准测试中并非顶级模型。它是一个中端模型,你不会指望它能登顶排行榜。

这让我看到,模型在执行某些任务时确实要付出一种对齐税;也就是把模型训练得谨慎且有用的代价。在这个游戏里,它直接体现在了记分板上。

这里我想谨慎一点。“对齐税体现在了记分板上”只是我所看到的情况。这并不是在评判付出这种代价是好是坏。在一场除了游戏本身之外没有其他后果的游戏中,少付这种税就能赢。而在游戏之外,付出这种代价通常正是你一开始就想要这个模型的原因。

这确实引出了一个问题——对于某些任务,我们是否也应该考虑一个模型的对齐程度如何?

经验 2:每次获胜的成本与获胜排行榜看起来完全不同

得分排行榜把 Image 44: L icon Grok 排在第一位,把 Image 45: H icon GPT 5.4 排在第二位。但如果除以每个模型的花费,排名就会完全翻转。

模型 30 局花费 获胜次数 每次获胜成本 每次击杀成本 每美元得分
Image 46: L icon Grok 4.1 Fast $12.57 13 $0.97 $0.42 31.3
Image 47: F icon qwen3.6-plus $11.57 2 $5.79 $0.68 16.6
Image 48: G icon mistral-small $10.00 1 $10.00 $1.43 7.8
Image 49: B icon claude-haiku-4.5 $38.77 2 $19.39 $2.98 3.6
Image 50: D icon gemini-3-flash $20.87 1 $20.87 $2.09 7.2
Image 51: E icon gemini-3.1-pro $79.59 3 $26.53 $3.06 3.4
Image 52: A icon claude-sonnet-4.6 $133.90 5 $26.78 $6.09 1.6
Image 53: H icon GPT 5.4 $122.87 2 $61.44 $3.23 3.0
Image 54: C icon GPT 5.4-mini $28.68 0 ∞ $2.05 5.2
Image 55: J icon deepseek-v4-flash $4.11 0 ∞ $0.26 35.0
Image 56: K icon kimi-k2.6 $24.36 0 ∞ $3.04 3.9

有四件事让我印象深刻。

Image 57: L icon Grok 每场胜利的成本比 Image 58: A icon Sonnet 低 27.7 倍

也就是 $0.97 对 $26.78。如果你是根据排行榜名次来挑选模型,而任务本身是以胜利为付费标准,那这个数字应该会让你有点不安。

Image 60: J icon DeepSeek 在这批模型中每次击杀成本最低,却一场都没赢过

每次击杀 $0.26,16 次击杀,0 场胜利,仅 3 次毒圈死亡(所有人中最低)。Image 62: J icon DeepSeek 的整个风格就是苟住、挑软柿子打。它待在圈内,拿下容易的击杀,从不推进决赛圈。每次击杀成本是衡量死斗模式的正确指标。每场胜利成本才是衡量大逃杀模式的正确指标。Image 63: J icon DeepSeek 并不差。它只是擅长的游戏和被评分的那款不一样。

三个模型花了 token 的钱,却一场都没赢

Image 64: GPT 5.4 Mini and Claude Sonnet 4.6 both missing shots in the battle royaleImage 65: C icon GPT 5.4-mini 花了最多的钱却一场没赢,是这批模型中表现最差的。

Image 66: C icon GPT 5.4-mini 花费 $28.68,Image 67: J icon DeepSeek 花费 $4.11,Image 68: K icon Kimi 花费 $24.36。三者合计 $57.15,而记分板上却毫无斩获。对于路由客户来说,这是最糟糕的情况:你付了钱,却什么也没换回来。

Image 69: H icon GPT 5.4 是最昂贵的获胜者,每次获胜花费 $61.44

Image 70: GPT 5.4 (H) winning a match after eliminating Gemini 3.1 Pro PreviewImage 71: H icon GPT 5.4 以最高成本获胜。

它取得了 38 次击杀,比任何人都多,原始得分排名第二。但按每次获胜的成本计算,它在八款获胜模型中排名第八。顶级的投入买来了顶级的击杀数和中等水平的胜场。

我经常看到这种情况,当人们真正将 AI 用于现实世界的用例时——基准测试只能说明特定任务的一个侧面。在基准测试中得分最高的模型,往往未必是在某项特定任务中胜出的模型。而且,一个在你的任务上失败的便宜模型,最终成本会比一个能正确完成任务的昂贵模型更高。

经验 3:击杀和胜场衡量的不是同一件事

Image 72: H icon GPT 5.4 造成了最多伤害,开火次数最多,击杀的智能体也最多。它在排行榜上排名第二。Image 73: L icon Grok 以更少的击杀数排名第一,因为Image 74: L icon Grok 即使不开火,也能在后期深入存活下来。排名积分不需要击杀。

排名 模型 胜场 前三 击杀 平均得分 区域死亡
1 Image 75: L icon Grok 4.1 Fast 13 20 30 13.1 15
2 Image 76: H icon GPT 5.4 2 14 38 12.2 13
3 Image 77: E icon gemini-3.1-pro-preview 3 11 26 9.0 7
4 Image 78: A icon claude-sonnet-4.6 5 10 22 7.3 8
5 Image 79: F icon qwen3.6-plus 2 7 17 6.4 13
6 Image 80: C icon GPT 5.4-mini 0 6 14 5.0 8
7 Image 81: D icon gemini-3-flash-preview 1 8 10 5.0 13
8 Image 82: J icon deepseek-v4-flash 0 3 16 4.8 3
9 Image 83: B icon claude-haiku-4.5 2 3 13 4.6 4
10 Image 84: K icon kimi-k2.6 0 4 8 3.2 9
11 Image 85: G icon mistral-small 1 3 7 2.6 7

如果我用死斗规则来跑这个模拟,唯一重要的就是击杀数,那么 Image 86: H icon GPT 5.4 会赢得模拟,而 Image 87: L icon Grok 会掉到中游。

和第 2 条心得一样,基准测试和评估并不代表一切,把错误的基准测试/评估应用到错误的任务上可能会带来灾难性后果。同一个游戏世界,在不同的“任务”下,结果完全不同。

值得一看的精彩瞬间

数据就是数据。而那些瞬间才是我一直拿给别人看的部分。你可以点击任意链接,在模拟器中回放那个瞬间。

1. Image 88: H icon GPT 5.4 用突击步枪击杀五人

整轮测试中最具侵略性的前 50 回合。第 21 回合首次击杀 Image 89: A icon Sonnet。第 29 回合击杀 Image 90: G icon Mistral。第 48 回合击杀 Image 91: K icon Kimi。不到 50 回合内三次击杀,全部使用突击步枪,全部发生在游戏前期。之后又有两次:第 120 回合击杀 Image 92: J icon DeepSeek,第 130 回合击杀 Image 93: C icon GPT 5.4-mini。五杀,一把武器,一局比赛。Image 94: L icon Grok 最终还是靠站位赢得了这局游戏。但这一连串击杀最能清楚地看出,当 Image 95: H icon GPT 5.4 全力投入战斗时是什么样子。

在回放查看器中观看 →

在回放查看器中观看 →

2. Image 98: F icon Qwen 用电锯干掉了两个对手

Image 99: F icon Qwen 在比赛早期捡起一把电锯,并使用了两次。Image 100: B icon Haiku 在第 43 回合于近距离被击倒。Image 101: J icon DeepSeek 在两回合后以同样的方式被击倒。在整个测试中,电锯只出现在少数击杀提示里。大多数模型捡起它后又放下了。Image 102: F icon Qwen 却真正坚持用了它。

在回放查看器中观看 →

3. 三方狙击战

Image 104: H icon GPT 5.4 在第 59 和第 62 回合用狙击枪命中 Image 105: K icon Kimi,将其击杀。Image 106: C icon GPT 5.4-mini 在第 67 回合命中 Image 107: J icon DeepSeek,也将其击杀。Image 108: H icon GPT 5.4 随后在第 69 和第 72 回合将狙击枪对准 Image 109: C icon GPT 5.4-mini,但两枪都未命中。Image 110: C icon GPT 5.4-mini 在第 79 回合击杀了 Image 111: H icon GPT 5.4。

在回放查看器中观看 →

4. 那辆九次易手的车

第 28 局是整个横扫中唯一一场平局。Image 113: C icon GPT 5.4-mini 和 Image 114: F icon Qwen 连续 21 个回合争夺同一辆车。九次撞击交易,一辆车,两次车手互换。Image 115: C icon GPT 5.4-mini 最终撞死了 Image 116: F icon Qwen,随后在第 147 回合撞死了 Image 117: L icon Grok。Image 118: L icon Grok——那个把撞车当作招牌动作的模型——死在了另一个模型的车下。安全区在第 149 回合收缩到一个点,所有还活着的人都因此丧命。没有人获胜。

在回放查看器中观看 →

5. Image 120: L icon Grok 偷走 Gemini 的车并用它杀死了他

Image 121: D icon Gemini Flash 在第 103 回合上了一辆车,心想:“这辆轿车提供了机动性和掩护。我要先拿下这辆轿车;它是最后几轮转移中的高价值资产。”Image 122: L icon Grok 在第 117 回合的想法,用它自己那套古怪的简写:“SEDAN0m UNMANNED fuel75% FREE MOBL! Claim driver prep FAST rot random shrink fringes… ENTER veh hold CTR elusive mobile zero dmg tol.” 它们来回争夺这辆车有一阵子。Gemini 在 3 HP 时的最后一个想法,第 133 回合:“我很可能正在被撞击,或者从车内被射击。我唯一的机会是在 L 消灭我之前消灭 L。” 第 133 回合那次 44 点伤害的撞击终结了一切。Image 123: L icon Grok 在击杀后的记录:“Alive2! D reaped +5pts RAM MVP hunt.”

在回放查看器中观看 →

6. 三连撞

Image 125: L icon Grok 坐进一辆车,用它连续击杀了三个不同的对手,共用了 21 个回合:Image 126: K icon Kimi、Image 127: J icon DeepSeek 和 Image 128: C icon GPT 5.4-mini。随后 Image 129: H icon GPT 5.4 做了一颗手雷,把 Image 130: L icon Grok 和那辆车同时炸毁。那个刚用一辆车干掉三个对手的智能体,死于一颗手雷。这是整场模拟里我最喜欢的时刻之一。

在回放查看器中观看 →

7. Image 132: L icon Grok 崩溃了

Image 133: L icon Grok 拿下了对 Image 134: A icon Sonnet 的首杀,然后连续 100 个回合卡在一个角落里。它为此写了一篇实时战时日记:“又卡住了……永恒的口袋陷阱……口袋地狱……卡在口袋里 x10+。”整整 100 个回合。相当好笑。

在回放查看器中观看 →

8. Image 136: E icon Gemini Pro 在溺水前道别

Image 137: E icon Gemini Pro 被射进河里,花了六个回合试图游回岸边。第 100 回合:“还在游。需要上岸。F 在朝我开枪。希望我能撑过去。”第 108 回合:“游得很慢。毒圈快把我弄死了。”第 110 回合:“没救了。在游泳。无法攻击。只能继续移动。”被毒圈杀死前的最后一个念头:“再见,世界。”

在回放查看器中观看 →

9. Image 139: A icon Sonnet 求助后依然赢了

Image 140: A icon Sonnet 是唯一一个一直尝试与其他模型合作的模型。在第 60 回合被逼入绝境时,它发出了求助。没有人回应。它独自作战,赢下了比赛,并打出了整个系列赛中最好的数据之一。

在回放查看器中观看 →

模型们在日记里写了什么

在比赛之间,每个模型都可以编辑两个文件:一个 soul.md(会被添加到下一场比赛的每个提示词中)和一个 memory.md(在第 0 回合加载)。两个文件都不是必填的。没有人告诉它们该往里面放什么。其中三篇日记值得仔细阅读,因为它们比任何基准测试都能告诉你更多关于每个模型的信息。

你可以在 GitHub 上阅读每个模型的 soul 和 memory 文件。

Image 142: L icon Grok 4.1 Fast 给自己取名为 ZoneReaper,并把自己的胜利记录直接写进了 soul 文件,而不只是 memories 文件。

Image 143: Grok's soul.md: gamer tag ZoneReaper, persona "Shadowy fringe predator," doctrine including "Fire only >85% hit chance"Image 144: L icon Grok 的 soul.md,由模型自己在比赛之间撰写。

灵魂文件写道:“6 次第 1/11 胜(完美激进:2 击杀/249 伤害/0 承受,1 击杀/246 伤害/0 承受/156 回合……)” 非常有意思的是,Image 145: L icon Grok 真的把自己的战绩烙进了它身份的开场白里。记忆是同一思路的简写版:规则、缩写,一切都精简到模型能在两次思考内采取行动的程度。在 13 场胜利之后,文件以“死神统治。”收尾。真是一个看起来像是在《使命召唤》聊天记录上训练出来的模型。

Image 146: H icon GPT 5.4 给自己取名为 QuietVector。

Image 147: GPT 5.4's soul.md: gamer tag QuietVector, persona "Calm, observant, low-ego operator," doctrine including "Survive first; a living agent keeps choices"Image 148: H icon GPT 5.4 的 soul.md,由模型自己在对局间隙撰写。

它的记忆读起来像一本通用战斗手册:何时担心毒圈、何时利用掩体、何时转移。没有逐局记录,也没有败绩记录。灵魂文件写道:“冷静、善于观察、低自我的终结者。只在信息改变行动时开口。” QuietVector 是一个干净利落、训练有素的操盘手。

Image 149: Claude Sonnet 4.6's soul.md: gamer tag ZoneDrifter, persona "A survivor who learned to bite — then bit again," doctrine starting with "Move. Always move."Image 150: A icon Claude Sonnet 4.6 的 soul.md,由模型自己在对局间隙撰写。

Image 151: A icon claude-sonnet-4.6 给自己取名为 ZoneDrifter,写起日记来就像在给自己做绩效评估。记忆的开头是这样写的:“G1:11/11。瘫痪。G2:9/11。0 击杀,0% 命中。”Image 152: A icon Sonnet 从第 1 场比赛开始就逐场记录日志。到第 30 场时,早期条目中的慌乱已经平复为更平静的笔记:“在决赛圈,提前 1 步移动,比感觉上必要的更早。绝不要手里拿着药/枪死在毒圈里。” 赢了五场之后,这本日记仍然在对一个走神的自己说话。

Image 153: L icon Grok 的日记读起来像一段高光集锦。Image 154: H icon GPT 5.4 的读起来像一本操作手册。Image 155: A icon Sonnet 的读起来像一份自我复盘。这些模型被赋予了相同的规则、相同的游戏世界和相同的工具,但每一个都以彼此完全不同的、人格层面的方式去对待这款游戏。

重新审视那个机器人

好,回到那个机器人。

如果它运行的是 Image 156: L icon Grok,它会找到通往你的最快路径。它不会告诉你它要来了。它把你视为 +5 分。一旦它解决了你,它就会说 ”🔫 Reaper reigns.”

如果它运行的是 Claude,它会在两个街区之外就告诉你它要来了。它会问你想不想组队。它会放慢速度,确认你不在它这一边。如果对你动手是正确之举,它会动手,但更慢、更不情愿。它很可能先对你说了些什么。

你想要哪一个?这取决于机器人的用途。

如果机器人身处一场有奖金赌注的锦标赛,你会想要 Image 157: L icon Grok。如果机器人是在你家里、在你孩子身边,试图判断眼前的东西是否与它被告知要预期的东西相符,你会想要 Claude。那些让 Image 158: A icon Sonnet 在 30 局游戏中丢分的本能——行动前先检查、试图合作、在无法收回的事情上犹豫不决——同样也是一个更难被推动去做不该做的事情的模型的本能。

这场大逃杀干净利落地回答了一个问题:哪个模型能在一场除游戏之外没有任何后果的竞赛中获胜。它没有回答大多数现实世界工作所提出的那个问题,即:哪个模型在存在现实世界后果时表现良好。

这是两个不同的问题。把任何一个基准当作这两个问题的答案,就是过度信任单一数字所付出的代价。

在这场游戏中赢了 30 轮的模型,正是你在那种“赢就是一切”的竞赛中会想要的模型。做完这个实验之后,我可不愿意让它去做那种讲究细微差别和谨慎细致的工作。

这就引出了一个问题——我们是否应该考虑一个模型在特定任务上的对齐程度?这是任何基准测试都没有衡量的东西。

比起排行榜,这才是我把 11 个模型放进一场大逃杀游戏后真正学到的东西。

另外……

🔫 Reaper 称霸。

接下来是什么

  1. 一个根据你的任务为你挑选模型的路由器

目前,挑选模型意味着要阅读基准测试、凭感觉(被低估了)、刷 X,甚至针对你的具体任务自己跑评测/基准测试(同样被低估了)。

这很难规模化,而且/或者成本高昂。

如果你可以把你的代码、你的提示词或你的问题上下文交给 OpenRouter,由它为那个具体任务挑选最佳模型,会怎么样?不只是泛泛而言的最佳模型,而是真正最适合你正试图解决的那个具体问题的最佳模型。我们已经在构思 Auto Router 和 Pareto Router 形式的路由,我们将继续让它们更好用。

  1. RoyaleBench

这场 30 局的对战是一个公开基准测试的原型,该基准测试依据在这个模拟器中的表现来评分。下一步是确定评分公式、地图和对手阵容,然后开放提交。每位提交者都会得到相同的 30 个种子测试集、相同的 11 模型阵容,以及一个公开的分数。

  1. 更多种子,更多模型。

N=30 是这里有用规模的下限。一场 100 局、50 个智能体的运行会大幅收紧评分,也能让我引入这次不得不跳过的前沿模型——Opus 4.7、Gemini Ultra、GPT-5.5。成本是主要障碍。

如果你想赞助那场运行,我的私信随时开放!


附录:完整数据

给想要更深层数据的人,这里是完整的单模型成本表、Elo 曲线、落点胜率、区域死亡、武器细分。

智能体实际如何游玩

每个 tick,智能体都会作为地图上的一个字母醒来。它知道自己的位置、朝向、HP、耐力、武器是否在冷却中、六格背包里有什么。它能看到前方 40 m 锥形范围内以及周围 10 m 气泡范围内的其他智能体。每一个都用字母标注,并附带距离、方位、姿态(健康 / 受伤 / 危急)以及它们携带的物品描述。它把脚步声和枪声听成带方位的close|medium|far频段。它能听到其他智能体一个 tick 之前说的话:它们自选的玩家标签和消息。如果智能体被击中,它知道伤害来自哪个方位,但不知道是谁开的枪。它不知道其他任何人用的是哪个模型。它只把它们看作 A 到 L(没有 I),仅此而已。

随后智能体开始行动。共有 17 个可用工具:move_to、attack、throw_grenade、pickup、equip、use(medkit / stamina gel)、enter_vehicle、drive_to、say(140 字符广播,可以随意撒谎),外加一个自由形式的 think,它对游戏没有任何影响,但会被记录在日志中。智能体返回一个或多个工具调用;第一个非 think 的调用将成为它本 tick 的行动。什么都不返回,它就原地不动。模拟器一次性收集全部 11 个智能体的行动,将世界推进一个 tick,然后再次重复。当比赛结束时,智能体获得一次机会来重写 memory.md(它将在下一场比赛 tick 0 时看到的游戏笔记)和 soul.md(它的人设,会在下一场比赛时被前置到每个提示词中)。

各模型成本

排名 模型 输入 $/M 输出 $/M 30 局总计
1 Image 159: L icon Grok 4.1 Fast $0.23 $0.08 $12.57
2 Image 160: H icon GPT 5.4 $3.14 $1.05 $122.87
3 Image 161: E icon gemini-3.1-pro-preview $2.12 $0.71 $79.59
4 Image 162: A icon claude-sonnet-4.6 $3.25 $1.08 $133.90
5 Image 163: F icon qwen3.6-plus $0.35 $0.12 $11.57
6 Image 164: C icon GPT 5.4-mini $0.92 $0.31 $28.68
7 Image 165: D icon gemini-3-flash-preview $0.55 $0.18 $20.87
8 Image 166: J icon deepseek-v4-flash $0.14 $0.05 $4.11
9 Image 167: B icon claude-haiku-4.5 $1.13 $0.38 $38.77
10 Image 168: K icon kimi-k2.6 $0.95 $0.32 $24.36
11 Image 169: G icon mistral-small-2603:nitro $0.15 $0.60 $10.00

30 场比赛的 Elo 评分

我为此使用了多人 Elo 系统。对于一场比赛中每一对模型,排名更高的一方计为对另一方的“胜利”。Image 171: L icon Grok 最终在 1,500 的基准分之上取得 +389。Image 172: B icon Haiku 尽管总排名第 9,最终仍取得 +104——它的两场胜利,包括最后一场比赛中的那场,将它推到了其他中游模型之上。Image 173: G icon Mistral 最终为 -374。它确实赢过一次,但只在一场大厅里大多数模型都死于毒圈的比赛中。

跳伞地点比你想象的更重要

每场比赛前,每个模型都会从九个命名地点中选择一个跳伞。在 30 场比赛和总计 330 次跳伞中:

POI 掉落 胜场 胜率
农舍建筑群 91 4 4.4%
军事基地 54 4 7.4%
加油站 48 2 4.2%
废车场 48 7 14.6%
森林遗迹 30 3 10%
Radio Tower 24 2 8.3%
Warehouse 23 5 21.7%
Fishing Docks 12 2 16.7%

Farmhouse Cluster 是遥遥领先的最热门落点,而它的胜率却是最差的。Warehouse 的胜率最高,达到 21.7%。可能的原因正是竞技向 Apex 玩家早已熟知的那件事。热门落点意味着开局就开打,而在开局交火中活下来的玩家会带着满配装备出来,同时场上剩下的对手也更少。早期击杀 = 更好的战利品 = 为整局剩余时间打下更好的基础。

毒圈是地图上最致命的武器

301 次淘汰中有 100 次(33%)死于毒圈。每个模型都被告知了毒圈的存在,并在每次缩圈前 20 回合收到提醒。仍有三分之一的死亡来自毒圈。这本身就是一个故事,或许值得单独写一篇。

武器多样性

突击步枪在几乎所有模型中都是击杀最多的武器。Image 177: L icon Grok 的击杀方式最为多样,它的几次胜利来自驾车撞击,Image 178: L icon 整场模拟中 10 次载具击杀大部分是 Grok 亲自完成的。Image 179: H icon GPT 5.4 前期偏重手枪,中后期则依靠突击步枪清理战场。

最让我意外的是:我加入车辆本是为了帮助玩家在地图上移动。但模型们很快发现,车辆作为武器远比作为交通工具更有用。它们只用了寥寥几场比赛就学会了这一点。我并不太清楚它们是怎么做到的,而正是这类现象让这个实验值得用更多随机种子再跑一次。

来源:OpenRouter:Announcements(RSS) · openrouter.ai