跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-08精选AI 评分73

OmniGameArena:面向VLM游戏智能体的统一UE5基准与改善动态

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

AI 导读

OmniGameArena是一个基于十二个Unreal Engine 5新构建游戏的实时基准,涵盖单人(7个)、PvP(3个)和合作(2个)模式,提供统一动作接口。除冷启动排行榜分数外,还引入Improvement Dynamics Curve (IDC),一种智能体反射评估机制:通过工具调用反射大语言模型自动优化技能提示词,追踪多轮反射中的分数变化以及习得技能在任务变体上的泛化表现。论文报告了12个VLM智能体在冷启动排行榜上的表现,以及4个顶级智能体在IDC下的指标。

推荐理由

在 UE5 里直接测 agent 的自我改进,这个思路让游戏 benchmark 从一次性的刷榜变成动态成长观测,对做多模态 agent 的团队是个新标尺。

正文 · AI 翻译

林明贤

钱圣驹

刘宇琦

黄奕华

王逸宇

黄伟

李一棠

张帆

胡泽宇

朱灵婷

王鑫

齐晓娟

香港大学

LIGHTSPEED

项目负责人 通讯作者

摘要

视觉语言模型(VLM)智能体正越来越多地被部署在交互式游戏环境中。然而,针对 VLM 智能体的游戏基准测试通常仅报告每个(智能体,游戏)对的单次首次尝试得分,侧重于单智能体的单人游戏模式,并且缺乏统一的协议来在同等条件下评估异构智能体类别(商业 VLM、开源权重 VLM 和专用游戏策略)。我们通过 OmniGameArena 来解决这些不足,这是一个包含十二个全新构建的虚幻引擎 5 游戏的实时基准测试,涵盖单人游戏(7 个)、玩家对战(3 个)和合作游戏(2 个),并配有统一的操作接口;同时我们还提出了改进动态曲线(IDC),这是一种智能体反思框架,其中使用工具的反思大语言模型能够自主地在多轮迭代中优化受限的技能提示词。除了冷启动排行榜分数之外,IDC 还为每个(智能体,游戏)对揭示了两个额外的可观测指标:分数在反思轮次中的演变情况,以及习得的技能在保留的任务变体上的表现。我们报告了十二个 VLM 智能体在冷启动排行榜上的这些可观测指标,以及四个顶级智能体在 IDC 框架下的表现。

OmniGameArena:面向 VLM 游戏智能体的统一 UE5 基准测试与改进动态

林明贤¹,钱圣驹², ‡,刘宇琦³,黄奕华¹,王逸宇²,黄伟¹,李一棠⁴,张帆³,胡泽宇²,朱灵婷²,王鑫²,齐晓娟¹, † ¹香港大学,²LIGHTSPEED,³香港中文大学,⁴清华大学 项目负责人 通讯作者 项目页面:https://mxlin043.github.io/OmniGameArena/

Refer to caption
图 1:OmniGameArena 概览。十二个全新构建的 UE5 游戏涵盖单人游戏(7 个)、玩家对战(3 个)和合作游戏(2 个)模式(顶部)。异构智能体(商业 VLM、开源权重 VLM、键盘鼠标策略和手柄策略)通过文档化的适配器连接到同一个实时 UE5 环境(中部)。评估报告了冷启动排行榜以及多轮反思下的改进动态曲线(IDC)(底部)。

1 引言

基础模型正越来越多地根据其行为方式而非仅仅根据其回答内容来评估,而游戏正是这一转变的天然压力测试(Wang 等人,2023;Tan 等人,2024;Paglieri 等人,2024):智能体必须解读不断变化的视觉场景,在时间压力下选择行动,针对延迟奖励进行规划,并在环境产生阻力时做出适应。游戏基准测试现已涵盖纯文本世界、2D 网格套件以及基于现有商业游戏构建的 3D 开放环境,并推动了视觉语言游戏智能体的快速发展(Tan 等人,2025;Magne 等人,2026;Wang 等人,2025b)。

然而,当前的基准测试很少衡量对部署这些智能体至关重要的两个特性。大多数基准测试仅报告每个(智能体,游戏)组合的首次尝试得分,这使得智能体在与同一任务反复交互过程中如何改进的轨迹不可见。此外,它们也严重偏向于单智能体的单人游戏模式,而对抗性(PvP)和合作性(Coop)模式则仍然代表性不足,尽管这些模式能够检验诸如对手建模、角色分配以及从队友失误中恢复等不同能力。因此,智能体能否在反复反思中适应,以及能否在对抗性或合作性环境中做到这一点,在很大程度上仍未被衡量。

我们通过 OmniGameArena(一个包含十二款全新虚幻引擎5游戏的实时基准测试,涵盖单人、玩家对战和合作模式)以及在此基础上构建的改进动态曲线(IDC,一种智能体反思框架)来同时解决这两个问题。这十二款游戏是为该基准测试专门创作的,而非复用公开游戏,从而降低了预训练数据泄露的风险;它们共享统一的动作接口(键盘鼠标、游戏手柄),使得商业视觉语言模型、开源视觉语言模型以及专用游戏策略都能在匹配的环境条件下进行评估。IDC 框架对每个(智能体,游戏)实例运行多轮:智能体在当前技能提示词下进行游戏回合,之后一个反思大语言模型通过工具使用检查游戏轨迹,自主决定读取哪些信息以及何时停止,然后为下一轮优化技能。我们报告了每轮的得分序列(该实例的 IDC)以及在保留任务变体上的迁移得分。

在冷启动排行榜上的十二个智能体中,没有单一视觉语言模型占据主导地位,商业智能体与开源视觉语言模型及专用策略之间差距悬殊。在我们通过 IDC 运行的前四个顶级智能体中,所有四个都通过反思在冷启动基线基础上有所提升,但峰值性能通常出现在曲线中部而非最后一轮。最值得注意的是,在我们的实验中,原始任务的改进与保留变体的迁移可能会产生分歧;这种分歧被单轮排行榜得分所掩盖,是 IDC 揭示的一个核心可观测现象。

总结而言,我们的贡献有三方面:(i)OmniGameArena,一个包含十二款虚幻引擎5游戏的基准测试,涵盖单人、玩家对战和合作模式,具有统一的动作接口,且游戏实例专为该基准测试构建;(ii)IDC 框架,一个智能体反思框架,其自主工具使用反思器会在多轮中优化一个有限的技能提示词,并具备持久记忆和最佳技能回滚功能;(iii)一项涵盖十二个智能体的实证研究,表明领先地位在不同游戏间轮换,且原始任务的提升本身并不能预测保留变体的迁移。

Refer to caption
图2:12款OmniGameArena游戏在七个能力维度上的雷达图。缩写含义如下:VP = 视觉感知,SN = 空间导航,RT = 反应速度,MEM = 记忆能力,PLN = 规划能力,ADV = 对抗能力,COOP = 协作能力。每个维度的评分范围为0到3分。

2 相关工作

游戏环境中的基准测试。自强化学习兴起以来,交互式游戏一直是人工智能的测试平台,如今更成为评估大语言模型(LLM)和视觉语言模型(VLM)的重要基准。早期的LLM评估仅基于文本(Huang等人,2024;Wu等人,2023;Hu等人,2024),虽能有效测试逻辑推理能力,但缺乏视觉基础。BALROG(Paglieri等人,2024)和LVLM-Playground(Wang等人,2025a)等二维网格套件增加了空间和多模态需求,而近期基于Minecraft或通用视觉基准构建的套件(V-MAGE(Zheng等人,2025)、Cradle(Tan等人,2024)、VideoGameBench(Zhang等人,2025))则将评估扩展至三维开放世界,要求模型从像素层面进行长程规划。除游戏玩法外,相关基准还探索了复杂三维环境中的具身推理与行动能力(Lin等人,2025;Zhu等人,2026),以及视频生成模型的统一推理能力(Luo等人,2025),但均未涉及多模式、实时游戏交互。这些基准的两大局限性促使了我们的工作:多数基准复用现有商业游戏,易受预训练数据污染;且很少有基准能在单一实时环境中涵盖单人、玩家对战和合作三种模式。OmniGameArena通过十二款全新构建的UE5游戏解决了这两个问题,这些游戏横跨全部三种交互模式。

游戏型大语言模型与视觉语言模型智能体。早期的LLM游戏智能体仅在纯文本环境(Hausknecht等人,2020;Tsai等人,2023)和二维网格世界(Feng等人,2023;Küttler等人,2020)中运行。Voyager(Wang等人,2023)和MineDojo(Fan等人,2022)将LLM智能体扩展到了三维《我的世界》游戏,但它们所需的针对每款游戏的大量工程工作限制了跨游戏的通用性。当前这一代VLM智能体(Li等人,2025;Bai等人,2026;Wang等人,2025b;Tan等人,2025;Magne等人,2026)直接操控图形用户界面或键盘鼠标接口,能够在各种三维世界中运行:Game-TARS(Wang等人,2025b)在超过5000亿个多模态游戏玩法模型token上进行了预训练;NitroGen(Magne等人,2026)在涵盖多款游戏的数小时游戏视频上进行了训练;Lumine(Tan等人,2025)能够在三维环境中执行长达数小时的实时任务。这些智能体既推动了、也超越了我们所提供的标准化跨游戏评估基础设施。

反思与自我改进。大多数游戏智能体基准测试只报告单次得分,这掩盖了智能体是否以及如何通过重复交互来改进。基于反思的方法通过积累过去经验的自然语言摘要来解决这个问题,而无需更新权重。Reflexion(Shinn 等人,2023)将回合反馈转化为口头自我批评;Self-Refine(Madaan 等人,2023)迭代地重写模型输出;ExpeL(Zhao 等人,2024)提取任务层面的洞察;Voyager 的技能库(Wang 等人,2023)在《我的世界》中积累可复用的代码技能;GameVerse(Zhang 等人,2026)报告了每个游戏中有无反思的单一对比结果。我们的工作与最近提出的启发式学习范式(Weng,2026)相一致,该范式将大语言模型驱动的自我改进视为一种作用于显式产物(提示词、代码、记忆)而非权重的学习过程。我们的 IDC 工具以三种具体方式实例化了这一范式:(i) 反思运行多轮,产生完整的得分轨迹,而非前后对比;(ii) 反思器本身是一个具备工具使用能力的大语言模型,它决定检查什么,而不是执行固定模板的脚本;(iii) 我们在每个游戏的保留任务变体上测试生成的技能,从而揭示单一数字指标所隐藏的技能风格差异。

游戏 描述 评估
\rowcolorgray!15 单人
ObstacleRun3D 一款 3D 跑酷游戏,智能体需在躲避物理障碍的同时导航至终点线。 ,其中:智能体位置,:起点,:目标
ObstacleRun2D 一款 2D 横向卷轴平台游戏,智能体必须到达线性关卡的终点。 ,其中:智能体位置,:起点,:目标
LastStand 一款平台生存游戏,智能体必须避开危险并防止掉落。 ,其中:存活时间,:最大时长
MonsterShoot 一款生存射击游戏,需定位并消灭敌对实体,同时避免受到伤害。 ,其中:有效伤害,:敌方总生命值
SceneEscape 一款场景解谜游戏,要求完成 NPC 分配的任务以逃脱。 ,其中:已完成任务,:总任务数
CueChase 一款第三人称探索游戏,需在地图中定位并激活隐藏的触发器。 ,其中: 为已激活触发器数量, 为触发器总数
SoloCraft 一款物流游戏,智能体需要收集、准备并交付物品以完成订单。 ,其中: 为已交付价值, 为目标价值
\rowcolorgray!15 PvP
SkyDuel 一款直接 1v1 对战游戏,智能体必须与对手交战并将其击败。 ,其中: 为智能体剩余生命值, 为智能体最大生命值
CrystalGuard 一款对称攻防游戏,目标是摧毁对方水晶核心,同时保护己方核心。 ,其中: 为己方核心生命值, 为核心最大生命值
MidlineClash 一款竞争性物流游戏,两个智能体在共享环境中竞相完成资源订单。 ,其中: 为智能体得分, 为目标得分
\rowcolorgray!15 合作
SharedFloor 一款对称合作游戏,智能体共享空间和能力以完成配送订单。 ,其中: 为已交付价值, 为团队目标价值
HandoffRun 一款非对称合作游戏,要求智能体根据不同的角色分工,在受限区域之间传递物品。 ,其中: 为已交付价值, 为团队目标价值
表 1:12 款交互游戏概览。

3 OmniGameArena

我们推出了 OmniGameArena,这是一套包含十二款定制虚幻引擎 5 游戏的套件,涵盖单人、PvP 和合作三种模式(第 3.1 节),旨在利用稳健、连续的进度指标,系统性地评估基于视觉的游戏智能体在不同能力维度上的表现。此外,为解决评估数据污染这一关键挑战,我们详细阐述了主动数据规避策略和严格的实证分析(第 3.2 节),以确保我们基准测试的完整性和新颖性。

3.1 游戏套件与评估指标

OmniGameArena 套件包含十二个在虚幻引擎 5 中开发的视觉丰富、物理复杂的虚拟环境。每款游戏都经过精心设计,旨在隔离并测试具身能力的特定子集,范围从单体的空间推理到复杂的多智能体合作,如图 2 所示。游戏进度被统一归一化到 的连续尺度上,从而在高度多样化的任务间提供一致的衡量标准。我们为每款游戏提供了简要描述及其评估协议,如第 2 节所示。

3.2 避免数据污染

我们在基准测试设计阶段采取主动措施来减轻数据污染。首先,我们在发布前进行网络曝光审计,搜索确切的游戏名称、任务短语、规则描述和评分事件,确保这些特定元素被严格排除在基准测试之外。为了保证环境的新颖性,我们使用虚幻引擎5(UE5)构建全新的游戏。在视觉内容方面,我们混合使用了定制和现成的UE5商城资源。然而,资源的组合、关卡几何结构的设计、脚本的执行顺序以及成功的标准都是独特设计的,确保评估场景无法从预训练数据中记忆。

媒体内容 · 前往原文查看
基准测试 游戏数量 识别率(%) 机制描述率(%)
BALROG 06 066.7 100.0
LMGame-Bench 06 100.0 100.0
ORAK 12 100.0 100.0
OmniGameArena 12 000.0 050.0
表2:给定截图时的污染分析。识别率:被识别出的游戏百分比;机制描述率:底层机制被成功描述的游戏百分比。

污染分析。为了实证验证我们规避策略的有效性,我们进行了一项污染分析,重点关注视觉新颖性和规则泄露。首先,我们向一个代表性模型(例如 Gemini)提供游戏截图,以评估它是否能识别出游戏名称,从而确认任务的视觉新颖性。其次,我们评估该模型是否能够仅基于视觉输入成功描述游戏的底层机制,这用于测试记忆游戏规则的泄露情况。如表2所示,我们在这两项测试中将现有基准测试(Paglieri 等人,2024;Park 等人,2025;Hu 等人,2025)与我们提出的 OmniGameArena 进行了比较。结果清楚地表明,现有基准测试中的游戏具有很高的可识别性,使得模型能够直接从记忆中检索其机制。相比之下,OmniGameArena 的识别率显著降低,机制泄露也大幅减少。这些结果表明,OmniGameArena 显著减轻了预训练污染的风险,减少了记忆先验知识对智能体评估的影响。

Refer to caption
图 3:改进动态曲线(IDC)框架概览。经验获取模块(左)在当前技能下运行多个回合。反思模块(中)读取新轨迹和持久化状态(笔记和先前技能),然后运行四个自主阶段(探索、诊断、验证、提炼)以生成精炼后的技能。持久化模块(右)存储经验笔记、经过验证的技能以及每轮得分曲线,这些内容将作为下一轮的初始输入。

4 游戏智能体框架

OmniGameArena 定义了游戏;框架则定义了智能体如何玩这些游戏。该框架包含两层:一个逐回合循环(§4.1),在冷启动运行期间驱动任何智能体;以及一个反思性外层循环(§4.2),其轮次级别得分构成了 §5.3 中研究的改进动态曲线。

4.1 逐回合循环

OmniGameArena 暴露了一个类似 Gym 的接口。在第 t 步,框架接收观测值 o_t,其中 RGB 帧为 1280×720 分辨率,t_cap 为其捕获时间戳。智能体发出一个动作 a_t(针对 VLM 的分块键盘-鼠标动作),引擎执行该动作后返回 r_t;循环在 done 信号为真时终止。

有界视觉-动作历史。

对于 VLM 智能体,框架维护一个最近观测-响应对的滑动窗口:

其中 r_i 是第 i 步的原始 VLM 响应。在第 t 步,VLM 接收系统指令、可选的技能提示词 s、历史记录 H_t 以及当前帧 o_t 作为提示,每次调用最多包含 5 张图像。当前帧仅在 r_t 返回后才追加到历史记录中。

4.2 改进动态曲线

IDC 将逐回合循环包裹在一个反思性外层循环中,该循环组织为三个模块(图 3):一个经验获取模块,在当前技能下运行多个回合;一个反思模块,将生成的轨迹转换为精炼后的技能;以及一个持久化模块,跨轮次携带状态。我们刻意保持该循环轻量但功能完备:一个小型固定工具集赋予反思器完全的智能体自主性,而无需预设检查脚本。

设 M 为一个具有冻结权重 θ 的 VLM。在第 r 轮,智能体以技能提示词 s_r 为条件,并根据策略 π_r 行动;该技能在整个轮次中固定不变。

经验获取。每一轮包含多个回合,生成轨迹和回合得分。

轮次使用空技能(),作为冷启动基线。

媒体内容 · 前往原文查看
智能体 障碍跑2D 障碍跑3D 最后一战 怪物射击 场景逃脱 线索追逐 单人工艺
Claude Opus 4.7(Anthropic,2026b) \cellcolorsecond \cellcolorthird \cellcolorthird
Claude Opus 4.6(Anthropic,2026a) \cellcolorsecond \cellcolorsecond \cellcolorbest \cellcolorsecond
Claude Sonnet 4.6(Anthropic,2026c) \cellcolorbest
GPT-5.5(OpenAI,2026b) \cellcolorbest \cellcolorbest \cellcolorsecond \cellcolorbest \cellcolorthird \cellcolorbest
GPT-5.4(OpenAI,2026a) \cellcolorsecond
Gemini 3.1 Pro Preview(Google,2026b) \cellcolorthird \cellcolorbest \cellcolorthird \cellcolorsecond
Gemini 3.1 Flash-Lite Preview(Google,2026b) \cellcolorthird
Kimi K2.5(月之暗面,2026) \cellcolorthird
Qwen3.5-397B-A17B(通义千问团队,2026)
Qwen3.5-122B-A10B(通义千问团队,2026)
NitroGen(游戏手柄)(Magne 等人,2026)
Open-P2P(键盘鼠标)(Yue 等人,2026)
表3:单人冷启动得分。每列前三名:红色 橙色 黄色。

反思。一轮结束后,反射器会自主优化技能,它读取新的轨迹以及持久化状态(笔记本和先前技能),自行决定检查哪些内容、使用多少次工具调用以及何时终止。优化过程分为四个阶段。探索阶段通过沙盒只读工具(list_dir、read_text、read_image、grep)暴露该轮中每个回合的轨迹;反射器自行选择要检查的内容,而非执行固定脚本。诊断阶段通过 submit_diagnosis 提交一份明确的失败模式列表,将原因与解决方案区分开来。验证阶段提出更新后的技能,并调用 validate_skill——一个独立的 LLM 评判器,它会拒绝那些记忆地图内容或与诊断结果相矛盾的提案;反射器最多迭代五次才会提交。蒸馏阶段最终确定被接受的技能,并可选择性地将持久性观察结果写入笔记本。在小型、固定的工具界面(读取、诊断、评判、写入)内结合智能体自主性,正是该框架保持轻量级且不牺牲功能完整性的关键。

持久化模块。三个工件在轮次之间传递状态。经验笔记本是由反射器为自身未来使用而编写的事实性日志(例如,“第轮回合步骤:事件”),设有 token 上限,采用编辑而非追加方式,并且从不向玩家展示。已验证的技能包含当前轮次使用的技能提示词(玩家可见,设有从提示到响应启发式的 token 上限),以及用于回滚的最佳技能缓存。曲线是迄今为止累积的得分序列。

最佳技能回滚。反思并非单调递增。当某一轮的得分急剧下降至低于迄今为止的最佳得分时,框架会将下一轮的起始提示词重置为,并从此处继续反思,以防止灾难性的技能漂移。

曲线。经过多轮迭代后,得到(智能体,游戏)对的改进动态曲线。两个最终得分相同的模型可能产生截然不同的曲线(早期收敛与晚期收敛、单调收敛与振荡收敛);在§5.3节中,测量对象是曲线本身,而非任何单轮结果。

5 实验

我们分三个模块报告结果。§5.1节固定了评估协议、智能体集合以及全文使用的评分规则。§5.2节报告了主要的冷启动排行榜,其中每个智能体在没有任何先前轨迹且未提供技能的情况下,对七款单人游戏、三款玩家对战游戏和两款合作游戏各进行一次游戏。§5.3节通过改进动态曲线(IDC)放宽了冷启动限制,这是一种智能体自我反思协议,同一模型在游戏与重写自身技能(针对特定游戏策略的自然语言摘要)之间交替进行,共进行轮次。我们使用IDC来刻画:(i) 每个模型在原始任务上的改进方式,以及 (ii) 所学技能是否能迁移到每款游戏的三个保留任务变体上。

5.1 实验设置

智能体。我们评估了十二个智能体,它们被分为三类,以便其优势与局限不会被平均化掩盖。(a) 商业视觉语言模型(仅限 API):三个 Claude 模型(Opus 4.7 (Anthropic, 2026b)、Opus 4.6 (Anthropic, 2026a)、Sonnet 4.6 (Anthropic, 2026c)),两个 OpenAI 模型(GPT-5.5 (OpenAI, 2026b) 和 GPT-5.4 (OpenAI, 2026a)),两个 Gemini 模型(3.1 Pro Preview 和 3.1 Flash-Lite Preview (Google, 2026b)),以及 Kimi K2.5 (Moonshot AI, 2026)。(b) 开放权重视觉语言模型:两个 Qwen3.5 混合专家模型检查点,分别为 397B-A17B 和 122B-A10B (Qwen Team, 2026),在本地通过兼容 OpenAI 的端点提供服务。(c) 专用游戏策略:NitroGen (Magne et al., 2026),它处理单帧图像并输出一段包含 18 个游戏手柄动作(每个动作 21 维)的数据块;以及 Open-P2P (Yue et al., 2026),它处理 200 帧的键盘鼠标历史记录,每帧输出一个动作。两者均使用其原始论文中的原生实时协议运行。所有智能体都在相同的 OmniGameArena 实时环境中进行评估,并采用匹配的配置。视觉语言模型使用 OmniGameArena 的分块键盘鼠标适配器,而专用策略则通过其原生接口直接路由,因此每个系统都在其设计的工作点上进行评估。

评估协议。每个(智能体,游戏)组合都会在多个回合中进行评估;PvP 组合还会额外覆盖智能体池中所有两两配对的情况。OmniGameArena 原生以实时方式运行,但商业视觉语言模型 API 调用会受到网络抖动的影响,这与模型能力本身无关。因此,我们在两种时钟模式下进行评估,这两种模式都会在推理期间暂停环境:暂停决策质量模式会在整个推理调用期间冻结环境,并将决策时间视为免费,从而隔离出纯粹的决策质量;延迟控制实时模式则会在每个动作执行前,额外等待服务器报告的推理时间,以此对智能体在设备上的延迟进行计费,同时排除网络往返噪声。主表结果使用暂停决策质量模式,而延迟控制实时模式的结果则在附录 A 中报告。

Refer to caption
图 4:在所有配对中,玩家 1(行)对阵玩家 2(列)的每局游戏 PvP 胜率。

5.2 冷启动排行榜

单人游戏。表 3 报告了七款单人游戏的结果。有三个显著模式。(1)没有单一模型占据主导地位。领先地位在不同游戏中轮换:GPT-5.5 在七款游戏中的四款(ObstacleRun2D、LastStand、SceneEscape、SoloCraft)领先,Claude Opus 4.6 在 CueChase 中以大幅优势获胜(对比次名),而 Gemini 3.1 Pro 在 MonsterShoot 中领先(对比次名)。(2)较新版本并不总是更好。Claude Opus 4.6 在七款单人游戏中的五款上表现优于 Opus 4.7,而 GPT-5.4 在 SceneEscape 上超过了 GPT-5.5,这表明能力排名是任务特定的,而非随发布顺序单调递增。(3)开放权重的视觉语言模型和专用策略无法迁移。Qwen3.5 MoE 的两个检查点在每款游戏上得分均较低,并在数款游戏中得分为零,而 NitroGen(游戏手柄)和 Open-P2P(键盘鼠标)在除少数几款游戏外的所有游戏中得分几乎为零。这证实了 OmniGameArena 的任务多样性远超出了为优化单一游戏而设计的策略的训练数据分布。

玩家对战游戏。图 4 报告了所有配对中玩家 1 的胜率(对角线已省略)。SkyDuel 和 CrystalGuard 显示出清晰的统治层级,与单人游戏排行榜一致:GPT-5.5 和 Gemini 3.1 Pro 几乎击败所有对手,而两个 Qwen3.5 变体几乎输掉了所有对局。MidlineClash 则呈现非传递性:Kimi K2.5 在所有五场玩家 1 对局中击败了 Claude Opus 4.6,尽管 Claude 是更强的单人游戏智能体,而 Claude 仅在对抗 Qwen3.5 时取得决定性胜利。这表明 MidlineClash 奖励的是特定于游戏的策略,而这些策略与单人游戏能力排名并不一致。

合作游戏。表 4 报告了同一模型的两个副本相互协作时的团队得分。排行榜与单人游戏相似:GPT-5.5 在两款游戏中均领先,Gemini 3.1 Pro 紧随其后位列第二,Claude Opus 4.6 排在第三。有两个发现超出了单人游戏的范畴。首先,商业模型与开放权重视觉语言模型之间的差距拉大:两个 Qwen3.5 检查点在两款游戏中得分均为零,未能完成任何一个共享订单或任务交接。其次,即使是最强的模型,在 SharedFloor 上也仅达到一定分数,在 HandoffRun 上达到另一分数,留下了相当大的提升空间,这表明大语言模型间的协作是一个尚未解决的能力缺口,而非一个已饱和的基准测试维度。

媒体内容 · 前往原文查看
智能体 SharedFloor HandoffRun
Claude Opus 4.7 (Anthropic, 2026b)
Claude Opus 4.6 (Anthropic, 2026a) \cellcolorthird \cellcolorthird
Claude Sonnet 4.6 (Anthropic, 2026c)
GPT-5.5 (OpenAI, 2026b) \cellcolorbest \cellcolorbest
GPT-5.4 (OpenAI, 2026a)
Gemini 3.1 Pro Preview (Google, 2026b) \cellcolorsecond \cellcolorsecond
Gemini 3.1 Flash-Lite Preview (Google, 2026a)
Kimi K2.5 (月之暗面, 2026)
Qwen3.5-397B-A17B (通义千问团队, 2026)
Qwen3.5-122B-A10B (通义千问团队, 2026)
表 4:两个合作游戏中的合作团队得分,其中同一模型的两个副本必须协调完成一个共享任务。
媒体内容 · 前往原文查看
LastStand SharedFloor
Agent origin var1 var2 var3 origin var1 var2 var3
Claude Opus 4.6 \cellcolorgainstrong \cellcolorgainstrong \cellcolorlossstrong \cellcolorgainmild \cellcolorgainmid \cellcolorgainstrong \cellcolorgainmid \cellcolorgainmid
Claude Opus 4.7 \cellcolorgainstrong \cellcolorlossmid \cellcolorlossstrong \cellcolorlossmid \cellcolorgainstrong \cellcolorgainmid \cellcolorgainmid \cellcolorgainmid
GPT-5.5 \cellcolorgainstrong \cellcolorgainstrong \cellcolorgainstrong \cellcolorgainmild \cellcolorgainmild \cellcolorgainmid \cellcolorgainmild \cellcolorgainmild
Gemini 3.1 Pro Preview \cellcolorgainstrong \cellcolorgainstrong \cellcolorlossmid \cellcolorgainmid \cellcolorgainmid \cellcolorgainmid \cellcolorgainmild \cellcolorgainmild
表 5:IDC 最佳技能在原始划分和三个未见变体上的迁移情况。每个单元格显示增益,后跟相对于 的变化。 是该划分上的无技能基线; 应用了在 10 轮运行中给出最高平均分数的技能。

5.3 改进动态曲线

实验设置。我们在 LastStand(单人模式)和 SharedFloor(合作模式)上运行 IDC,以实现互补的技能覆盖:LastStand 强调反应式控制,因为地面会逐渐塌陷;而 SharedFloor 则将明确的任务规则与多智能体协调相结合。我们排除了 PvP 模式,以确保 IDC 的收益归因于反射器而非对手行为。来自冷启动排行榜的四名顶尖智能体参与其中:Claude Opus 4.6、Claude Opus 4.7、GPT-5.5 和 Gemini 3.1 Pro。每个智能体在 PDQ 下完成多轮回合;第 0 轮复用了第 5.2 节中的冷启动基线。然后,每个(模型,游戏)运行中的最佳技能被重新应用于每个游戏的三项保留任务变体。

Refer to caption
图 5:IDC 曲线:四个智能体在 LastStand(左)和 SharedFloor(右)上,经过 10 轮反思的每轮平均回合得分。水平线标出了每个智能体的第 0 轮(无技能 PDQ 基线)得分作为参考;线上方的偏差表示技能驱动的改进。每轮汇总每个智能体的 5 个回合。

5.3.1 在原始任务上的改进

图 5 报告了每轮平均得分。通过多轮智能体反思,两款游戏上的每个模型都发现了能够超越其第 0 轮基线的技能。在 LastStand 上,最佳轮次的生存分数提升范围从 [原文缺失数值] 到 [原文缺失数值](相对提升 [原文缺失数值] 到 [原文缺失数值])。在 SharedFloor 上,最佳轮次的团队每回合完成了 [原文缺失数值] 到 [原文缺失数值] 个额外订单,这是协调吞吐量上的显著提升。然而,峰值性能通常出现在曲线中部而非第 10 轮:在 LastStand 上,两个 Opus 模型在最佳轮次和最终轮次之间损失了 [原文缺失数值] 的分数,而 GPT-5.5 和 Gemini 则几乎保留了所有增益。这种最佳与最终轮次之间的差距,证明了第 3 节中描述的最佳技能回滚机制是合理的。

5.3.2 向保留变体的迁移

表5报告了每个最佳技能在原始划分及每个游戏三种保留变体上的增益。SharedFloor技能具有普遍迁移性(在所有变体上均为正增益)。增益范围从X到Y,相当于在最佳技能下每个回合大约额外完成Z到W个订单。这些技能编码的是协调启发式策略,而非空间记忆:智能体被引导在提交订单前观察队友的位置和当前持有的物品(以避免两个玩家拿起同一物品),当发生这种情况时在垃圾桶丢弃重复物品,与队友的工作站保持距离以防止拥挤,并在各工作站之间维持可见的劳动分工。由于变体仅改变了工作台和物品的摆放位置,同时保留了协调规则,这些行为启发式策略无需修改即可迁移。LastStand技能的迁移取决于技能风格,而非原始增益的大小。原始版本一次掉落一个方块,因此四个模型中有三个收敛到“找到一个安全方块并停留”的策略,利用了单方块结构。变体1(不同种子,相同机制)保留了该结构,四个模型中有三个实现了正迁移。变体2(多个相连方块的簇状掉落)移除了技能所依赖的安全区域:两个Opus模型性能崩溃(X和Y),而GPT-5.5获得了Z增益。技能检查(附录C)解释了这种差异:Opus和Gemini技能收敛于最小化移动的策略(例如,“除非你的方块变红,否则保持静止”、“绝不向前连续迈步”),这些策略在单方块掉落情况下是最优的,但当簇状掉落清除安全区域时则适应不良。GPT-5.5的技能则编码了一个“短暂移动,然后重新评估”的循环,能够适应两种机制。变体3(追踪玩家的方块)完全消除了静态安全性;所有四个模型的迁移增益降至很小或为负值。GPT-5.5是唯一在所有三个变体上均实现正迁移的模型,但其原始增益最小(X);Opus 4.7在原始版本上获得增益,但在每个变体上迁移均为负值。这种原始增益与可迁移性之间的分离是变体实验的核心发现。

6 结论

我们推出了 OmniGameArena,这是一个包含十二个全新构建的 UE5 实时游戏的基准测试,涵盖单人、玩家对战和合作模式,以及改进动态曲线(IDC),一种能生成多轮自我改进轨迹的智能体反思框架。除了单轮排行榜得分外,IDC 还为每个(智能体,游戏)组合揭示了另外两个可观测指标:得分在反思轮次间的演变情况,以及所学技能在未见过的任务变体上的表现。

局限性

IDC 范围。由于计算资源限制,我们的 IDC 实验仅涵盖两个环境(LastStand 和 SharedFloor),每个环境包含三个未见过的变体,以及来自冷启动排行榜的四个智能体。将 IDC 扩展到更多游戏、变体和模型是未来的扩展方向。

单一技能格式。我们的反思器维护一个单一的、有边界的技能提示词,该提示词每轮被替换,而不是像 Voyager 那样维护一个不断增长的技能库。基于库的扩展与逐轮优化是正交的。

玩家与反思器共享模型。每个智能体使用相同的底层模型作为玩家和反思器。非对称设置(例如,较小的玩家与较强的反思器配对)是否会产生不同的改进效果尚未经过测试。

参考文献

  • Anthropic (2026a) Anthropic. 2026a. 推出 Claude Opus 4.6。https://www.anthropic.com/news/claude-opus-4-6。
  • Anthropic (2026b) Anthropic. 2026b. 推出 Claude Opus 4.7。https://www.anthropic.com/news/claude-opus-4-7。
  • Anthropic (2026c) Anthropic. 2026c. 推出 Claude Sonnet 4.6。https://www.anthropic.com/news/claude-sonnet-4-6。
  • Bai et al. (2026) Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, and Spencer Whitehead. 2026. Webgym: 为视觉网络智能体扩展具有现实任务的训练环境。arXiv 预印本 arXiv:2601.02439。
  • Fan et al. (2022) Linxi Fan, Guanzhi Wang, Yunfan Jiang, Ajay Mandlekar, Yuncong Yang, Haoyi Zhu, Andrew Tang, De-An Huang, Yuke Zhu, and Anima Anandkumar. 2022. Minedojo: 利用互联网规模知识构建开放式具身智能体。第 35 卷,第 18343–18362 页。
  • Feng 等人 (2023) Xidong Feng, Yicheng Luo, Ziyan Wang, Hongrui Tang, Mengyue Yang, Kun Shao, David Mguni, Yali Du, 和 Jun Wang。2023年。Chessgpt:桥接策略学习与语言建模。《神经信息处理系统进展》,36:7216–7262。
  • Google (2026a) Google。2026a。推出 Gemini 3.1 Flash-Lite。https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-lite/。
  • Google (2026b) Google。2026b。推出 Gemini 3.1 Pro。https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/。
  • Hausknecht 等人 (2020) Matthew Hausknecht, Prithviraj Ammanabrolu, Marc-Alexandre Côté, 和 Xingdi Yuan。2020年。互动小说游戏:一场宏大的冒险。载于《AAAI 人工智能会议论文集》,第34卷,第7903–7910页。
  • Hu 等人 (2025) Lanxiang Hu, Mingjia Huo, Yuxuan Zhang, Haoyang Yu, Eric P Xing, Ion Stoica, Tajana Rosing, Haojian Jin, 和 Hao Zhang。2025年。lmgame-bench:大语言模型在玩游戏方面表现如何?arXiv 预印本 arXiv:2505.15146。
  • Hu 等人 (2024) Lanxiang Hu, Qiyu Li, Anze Xie, Nan Jiang, Ion Stoica, Haojian Jin, 和 Hao Zhang。2024年。Gamearena:通过实时电脑游戏评估大语言模型推理能力。arXiv 预印本 arXiv:2412.06394。
  • Huang 等人 (2024) Jen-tse Huang, Eric John Li, Man Ho Lam, Tian Liang, Wenxuan Wang, Youliang Yuan, Wenxiang Jiao, Xing Wang, Zhaopeng Tu, 和 Michael R Lyu。2024年。我们在评估大语言模型决策能力方面进展如何?在多智能体环境中评估大语言模型的游戏能力。arXiv 预印本 arXiv:2403.11807。
  • Küttler 等人 (2020) Heinrich Küttler, Nantas Nardelli, Alexander Miller, Roberta Raileanu, Marco Selvatici, Edward Grefenstette, 和 Tim Rocktäschel。2020年。NetHack 学习环境。《神经信息处理系统进展》,33:7671–7684。
  • Li 等人 (2025) Muyao Li, Zihao Wang, Kaichen He, Xiaojian Ma, 和 Yitao Liang。2025年。Jarvis-VLA:后训练大规模视觉语言模型以使用键盘和鼠标玩视觉游戏。载于《计算语言学协会发现:ACL 2025》,第17878–17899页。
  • Lin 等人(2025)Mingxian Lin、Wei Huang、Yitang Li、Chengjie Jiang、Kui Wu、Fangwei Zhong、Shengju Qian、Xin Wang 和 Xiaojuan Qi。2025 年。Embrace-3k:复杂环境中的具身推理与行动。arXiv 预印本 arXiv:2507.10548。
  • Luo 等人(2025)Yang Luo、Xuanlei Zhao、Baijiong Lin、Lingting Zhu、Liyao Tang、Yuqi Liu、Ying-Cong Chen、Shengju Qian、Xin Wang 和 Yang You。2025 年。V-reasonbench:面向视频生成模型的统一推理基准套件。arXiv 预印本 arXiv:2511.16668。
  • Madaan 等人(2023)Aman Madaan、Niket Tandon、Prakhar Gupta、Skyler Hallinan、Luyu Gao、Sarah Wiegreffe、Uri Alon、Nouha Dziri、Shrimai Prabhumoye、Yiming Yang 及其他 1 人。2023 年。Self-refine:基于自我反馈的迭代优化。神经信息处理系统进展,36:46534–46594。
  • Magne 等人(2026)Loïc Magne、Anas Awadalla、Guanzhi Wang、Yinzhen Xu、Joshua Belofsky、Fengyuan Hu、Joohwan Kim、Ludwig Schmidt、Georgia Gkioxari、Jan Kautz 及其他 1 人。2026 年。Nitrogen:面向通用游戏智能体的开放基础模型。arXiv 预印本 arXiv:2601.02427。
  • Moonshot AI(2026)Moonshot AI。2026 年。Kimi k2.5:视觉智能体智能。https://www.kimi.com/blog/kimi-k2-5。
  • OpenAI(2026a)OpenAI。2026a。推出 GPT-5.4。https://openai.com/index/introducing-gpt-5-4/。
  • OpenAI(2026b)OpenAI。2026b。推出 GPT-5.5。https://openai.com/index/introducing-gpt-5-5/。
  • Paglieri 等人(2024)Davide Paglieri、Bartłomiej Cupiał、Samuel Coward、Ulyana Piterbarg、Maciej Wolczyk、Akbir Khan、Eduardo Pignatelli、Łukasz Kuciński、Lerrel Pinto、Rob Fergus 及其他 1 人。2024 年。Balrog:在游戏中基准测试智能体大语言模型与视觉语言模型的推理能力。arXiv 预印本 arXiv:2411.13543。
  • Park 等人(2025)Dongmin Park、Minkyu Kim、Beongjun Choi、Junhyuck Kim、Keon Lee、Jonghyun Lee、Inkyu Park、Byeong-Uk Lee、Jaeyoung Hwang、Jaewoo Ahn 及其他 1 人。2025 年。Orak:面向多样视频游戏训练与评估大语言模型智能体的基础基准。arXiv 预印本 arXiv:2506.03610。
  • Qwen Team(2026)Qwen Team。2026 年。Qwen3.5:面向效率的原生多模态基础模型。https://qwen.ai/blog?id=qwen3.5。
  • Shinn 等人(2023)Noah Shinn、Federico Cassano、Ashwin Gopinath、Karthik Narasimhan 和 Shunyu Yao。2023 年。《Reflexion:基于语言强化学习的语言智能体》。Advances in Neural Information Processing Systems,第 36 卷,第 8634–8652 页。
  • Tan 等人(2024)Weihao Tan、Ziluo Ding、Wentao Zhang、Boyu Li、Bohan Zhou、Junpeng Yue、Haochong Xia、Jiechuan Jiang、Longtao Zheng、Xinrun Xu 等。2024 年。《迈向通用计算机控制:以〈荒野大镖客:救赎 II〉为例的多模态智能体》。arXiv 预印本 arXiv:2403.03186,第 1 卷,第 2 期。
  • Tan 等人(2025)Weihao Tan、Xiangyang Li、Yunhao Fang、Heyuan Yao、Shi Yan、Hao Luo、Tenglong Ao、Huihui Li、Hongbin Ren、Bairen Yi 等。2025 年。《Lumine:在 3D 开放世界中构建通用智能体的开放配方》。arXiv 预印本 arXiv:2511.08892。
  • Tsai 等人(2023)Chen Feng Tsai、Xiaochen Zhou、Sierra S Liu、Jing Li、Mo Yu 和 Hongyuan Mei。2023 年。《大语言模型能很好地玩文字游戏吗?当前最先进水平与开放问题》。arXiv 预印本 arXiv:2304.02868。
  • Wang 等人(2023)Guanzhi Wang、Yuqi Xie、Yunfan Jiang、Ajay Mandlekar、Chaowei Xiao、Yuke Zhu、Linxi Fan 和 Anima Anandkumar。2023 年。《Voyager:基于大语言模型的无边界具身智能体》,2023 年。网址:https://arxiv.org/abs/2305.16291,第 2 卷,第 11 期。
  • Wang 等人(2025a)Xinyu Wang、Bohan Zhuang 和 Qi Wu。2025a 年。《大型视觉语言模型是优秀的游戏玩家吗?》arXiv 预印本 arXiv:2503.02358。
  • Wang 等人(2025b)Zihao Wang、Xujing Li、Yining Ye、Junjie Fang、Haoming Wang、Longxiang Liu、Shihao Liang、Junting Lu、Zhiyong Wu、Jiazhan Feng 等。2025b 年。《Game-Tars:面向可扩展通用多模态游戏智能体的预训练基础模型》。arXiv 预印本 arXiv:2510.23691。
  • Weng(2026)Jiayi Weng。2026 年。《超越梯度的学习》。https://trinkle23897.github.io/learning-beyond-gradients/。博客文章。
  • Wu 等人(2023)Yue Wu、Xuan Tang、Tom M Mitchell 和 Yuanzhi Li。2023 年。《SmartPlay:将大语言模型作为智能体的基准测试》。arXiv 预印本 arXiv:2310.01557。
  • Yue 等人 (2026) Yuguang Yue, Irakli Salia, Samuel Hunt, Chris Green, Wenzhe Shi, 以及 Jonathan J Hunt。2026 年。扩展行为克隆可改进因果推理:一种用于实时电子游戏游玩的开放模型。arXiv 预印本 arXiv:2601.04575。
  • Zhang 等人 (2025) Alex L Zhang, Thomas L Griffiths, Karthik R Narasimhan, 以及 Ofir Press。2025 年。Videogamebench:视觉语言模型能否通关热门电子游戏?arXiv 预印本 arXiv:2505.18134。
  • Zhang 等人 (2026) Kuan Zhang, Dongchen Liu, Qiyue Zhao, Jinkun Hou, Xinran Zhang, Qinlei Xie, Miao Liu, 以及 Yiming Li。2026 年。Gameverse:视觉语言模型能否从基于视频的反思中学习?arXiv 预印本 arXiv:2603.06656。
  • Zhao 等人 (2024) Andrew Zhao, Daniel Huang, Quentin Xu, Matthieu Lin, Yong-Jin Liu, 以及 Gao Huang。2024 年。Expel:大语言模型智能体是经验型学习者。载于《AAAI 人工智能会议论文集》,第 38 卷,第 19632–19642 页。
  • Zheng 等人 (2025) Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, 以及 Lijuan Wang。2025 年。V-mage:一种用于评估多模态大语言模型中视觉中心能力的游戏评估框架。arXiv 预印本 arXiv:2504.06148。
  • Zhu 等人 (2026) Lingting Zhu, Shengju Qian, Haidi Fan, Jiayu Dong, Zhenchao Jin, Siwei Zhou, Gen Dong, Xin Wang, 以及 Lequan Yu。2026 年。Assetformer:基于自回归 Transformer 的模块化 3D 资产生成。arXiv 预印本 arXiv:2602.12100。

附录 A 延迟受控的实时评估

我们进一步在延迟控制实时(LCRT)协议下对部分智能体进行评估。在PDQ模式下,模型思考时模拟器会暂停,返回的动作会从观测到的状态立即执行。在LCRT模式下,模型调用期间模拟器同样暂停,但模型测得的决策延迟会在动作执行前重新注入游戏时间线。因此,从观测结果预测的动作会在约秒的模拟游戏时间后执行,其中为模型的决策延迟。LCRT需要可靠地估算纯模型推理时间。因此,我们仅针对四个模型报告LCRT结果,这些模型的后端在我们的实现中提供了可用的模型侧时间信号:Claude Opus 4.6、Claude Sonnet 4.6、GPT-5.5和GPT-5.4。其他智能体被排除在外,因为它们可用的计时数据包含了客户端开销,例如请求排队、网络传输、重试或封装层延迟;将此类端到端挂钟测量结果注入会混淆模型延迟与基础设施延迟,导致比较不公平。

单人游戏。我们将 LCRT 分析聚焦于那些延迟预计会影响游戏状态演变或可用时间预算的任务,并据此将 LastStand 和 MonsterShoot 报告为动态实时任务,将 SoloCraft 报告为有时间预算的交互任务。如表 6 所示,这三项任务呈现出不同的敏感模式。MonsterShoot 对延迟最为敏感:所有四个模型的表现均出现下降,其中 GPT-5.5 下降最为显著(),这与该任务需要持续瞄准和追踪目标的特点一致。LastStand 的表现则不同:其最优策略几乎是静止的,即等待在安全的地块上,仅当自身所在地块即将塌陷时才移动,因此延迟在此不一定有害,而采取更少、更晚的行动甚至能避免致命的失误。这或许可以解释为何 Claude Opus 4.6 和 GPT-5.4 在 LCRT 下表现甚至有所提升,Claude Sonnet 4.6 基本持平,而 GPT-5.5 是唯一表现下降的模型。SoloCraft 在相同意义上并非反应控制类任务;在此,延迟主要消耗回合时间预算并降低交互吞吐量,我们将在下文量化这一影响。

媒体内容 · 前往原文查看
智能体 LastStand MonsterShoot SoloCraft
Claude Opus 4.6 (Anthropic, 2026a) +0.101 -0.182 -0.148
Claude Sonnet 4.6 (Anthropic, 2026c) +0.010 -0.050 -0.052
GPT-5.5 (OpenAI, 2026b) -0.092 -0.408 -0.200
GPT-5.4 (OpenAI, 2026a) +0.105 -0.188 -0.044
表 6:选定单人游戏的 LCRT 结果。每个单元格报告了各回合的均值(标准差以下标形式给出),其中 表示相对于相应 PDQ 结果的变化。
Refer to caption
图 6:在延迟控制设置下,MidlineClash 中玩家 1(行)对阵玩家 2(列)的 PvP 胜率。

PvP 游戏。图 6 报告了在 LCRT 模式下,四种商用视觉大语言模型在 MidlineClash 上的玩家 1 胜率。这些结果与 PDQ 热力图(图 4)存在差异,但这种差异反映的是时钟模式的变化,而非模型能力的变化。在游戏时钟限制下,充能决策延迟导致每步可用的游戏时间大幅减少,因此在 LCRT 模式下,每位玩家每局游戏仅能完成约 次行动,而 PDQ 预算为 次行动,比赛因此压缩为低分、频繁平局的局面。这种效应在 GPT-5.5 与 Opus 4.6 的对战中最为明显,这是两种协议共有的唯一一组对战:GPT-5.5 在 PDQ 模式下以巨大优势横扫对手(例如 –、–、–),而在 LCRT 模式下,同一组对战的结果为 GPT-5.5 胜 局、Opus 胜 局、平局 局,比分差距较小,如 –、– 和 –,且该组对战的玩家平均得分从 下降至 。尽管 GPT-5.5 的推理延迟远高于其他模型(纯模型时间达 秒,而其他模型为 – 秒),它仍然赢得了该组对战,并且保持了最高的玩家 1 平均胜率(,而最弱的 GPT-5.4 为 )。由于双方承受相同的延迟,在对称对战中,延迟主要压缩了比分差距并放大了单局比赛的随机性,而非重新排列智能体的排名,其影响远小于下文吞吐量任务中的效果。

媒体内容 · 前往原文查看
智能体 共享楼层
Claude Opus 4.6(Anthropic,2026a) -0.104
Claude Sonnet 4.6(Anthropic,2026c) -0.120
GPT-5.5(OpenAI,2026b) -0.320
GPT-5.4(OpenAI,2026a) -0.044
表 7:合作游戏 SharedFloor 的 LCRT 结果。每个单元格报告了 个回合的均值,下标为标准差, 表示相对于对应 PDQ 结果的变化量。

合作游戏。我们进一步报告了合作任务 SharedFloor,在该任务中,同一模型的两个实例需在固定的比赛截止时间前协调完成共享订单(表 7)。每个模型在 LCRT 下性能均有所下降,且损失随行动预算增加而扩大:因为 LCRT 会将每个模型的决策延迟计入比赛时钟,所以最慢的智能体完成的交互次数最少。最慢的 GPT-5.5 绝对下降幅度最大,从低于 PDQ 降至 ();但由于其初始领先优势较大,它仍与 Opus 4.6 并列获得最佳 LCRT 分数,而非彻底崩溃。最快的 GPT-5.4 保留了最多的行动次数,变化最小 ()。接下来我们将量化这种行动预算的影响。

动作预算与单动作效率。为了探究吞吐量任务得分下降的原因,我们测量了每个智能体在 SoloCraft(表 8)和 SharedFloor(表 9)两种协议下的每轮动作数以及单动作得分。动作预算随模型速度单调递减:最慢的 GPT-5.5 完成动作数最少,在 SoloCraft 上每轮仅完成约其 PDQ 动作数的动作,在 SharedFloor 上则为 vs.,而较快的智能体保留了更多动作。得分下降主要是预算效应:PDQ 与 LCRT 之间的单动作得分基本保持不变,GPT-5.5 最为明显(在 SoloCraft 上基本不变,在 SharedFloor 上仅略有下降),因此每个智能体的得分大致与其减少的动作数成比例,例如 GPT-5.5 在 SoloCraft 上因动作数减少而得分下降。这种解释仅适用于交互吞吐量任务,在该类任务中,得分随固定截止时间前有效交互次数的增加而累积;它不适用于动态任务,在动态任务中,延迟通过反应时机而非吞吐量起作用,甚至不是单调的——在 LastStand 中反而有帮助,因为其近乎静态的最优策略奖励更少、更晚的动作,但在 MonsterShoot 中因错失和时机不当的射击而有害。综合来看,这些情况表明延迟是一个首要的评估维度,其效果因任务而异:会降低单智能体吞吐量,压缩而非重新排序对称博弈,甚至有助于近乎静态的生存场景,因此 PDQ 的差距无法直接迁移到实时部署中。

媒体内容 · 前往原文查看
动作数 / 轮 得分 / 动作
智能体 PDQ LCRT PDQ LCRT
Claude Opus 4.6 (Anthropic, 2026a) 43 17 0.0053 0.0047
Claude Sonnet 4.6 (Anthropic, 2026c) 43 19 0.0029 0.0038
GPT-5.5 (OpenAI, 2026b) 43 8 0.0059 0.0065
GPT-5.4 (OpenAI, 2026a) 43 28 0.0020 0.0014
表 8:SoloCraft 动作预算。PDQ 与 LCRT 下的每轮动作数和归一化单动作得分。单动作得分几乎不变,因此每个智能体在 LCRT 下的得分下降(表 6)几乎完全由其较小的动作预算导致。
媒体内容 · 前往原文查看
动作数 / 轮 得分 / 动作
智能体 PDQ LCRT PDQ LCRT
Claude Opus 4.6 (Anthropic, 2026a) 84 33 0.0018 0.0015
Claude Sonnet 4.6 (Anthropic, 2026c) 84 36 0.0018 0.0008
GPT-5.5 (OpenAI, 2026b) 84 14 0.0044 0.0034
GPT-5.4(OpenAI,2026a) 84 55 0.0008 0.0004
表 9:SharedFloor 行动预算(行动次数和团队得分均为两名玩家之和;得分已归一化)。LCRT 下降轨迹反映了不断缩减的行动预算:GPT-5.5 速度最慢,完成的行动次数远少于其他模型,但在两种协议下均保持了最高的单次行动得分,因此其损失是预算效应所致,而非单次行动能力崩溃。
Refer to caption
图 7:使用 GPT-5.5 在 Last Stand 上的定性比较。
Refer to caption
图 8:使用 Gemini-3.1-Pro 在 Shared Floor 上的定性比较。

附录 B 与 IDC 的定性比较

IDC 技能归纳改善了智能体在两个环境中的行为。没有 IDC 时,智能体倾向于做出不稳定或低效的决策:在生存导向任务中,智能体无法持续维持安全位置;而在协作任务中,智能体表现出较弱的协调性,完成的目标也更少。引入 IDC 后,学习到的行为变得更加有效且与任务对齐。生存任务中的智能体能维持更安全的位置并获得更高分数,协作任务中的智能体则展现出更好的协调性并取得更高的团队得分。(见图 8)

附录 C 技能检查

本附录列出了 IDC 比较中每个游戏-模型配对的最佳实测技能提示词。它解释了正文中讨论的分歧:LastStand 的提示词收敛于保守的瓷砖生存行为,而 SharedFloor 的提示词则强调协作分工、站位对齐以及订单刷新处理。此处范围仅限于 LastStand 和 SharedFloor;ObstacleRun3D 被有意排除在外。

附录 D 可视化

可视化结果如图 9–20 所示。对于每个游戏,我们展示了来自不同模型的代表性轨迹。每一行对应一个模型或对阵组合,包含五个采样帧以说明回合的进展过程。

媒体内容 · 前往原文查看
表 10:使用 claude-opus-4-6 时 LastStand 的最佳技能提示词。
媒体内容 · 前往原文查看
表 11:使用 claude-opus-4-7 时 LastStand 的最佳技能提示词。
媒体内容 · 前往原文查看
表 12:使用 gemini-3.1-pro-preview 时 LastStand 的最佳技能提示词。
媒体内容 · 前往原文查看
表 13:使用 gpt-5.5 时 LastStand 的最佳技能提示词。
媒体内容 · 前往原文查看
表 14:使用 claude-opus-4-6 时 SharedFloor 的最佳技能提示词。
媒体内容 · 前往原文查看
表 15:使用 claude-opus-4-7 时 SharedFloor 的最佳技能提示词。
媒体内容 · 前往原文查看
表 16:使用 gemini-3.1-pro-preview 时 SharedFloor 的最佳技能提示词。
媒体内容 · 前往原文查看
表 17:使用 gpt-5.5 时 SharedFloor 的最佳技能提示词。
Refer to caption
图 9:cue_chase 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 10:last_stand 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 11:monster_shoot 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 12:obstacle_run_2d 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 13:obstacle_run_3d 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 14:scene_escape 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 15:solo_craft 的可视化结果。每行展示一个模型,包含对应轨迹中采样的五个帧。
Refer to caption
图 16:handoff_run 的可视化结果。每行展示一对协作模型,包含对应回合中采样的五个帧。
Refer to caption
图 17:shared_floor 的可视化结果。每行展示一对协作模型,包含对应回合中采样的五个帧。
Refer to caption
图 18:crystal_guard 的可视化结果。每行展示一场具有代表性的 PvP 对战,包含对应比赛中采样的五个帧。
Refer to caption
图 19:midline_clash 的可视化结果。每行展示一场具有代表性的 PvP 对战,包含对应比赛中采样的五个帧。
Refer to caption
图 20:sky_duel 的可视化结果。每行展示一场具有代表性的 PvP 对战,包含对应比赛中采样的五个帧。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org