跳到正文
北京时间
原文
Qwen:Blog Retrieval(API)· QwenTeam·· 2026-06-23精选AI 评分81

Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen-AgentWorld: Language World Models for General Agents

AI 导读

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

推荐理由

Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。

正文 · AI 翻译

Image 2 论文GITHUBHUGGING FACEMODELSCOPE

今天我们发布 Qwen-AgentWorld,这是一个原生语言世界模型,能够模拟横跨七个领域的智能体环境:

  • 原生世界建模:环境建模从持续预训练开始就是训练目标(CPT → SFT → RL),而不是在通用大语言模型之上做事后适配。
  • 七个领域,一个模型:单个模型即可模拟基于文本的(MCP、Search、Terminal、SWE)和基于 GUI 的(Web、OS、Android)环境,并且知识能够跨领域迁移。

与该模型一同,我们还发布了 AgentWorldBench,这是一个覆盖七个领域的评测基准,配有来自真实环境的成对真值观测。两者均可在 Hugging Face 和 ModelScope 上获取。


语言智能体被训练在交互式环境中行动,但还没有任何语言模型被明确训练来对环境的本身进行建模——即在给定当前状态和智能体动作的情况下,预测接下来会发生什么。

路线图: Qwen-AgentWorld 代表了我们的一项尝试,旨在探究建立在语言模型之上的世界建模如何进一步拓展通用智能体能力的边界。

我们既探索如何实现语言世界建模,也探索如何将其应用于推进通用智能体:

  • 首先,我们构建了一个用于智能体环境模拟的基础模型:Qwen-AgentWorld 是首个在单一模型中覆盖七个智能体交互领域(MCP、Search、Terminal、SWE、Web、OS、Android)的语言世界模型,其训练流程为 CPT → SFT → RL,使用了超过 10M 条真实环境交互轨迹。在 AgentWorldBench 上,Qwen-AgentWorld-397B-A17B 取得了最高的整体模拟质量,超越了 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。
  • 其次,我们通过两种互补范式研究了世界建模在智能体训练中的作用:作为一种解耦的环境模拟器,它为智能体 RL 提供了更优越的可扩展性和可控性。可控的模拟 RL 能够以真实环境无法做到的方式塑造智能体行为,并且显著优于仅在真实环境中训练的 RL;作为一种统一的智能体基础模型,LWM 预热使其能够有效迁移到七个基准上的多轮智能体任务,其中包括三个完全属于域外的任务,且无需在智能体任务上进行任何 RL 微调,这初步验证了语言世界模型可以作为构建更强智能体模型的基础。

Image 3: Qwen-AgentWorld Overview Qwen-AgentWorld:一个原生语言世界模型,横跨七个统一领域,具备两种互补范式以增强通用智能体。

交互式演示 #

探索由 Qwen-AgentWorld 在全部七个领域中模拟的真实智能体-环境对话。点击任意思考轨迹即可查看模型的内部推理过程。

Qwen-AgentWorld 演示 — 7 个领域(Terminal、Search、MCP、SWE、Android、Web、OS)

展开


第一部分:构建用于智能体环境模拟的基础模型#

七个领域,一个模型 #

Qwen-AgentWorld 涵盖七类交互式环境。对于其中三个 GUI 领域,环境观测采用可渲染代码的形式(无障碍树 XML、HTML、UI 层级标记),而非像素帧,从而实现对可视化环境的纯文本世界建模。

领域 LWM 模拟的内容 代表性预测
文本环境
终端 命令行环境:shell 输出、文件系统状态、进程行为 多步命令管道的完整 shell 输出
搜索 搜索引擎结果:URL、摘要片段、排名、页面内容 逼真的 URL 标识符、自然的来源排名顺序、针对查询的具体事实细节
MCP API 服务器响应:工具调用结果、数据库状态、服务协议 九次连续 Notion API 调用之间的跨调用 schema 一致性
SWE IDE / 代码编辑环境:git diff、测试结果、编译错误 代码变更的文件修改与测试结果
GUI 环境
Web 用户交互后浏览器 DOM 状态的变化 HTML + 无障碍树更新
Android 触摸/手势操作后 Android UI 层级的变化 UI 层级 XML 标记
操作系统 桌面操作系统状态:文件系统、窗口管理、应用程序行为 无障碍树 XML 更新

训练流程 #

Image 4: Training Pipeline 三阶段训练流程:CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度。

Qwen-AgentWorld 以环境建模作为从持续预训练开始的明确目标进行端到端训练。三阶段流程遵循一个原则:CPT 注入,SFT 激活,RL 提升。

阶段 1:持续预训练(CPT)通过非思考轨迹注入环境知识。数据来自专用的智能体基础设施(容器化执行沙箱、MCP 服务器、Android/Web/OS 模拟器)、开放环境交互轨迹以及内部智能体轨迹。除环境数据外,我们还引入了涵盖工业控制、网络安全、法律、医学、金融和时事的专业领域世界知识语料库。一项关键贡献是轮次级信息论损失掩码:通过每个(动作,观察)对的四项表层统计量识别出携带真实环境信息的轮次,将其余轮次从损失中掩蔽,同时保留它们作为上下文。

阶段 2:监督微调(SFT)通过 <think>...</think> 块将下一状态预测激活为一种显式的思考模式。我们使用拒绝采样来筛选高质量的思考轨迹,最终得到 7,094 条训练样本。

阶段 3:强化学习(RL)通过混合奖励提升输出质量。我们使用 GSPO 进行 RL 训练。奖励结合了基于评分标准的 LLM 评判器(评估多维质量)与基于规则的验证器(用于可通过程序化方式检查精确正确性的领域)。

AgentWorldBench #

Image 5: AgentWorldBench Overview AgentWorldBench 概览:领域分布、来源基准、评估维度以及各领域的轨迹统计。

为评估语言世界模型,我们推出了 AgentWorldBench,这是一个综合性基准,基于对 5 个前沿模型在 9 个既定基准(如 Tool Decathlon、Terminal-Bench 1.0 & 2.0 和 OSWorld-Verified)上的真实世界轨迹观察构建而成。每个评估样本都配有一个从真实环境执行中获得的真值观察,从而支持基于参考的评分。AgentWorldBench 通过开放式评分标准评判,从 5 个维度——格式、事实性、一致性、真实感和质量——评估世界建模质量,考察推理、知识和长上下文能力。

性能 #

Image 6: Qwen-AgentWorld Main Results AgentWorldBench 结果:各领域五维评分标准均值。Qwen-AgentWorld-397B-A17B 取得最高总分(58.71),优于 GPT-5.4(58.25)及其他前沿模型。

Qwen-AgentWorld-397B-A17B 取得最高总体均值(58.71),超越 GPT-5.4(58.25)及所有其他前沿模型。这一优势在 Terminal 和 SWE 上最为显著,这两个领域的预测需要对代码执行状态和工具 API 行为进行准确建模。

在 35B-A3B 规模下,三阶段流水线将总体均值提升了 +8.66 分(47.73 → 56.39),使 Qwen-AgentWorld-35B-A3B 超过 Claude Sonnet 4.6(56.04)。这一提升在文本和 GUI 两个领域均保持一致。

走进世界模型的思维 #

除了总体性能之外,语言世界模型真正有意思的地方在于它如何进行推理。我们分析了四个基于文本的领域中的 129 条思维轨迹,发现了三种涌现出的推理模式。

Image 7: Qwen-AgentWorld Reasoning Patterns LWM 推理模式:审慎的自我纠错、信息泄漏防范,以及多步因果推理。

审慎的自我纠错。 模型使用“Wait!”作为认知中断来修正中间预测。在 129 轮中,我们统计到 1,347 次此类中断(每轮 10.4 次),涵盖事实性错误、认识论局限(“我实际上无法执行 np.random.seed(42)”)以及视角采择。

信息泄漏防范。 在 Search 领域中,模型持有一个智能体正试图寻找的参考答案。当查询不相关时,模型通过确保片段不会意外泄露目标来防止泄漏——这相当于世界模型层面的心智理论。

多步因果推理。 预测 curl -s localhost:3000 | python3 -m json.tool 的输出需要一条六步链条:Node.js 缺失 → 服务器从未启动 → 端口 3000 上没有监听器 → curl 静默失败 → 空管道 → json.tool 抛出 JSONDecodeError。


第二部分:探究世界建模在智能体训练中的作用#

我们研究了两种互补的范式,世界建模通过它们增强通用智能体。

为什么世界建模对智能体至关重要?#

不是为了取代真实环境,不是为了降低成本,而是作为推动前沿的互补维度

语言世界模型的作用。在智能体与环境的交互循环中,策略决定做什么,世界模型预测接下来会发生什么。语言世界模型接收当前交互历史和智能体的动作,预测环境将返回什么:终端输出、API 响应、更新后的 DOM。这不是基于模板的生成。忠实的模拟需要多步因果推理(串联六个系统知识步骤来预测curl流水线故障)、有状态追踪(在九次连续的 Notion API 调用中维护引用完整性),以及领域特定知识(Unix 语义、API schema、浏览器渲染规则)。

为什么不直接/仅使用真实环境?真实环境交互仍然是锚定智能体行为的黄金标准。语言世界模型并非旨在取代它,也不是主要用于降低成本的措施。相反,LWM 开辟了一个互补维度来补充真实环境:

(1) 超越真实环境的可扩展性与可控性。 LWM 能够实现多样化环境的轮次级扩展,无需专用基础设施(沙箱、GUI 虚拟机),覆盖极端场景、真实世界任务以及因不可逆操作或专有部署而无法真实执行的高价值专业领域。除了可扩展性,LWM 还提供精确的可控性:在真实环境中罕见或不存在的定向扰动,可以系统性地暴露智能体的弱点。针对这些扰动进行训练,有助于智能体处理仅靠真实环境训练无法覆盖的边缘情况,最终超越仅在真实环境中训练的智能体。

(2) 将世界预测内化为智能体能力。 一个有能力通用智能体应同时具备决策能力和世界建模能力。世界建模使智能体能够预测未来的环境状态,从而优化动作选择,有效地将心智模拟作为内部规划步骤来执行——而传统的智能体训练仅关注从状态到动作的决策。因此,下一状态预测被内化为一种类似于“反思”但面向未来的元推理模式:先预测,再行动。此外,准确的下一状态预测本身就需要推理、知识、指令遵循和长上下文处理能力——这些都是通用智能体的基础能力。

是什么让通用语言环境模拟成为可能? 构建一个通用的语言世界模型需要三个要素协同作用。第一,环境多样性:在尽可能多不同环境的轨迹上进行训练,使模型能够接触到完整的状态转移模式谱系,而不是记住一个狭窄的子集。第二,跨领域泛化:我们的实验表明,在单一文本领域上训练就能在所有其他文本领域上取得提升,这表明存在共享的底层环境建模能力,且随着领域覆盖范围的扩大而不断累积。第三,通过 CPT 获取世界知识:仅靠环境轨迹无法提供忠实模拟所需的事实基础。模拟一个监管合规平台需要法律知识;模拟搜索引擎对时事的响应需要最新的事实覆盖。通过在持续预训练过程中引入专业领域的世界知识语料库(工业控制、网络安全、法律、医学、金融、时事),模型获得了环境模拟所依赖的事实基底。这三个要素——环境多样性、跨领域迁移和世界知识——共同使单一模型能够作为通用模拟器服务于七个智能体交互领域。

范式一:解耦模拟 #

作为一个独立的模拟器,其中策略智能体和世界模型是相互独立的模型,Qwen-AgentWorld 提供了真实环境无法企及的可扩展性和可控性。在这种 Sim RL 设置中,世界模型在智能体 RL 训练期间取代真实环境:智能体采取行动,世界模型预测下一个观测结果,智能体从这些模拟的 rollout 中学习。关键发现:

  • 零样本环境泛化。 Qwen-AgentWorld 模拟了 4k 个完全未出现在训练中的 OpenClaw 环境,在没有任何领域特定适配的情况下,Sim RL 在 Claw-Eval 上取得 +4.3 的提升,在 QwenClawBench 上取得 +7.1 的提升。
  • 受控模拟至关重要。 不受控的 Sim RL 带来的提升微乎其微;可控扰动使 MCPMark 提升 +12.3,WideSearch 提升 +16.3,远超不受控的 Sim RL。
  • 超越真实环境训练。 可控 Sim RL 超过了针对实时搜索引擎训练的真实 RL(F1 为 50.3% 对 45.6%),同时通过对抗性摘要设计塑造出更具针对性的智能体行为。
  • 虚构世界同样有效。 在完全虚构、自洽的世界中训练的智能体能够泛化到真实搜索任务,同时在结构上防止智能体将模拟事实与真实世界知识相混淆。
  • 状态是瓶颈。 Sim RL 的有效性取决于能否为世界模型提供足够详细的初始状态;缺少它,仿真保真度就会下降,下游收益也随之减少。

可泛化的环境扩展 #

我们测试世界模型能否泛化到训练中完全未出现的环境。OpenClaw 是一个开源智能体平台,其任务涵盖日程安排、编程、邮件分诊、浏览器自动化和文件管理——对 Qwen-AgentWorld 而言完全处于分布之外。我们为智能体 RL 训练仿真了 4,000 个 OpenClaw 环境,未做任何领域特定适配,同时也对模拟器本身做了消融:使用 Qwen3.6-Plus 作为模拟器带来的提升微乎其微,而 Qwen-AgentWorld-397B-A17B 则产生了显著收益——这证实了世界模型质量是瓶颈,对 Sim RL 而言如此。智能体从不忠实的模拟器中交互学到的东西很少。

Claw-Eval QwenClawBench
Qwen3.5-35B-A3B 65.4 47.9
+ Sim RL(使用 Qwen3.6-Plus) 66.7 47.8
+ Sim RL(使用 Qwen-AgentWorld-397B-A17B) 69.7 55.0
Δ +4.3 +7.1
  • 所有分数均为 3 次独立 rollout 的平均值,最大序列长度为 256K。

可控仿真 #

更强大的能力在于可控性:使用自然语言指令在训练过程中塑造仿真器的行为。我们验证了两种模式。

MCP:环境适配。我们从真实的 MCP 工具使用轨迹中合成仿真系统提示词:每个提示词指定工具 schema 和服务器配置,总结隐藏的环境状态(数据库内容、权限设置、服务可用性),并定义可控仿真指令,以塑造仿真器在每一轮的响应方式。控制指令注入有针对性的扰动——间歇性 API 错误、需要后续调用的分页响应、迫使多步检索的不完整中间结果,以及批量操作中的部分失败——以系统性地暴露真实部署中很少产生的智能体弱点。

结果揭示出鲜明对比:标准的 Sim RL 在没有控制指令的情况下没有带来有意义的提升(Tool Decathlon 实际上从 32.4 下降到 31.5),因为模拟器缺乏足够的依据来生成忠实的响应。在可控模拟的情况下,Tool Decathlon 提升了 +3.7,MCPMark 提升了 +12.3。可控性不仅仅是提升幅度的一个因素——它是 Sim RL 在这一领域能够发挥作用的前提条件。MCPMark 上更大的提升(+12.3 对比 +3.7)表明,可控模拟对于需要大量顺序工具调用和仔细处理中间结果的任务尤为有效。

Tool Decathlon MCPMark
Qwen3.5-35B-A3B-SFT 32.4 21.5
+ Sim RL(无控制) 31.5 24.6
+ Sim RL(有控制) 36.1 33.8
Δ +3.7 +12.3

搜索:虚构世界构建。 我们构建了 1,000 个自包含的虚构环境,每个环境以一个关系型数据库(300–500 行)为锚点,其中包含内部一致的虚构事实。一个时间偏移的环境可能包含一份 2029 年智能手机市场排名,其中使用真实品牌名称但型号并不存在。由于答案只存在于虚构设定之中,智能体无法绕过搜索工具、仅凭参数化记忆作答;由于所有事实均为虚构,智能体也无法将模拟事实与真实世界知识相混淆。

按条目统计的 F1 按行统计的 F1
Qwen3.5-35B-A3B-SFT 34.02 13.72
+ 模拟强化学习(受控) 50.31 24.21
Δ +16.29 +10.49
Qwen3.5-397B-A17B-SFT 70.11 45.69
+ Sim RL(受控) 73.98 51.74
Δ +3.87 +6.05

Sim RL 与 Real RL 对比 #

Image 8: Sim RL vs Real RL Training Curves WideSearch 上的 Sim RL 与 Real RL 对比:受控 Sim RL 的表现与使用实时搜索引擎训练的 Real RL 相当,甚至略有超越。

性能。我们在 WideSearch 上直接对比了受控 Sim RL 与 Real RL(使用实时搜索引擎训练)。Sim RL 的表现与 Real RL 相当,甚至略有超越:在第 60 步时,F1 by Item 达到 50.3%,而 Real RL 为 45.6%。

Image 9: Sim RL vs Real RL Tool Usage 工具使用差异:经 Sim RL 训练的智能体增加了 web\_extractor 调用,而经 Real RL 训练的智能体则减少了调用,这反映出可控模拟如何塑造出不同的智能体行为。

行为。更具信息量的信号来自智能体的行为。两种训练范式都将每条轨迹的 web_search 调用次数从约 5 次降至约 3.5 次,但 web_extractor 调用次数出现明显分化:Sim RL 将使用量从 2.5 提升至 4.0,而 Real RL 则从 2.5 降至 1.5。由于模拟片段刻意隐藏了详细内容,经 Sim RL 训练的智能体学会了必须提取完整页面才能拼装出完整答案。可控模拟能够以真实环境无法做到的方式,有针对性地塑造智能体行为。

范式 II:智能体基础模型 #

在范式 I 中,智能体和世界模型是两个独立的模型。在这里我们将它们统一:同一个既选择动作又预测环境状态的模型。LWM 训练将下一状态预测作为一种内化的推理能力灌输给模型。关键发现:

  • 极致的跨任务泛化。单轮、非智能体的 LWM RL 预热(不涉及任何工具调用)能够迁移到多轮、工具调用的智能体任务上,覆盖五个领域的七个基准测试。
  • 领域泛化。在 LWM 训练中完全未出现的、彻底分布外的领域上也取得了提升(Claw-Eval 上 +11.3,QwenClawBench 上 +9.7,BFCL v4 上 +9.0),证实了这是可迁移的能力,而非特定领域的捷径。
  • 将下一状态预测作为元推理模式。 LWM 训练教会智能体在行动之前先在脑中模拟环境响应,这种能力可泛化到不同的任务形式和领域。

我们通过在 Qwen3.5-35B-A3B-SFT 上运行 LWM RL 来验证这一点——这是一个无工具调用的单轮任务——然后直接在七个基准上的多轮、工具调用智能体任务上进行评估,无需额外微调,其中包括三个不在 LWM 训练范围内的域外基准。

域内 域外
Terminal-Bench 2.0 SWE-Bench Verified
基线 33.3 64.5
+ LWM RL 39.6 67.9
Δ +6.3 +3.4

域外结果尤为引人注目:LWM 训练流程中不包含任何 Claw 或函数调用数据,然而在完全未出现在世界模型训练中的领域上,仍分别取得了 +11.3、+9.7 和 +9.0 的提升。


使用 Qwen-AgentWorld 构建 #

部署 #

我们已开源 Qwen-AgentWorld-35B-A3B(Hugging Face、ModelScope),这是一个基于 MoE 架构构建的语言世界模型,总参数量 35B / 激活参数量 3B,支持 256K 上下文窗口。可通过以下方式进行部署和使用。

# SGLangpython -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3
# vLLMvllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

from transformers import AutoModelForCausalLM, AutoTokenizermodel = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen-AgentWorld-35B-A3B", torch_dtype="auto", device_map="auto",)tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen-AgentWorld-35B-A3B")

评估 #

AgentWorldBench 已在 Hugging Face 和 Modelscope 上以按领域划分的 JSONL 文件形式提供,每个文件包含带有来自真实环境的真实观测的交互轨迹。评估通过 eval/eval.py 使用三步流水线进行:(1) infer —— 运行世界模型生成预测观测,(2) judge —— 使用 LLM 评判器在五个维度(格式、事实性、一致性、真实感、质量)上将每个预测与真实观测进行评分,(3) aggregate —— 计算按领域和总体得分。世界模型和评判器均使用 OpenAI 兼容 API,支持 SGLang、vLLM 或专有端点。完整设置、数据格式和示例命令请参阅 GitHub README。

摘要 #

Qwen-AgentWorld 是一个原生语言世界模型,在单一模型中覆盖七个智能体交互领域,提供两种规模(35B-A3B 和 397B-A17B)。通过三阶段配方,CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度,从零开始逐步构建世界建模能力。我们研究了世界建模增强通用智能体的两种互补范式。作为解耦模拟器,我们在 Tool Decathlon、MCPMark 和 WideSearch 上验证了可控模拟的有效性,超越了非受控模拟和真实环境训练。作为统一的智能体基础模型,LWM 预热可迁移至七个基准上的多轮智能体任务,其中三个完全属于域外任务,初步验证了语言世界模型可以作为构建更强智能体模型的基础。语言世界建模为扩展通用智能体开辟了一条互补路径,超越了仅靠真实环境交互所能提供的能力。

引用 #

@article{zuo2026qwen, title={Qwen-agentworld: language world models for general agents}, author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others}, journal={arXiv preprint arXiv:2606.24597}, year={2026}}

来源:Qwen:Blog Retrieval(API) · qwen.ai