跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-02精选AI 评分70

世界模型与语言模型:论具体推理与抽象推理的互补性

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

AI 导读

本研究探讨了世界模型与多模态大语言模型在预测未来状态时的互补性。世界模型可生成具体的视觉未来轨迹,但可能视觉合理却任务错误;多模态大语言模型则擅长抽象推理。为此,研究提出了“受控的具体推理”框架,并构建了VRQABench和OpenWorldQA两个基准。同时,提出了Privileged-Future On-Policy Self-Distillation(PF-OPSD)方法,该方法在训练时利用真实未来视频作为特权上下文评估推理轨迹,但部署时无需真实未来。实验结果显示,PF-OPSD在两个基准上分别比基线高出10.6%和10.9%,并提升了对噪声或冲突轨迹的鲁棒性。

推荐理由

世界模型靠视觉预测,语言模型靠抽象推理,这篇把两者真正拧在一起了。用未来视频做自我蒸馏提升 10%,还给全开源,做 agent 决策的可以认真看看‘什么时候不信自己的眼睛’是怎么训出来的。

正文 · AI 翻译

周宇程

,陶伟

,郭奕文

,沈建冰

澳门大学,

LIGHTSPEED,

yucheng.zhou@connect.um.edu.mo

摘要

世界模型与多模态大语言模型(MLLMs)在根据静态视觉观测预测未来结果方面提供了互补的能力。世界模型可以生成关于可能未来的具体视觉推演,而多模态大语言模型则能够对问题、目标和规则进行抽象推理。然而,生成的推演具有随机性,可能在视觉上合理但与任务不符,因此有必要确定视觉模拟何时有用、推演是否可信,以及它应如何影响最终答案。我们将此问题定义为受控的具体推理,即模型学习在抽象推理的同时调用、验证并整合视觉未来模拟。为了研究这一设定,我们构建了两个人工验证的基准:用于可控空间前瞻的 VRQABench 和用于开放域物理预测的 OpenWorldQA,并提出了特权未来在线策略自蒸馏(PF-OPSD)。在训练过程中,PF-OPSD 仅将真实未来视频和答案作为教师端的特权上下文,用于评估在线策略的具体推理轨迹,而可部署的学生模型在测试时从未观察到真实未来。实验结果表明,PF-OPSD 在 VRQABench 和 OpenWorldQA 上分别比基线高出 10.6% 和 10.9%,同时增强了对噪声或冲突推演的鲁棒性。我们的代码和数据集可在 https://github.com/yczhou001/PF-OPSD 获取。

世界模型遇见语言模型:论具体推理与抽象推理的互补性

周宇程¹,陶伟²,郭奕文³††通讯作者,沈建冰¹††通讯作者 ¹澳门大学,²LIGHTSPEED,³独立研究员 yucheng.zhou@connect.um.edu.mo

1 引言

面向未来的视觉推理要求模型回答关于静态观测中尚未显现的结果的问题。单张图像或关键帧可能揭示物体、接触关系、空间约束或谜题状态,但答案往往依赖于对短期动态或计划的推断。近期的大语言模型(MLLM)能够用语言组织目标、规则和备选方案(Yin et al., 2024; Yoon et al., 2025; Bai et al., 2025),而视频世界模型则能通过生成的推演过程(Wan et al., 2025; Team, 2025; Yuan et al., 2026; Yue et al., 2025; Zhang et al., 2025)将可能的未来以视觉方式明确呈现。这使得未来预测成为结合抽象语言级推理与具体视觉模拟的自然试验场。

Refer to caption
图1:抽象推理用语言组织目标、规则和问题,而具体推理则利用世界模型推演将可能的未来以视觉方式明确呈现;可靠的智能体必须协调这两种能力。

图1展示了这一概念动机:抽象的语言级推理组织目标、规则和问题,而基于具体推演的推理则使可能的未来变得明确。然而,仅仅将世界模型附加到大语言模型(MLLM)上并不能使这种协调变得可靠。生成的推演过程是带有噪声的推理轨迹,而非精确的预言:它们可能遗漏任务关键交互、偏离初始几何结构,或产生视觉上合理但答案错误的未来(Qian et al., 2026; Yue et al., 2025; Zhang et al., 2025)。因此,关键挑战不在于世界模型能否生成未来,而在于大语言模型(MLLM)能否控制这些未来何时应影响推理。

一项初步的实证研究使这一挑战变得具体。在可选工具使用的情况下,模型即使在外界模拟有助于解决问题时,也常常继续依赖抽象推理,我们将此称为“模拟惯性”。在强制模拟的情况下,模型可能会在没有充分审查的情况下接受具有误导性的推演结果,从而导致“强制模拟悖论”。这些失败表明,世界模型辅助需要在抽象先验与基于推演的证据之间进行仲裁,而非无条件的生成或无条件的信任。

我们将此问题表述为受控的具体推理:给定一个初始观察和一个面向未来的问题,多模态大语言模型必须学会何时调用世界模型、如何验证由此产生的推演结果,以及在预测最终答案时应在多大程度上依赖该结果。外部世界模型提供候选的视觉未来状态,而多模态大语言模型则负责模拟选择、推演验证、推演依赖度以及答案预测。

为了评估这一设定,我们构建了两个互补的人工验证基准。VRQABench 针对迷宫、不规则迷宫和推箱子类谜题环境中的可控空间前瞻能力进行测试(Yang 等人,2025);OpenWorldQA 则针对真实世界视频中基于事前锚定帧的开放域物理预测进行测试。两者共同检验了在结构化空间环境和自然物理场景中,从静态初始条件出发进行未来预测的能力。

我们进一步提出了“特权未来在策略自蒸馏”(Privileged-Future On-Policy Self-Distillation, PF-OPSD),这是一个专为这些模拟控制决策量身定制的训练框架。在训练过程中,一个特权评估器仅作为教师端上下文观察真实未来视频和答案,对学生模型在策略的具体推理轨迹进行效用评分,并将基于优势加权的目标蒸馏回一个可部署的学生模型。在测试时,学生模型无法获取真实未来,必须自行决定何时进行模拟、验证、依赖或退回到抽象推理。

  • •

    我们将未来结果预测定义为受控的具体推理,其中多模态大语言模型学习何时调用世界模型推演、如何验证这些推演,以及在抽象推理之外应在多大程度上依赖它们。

  • •

    我们识别出“模拟惯性”和“强制模拟悖论”两种失效模式,它们揭示了单纯依赖世界模型的局限性。

  • •

    我们构建了两个人工验证的评估场景——VRQABench 和 OpenWorldQA,分别用于可控的空间前瞻预测以及基于初始观测的开放域物理未来预测。

  • •

    我们提出 PF-OPSD,该方法在训练期间利用特权未来上下文,将具体推理决策蒸馏到多模态大语言模型中,在两个基准上相比基线分别取得了 10.6% 和 10.9% 的性能提升。

2 相关工作

大语言模型通过思维链、自一致性、程序辅助推理以及智能体工具调用(Wei 等,2022;Wang 等,2023;Kojima 等,2022;Chen 等,2023;Yao 等,2023;Schick 等,2023)支持结构化推理和工具使用。多模态大语言模型将这些能力扩展到图文推理(Yin 等,2024;Yoon 等,2025;Bai 等,2025),而视觉与物理推理基准则研究组合式视觉问答、直觉物理和结果预测(Johnson 等,2025;Hudson 和 Manning,2019;Bakhtin 等,2019;Riochet 等,2018)。最近的视频模型可作为世界模型用于未来推演(Tong 等,2022;Drozdov 等,2024;Wiedemer 等,2025;Wan 等,2025;Team,2025;Yue 等,2025;Zhang 等,2025),但此类推演可能产生幻觉或偏离任务相关的几何结构(Luo 等,2025;Cao 等,2026;Qian 等,2026)。PF-OPSD 将这些推演视为有噪声的具体推理轨迹,并实例化蒸馏、特权信息和在策略学习(Hinton 等,2015;Vapnik 和 Vashist,2009;Schulman 等,2017)以用于模拟控制决策。完整相关工作见附录 C。

3 问题定义与基准

3.1 受控的具体推理

我们将世界模型辅助的未来预测定义为一个受控的具体推理问题。给定一张当前图像或事件前的锚定帧以及一个问题,智能体在预测未来结果答案时,可选择性地使用一个生成式世界模型。该世界模型通过候选的未来推演提供具体推理:当使用智能体编写的提示词调用时,它返回的是推演结果而非答案。真实未来视频仅用作特权训练信息,在测试时不可用。

策略生成的是具体推理轨迹,而非将其作为固定输入消耗。它首先判断是否需要模拟,

(1)

如果需要,则编写一个模拟提示词并接收推演结果:

(2)

同一策略随后要么验证并依赖该推演结果,要么在未使用模拟时退回到抽象推理:

(3)

此处,是推演验证决策,是推演依赖或抽象推理回退过程。目标是改进未来预测,同时避免来自错误模拟的负迁移以及对薄弱推演的不必要依赖。

Refer to caption
图 2:初步实证观察,展示了模拟惯性以及强制模拟悖论。面板 (a) 报告了在可选世界模型使用下的无调用概率,面板 (b) 比较了强制 Helios 模拟前后的准确率。

3.2 为何简单集成会失败

我们使用 Gemini-3-Flash Pichai 等人(2025)作为语言智能体、Helios Yuan 等人(2026)作为视频世界模型,对 VRQABench 进行了初步诊断。如图 2 所示,我们比较了可选世界模型使用与强制模拟,以隔离朴素世界模型附着的两个局限性。首先,可选工具使用会导致模拟惯性:即使提示词鼓励针对复杂空间推理进行模拟,智能体也常常依赖抽象推理,并不调用世界模型。其次,强制模拟会导致强制模拟悖论:为每个查询提供生成的展开结果并不一定能提高准确性,当展开结果在视觉上看似合理但与任务不符时,甚至可能损害性能。这些观察表明,核心问题不仅仅是获取更多未来视频,而是学习何时请求、信任、折扣或拒绝有噪声的展开结果。

媒体内容 · 前往原文查看
基准测试 类型 训练集 测试集 覆盖范围
VRQABench 谜题 4,000 636 5 个空间类别
OpenWorldQA 真实世界 3,904 500 12 个物理类别
表 1:两个基准测试分布的概览。所有示例均为基于初始图像或锚定帧的四选一问题;类别定义和划分细节见附录 D,构建提示词见附录 F。

3.3 基于静态观测的未来预测基准测试套件

我们针对相同的输入机制引入了两个四选一基准测试:模型仅观察初始状态,并必须回答关于后续结果的问题。VRQABench 在谜题环境中隔离了受规则约束的空间前瞻能力,而 OpenWorldQA 则测试了基于自然视频的开放域物理预测。未来帧从不作为基准测试输入的一部分;生成的展开结果(如果使用)是由智能体控制的可选具体推理输入。

VRQABench:基于初始谜题图像的可控空间前瞻能力。

VRQABench 基于 VR-Bench(Yang 等人,2025)构建,通过将迷宫、不规则迷宫和推箱子游戏的状态转化为多项选择的未来预测问题。针对每个谜题,我们首先利用确定性求解器从底层状态中推导出目标统计量:针对迷宫变体采用最短路径搜索和几何路径分析,针对推箱子任务采用推箱子搜索。随后,我们仅使用语言模型进行表层实现,即编写问题、生成合理的干扰项并筛选题目质量,从而确保标签在程序层面有据可依。经过自动筛选后,人工标注员会对每个保留题目进行视觉一致性、选项合理性和答案有效性的核查;未通过最终核查的题目将被剔除。完整的构建提示词见附录 F。

由此产生的基准测试包含 4,636 道经人工验证的题目,其中 4,000 个训练样本和 636 个评估样本。其类别涵盖转弯计数、转弯方向、推箱子步数、方向计数以及推箱子方向计数;详细的类别定义和数据集划分分布见附录 D。在涉及世界模型辅助的实验中,VRQABench 仅将基于 VR-Bench 微调的 Helios 世界模型(Yuan 等人,2026)用作外部推演生成器;被评估的模型仍接收初始图像、问题、选项以及任何被调用的推演结果。

OpenWorldQA:基于锚定帧预测现实世界的物理未来。

OpenWorldQA 使用短视频片段,但只向被评估模型展示结果出现前的锚定帧。我们通过一个五阶段智能体流程来构建该数据集。场景分析阶段选取包含足够初始条件线索但不揭示结果的锚定帧;问题设计阶段编写一到三步的物理预测问题;干扰项阶段生成局部合理的替代选项;小型模型探测阶段移除过于简单的问题;审核阶段验证答案正确性、锚定帧有效性、干扰项合理性、视觉一致性以及类别对齐。每个通过筛选的样本随后进入人工验证环节,标注员检查锚定帧是否支持预测、未来结果是否明确、答案与选项在物理上是否合理;不合格样本被过滤掉。各阶段的详细提示词见附录F。

最终构建的基准测试包含4,404道经人工验证的四选一选择题,其中3,904个训练样本和500道平衡测试题。该基准涵盖12个物理推理类别和6种问题形式,包括顺序、计数、首次接触、中间状态、失败和反事实问题;附录D给出了完整的类别分类和划分分布。表1总结了基准测试的分布情况。

4 基于PF-OPSD的受控具体推理

图3展示了PF-OPSD的整体流程。核心难点不在于访问世界模型,而在于如何控制不确定的推演结果用于具体推理。给定输入后,我们定义诱导轨迹分布如下:

(4)

此处,包含控制动作和最终答案,是动作前的历史记录,仅采样候选未来状态。在我们的实验中,由Helios(Yuan等人,2026)实例化:VRQABench使用基于VR-Bench微调的Helios模型,而OpenWorldQA使用通用Helios模型。

PF-OPSD 利用非对称信息训练这个可部署的学生策略。在训练阶段,一个特权评估器以教师端上下文的形式观察真实未来与答案,并用它们来为学生生成的候选具体推理轨迹打分。在推理阶段,这些信息被移除;学生仅接收来自 的 和可选的展开结果。学习问题是

(5)

因此,特权的未来与答案仅用于为学生自身的轨迹构建训练目标,而非作为测试时的输入。

Refer to caption
图 3:推理阶段受控的具体推理。学生多模态大语言模型首先判断抽象推理是否足够。如果需要模拟,它会编写一个模拟提示词 ,向世界模型查询一个候选展开结果 ,验证该展开结果,并决定在多大程度上将其与抽象推理结合使用。被拒绝的展开结果会触发提示词重试,最多进行三次模拟尝试;一旦达到每个样本的上限,策略会在预测 之前,以其当前的展开结果依赖状态继续执行。

4.1 策略轨迹与动作空间

给定一个观察 和一个问题 ,学生策略会生成一个具体推理轨迹,而不是将展开结果作为固定输入来消费。在不进行模拟的情况下,该轨迹为

(6)

当调用模拟时,轨迹包含一个有界的模拟尝试序列:

(7)

其中 且 。每次尝试会编写一个提示词 ,接收 ,并预测 。令 表示 。尝试次数由以下公式决定

(8)

该轨迹的完整概率遵循开篇的乘积形式,每个控制动作对应一个策略因子,每个被查询的展开结果对应一个世界模型因子。

动作空间暴露了五个控制决策:

  • •

    模拟决策。 决定来自展开结果的具体推理是否可能有用。

  • •

    模拟查询。 指定与第 次尝试中任务相关的对象、路径、接触点或事件变化。

  • •

    展开结果验证。 判断展开结果是否一致、合理且与问题相关。

  • •

    展开结果依赖度。 说明一个被接受、不确定或被拒绝的展开结果应如何使用、折减或覆盖。

  • •

    答案预测。 是最终的选择。

这一轨迹使失败点变得明确:模型可能未能充分利用有用的模拟、接受误导性的推演,或过度依赖薄弱的推演。

4.2 两阶段训练

PF-OPSD 将格式学习与效用校准分离开来。第一阶段教学生模型生成有效的具体推理轨迹。第二阶段利用教师侧评估器对这些轨迹进行校准,该评估器仅在训练期间能看到特权未来信息。

第一阶段:协议监督微调。

我们使用来自 Gemini-3.1-Pro + Agent 工作流(Pichai 等人,2025)的协议监督来初始化学生模型。对于每个训练样本,该工作流观察图像或锚定帧、问题、选项、真实答案以及训练时的未来视频作为教师上下文,并生成一个结构化的轨迹,涵盖 、、、、 等元素。我们仅保留通过规则检查、答案一致性检查以及审查式过滤的轨迹。此阶段固定了输出协议;该工作流在 PF-OPSD 自蒸馏或测试时推理中不再使用。

第二阶段:基于特权未来的在线策略自蒸馏。

第二阶段校准当前学生模型生成的决策。对于每个训练样本,学生模型首先在学生视角上下文 下生成一个基础轨迹,该上下文排除了真实未来和答案 。在每个带有前缀 的决策节点处,我们构建一个候选集 。离散节点使用有效动作集,包括 、、 等。文本节点(包括 和 )则使用当前策略的采样结果。

每个候选动作在节点 处被强制执行,之后剩余轨迹以贪心方式补全为 。特权评估器随后接收 并分配一个教师侧分数。在我们的实现中, 由 Qwen3.6-27B 实例化,这是一个原生多模态模型,仅在训练期间观察生成的推演和真实未来视频。具体而言, 利用 判断最终答案的正确性,并利用 判断已接受的推演是否与实际未来一致且对问题有用:

(9)

这些标签是基于评估器生成的训练信号,而非人工标注的真值;其操作化定义见附录表4。评估器还提供教师视角下的偏好。我们设定并计算,其中

(10)

这种在线策略设计探讨的是哪些备选方案能改善学生自身的行为,而非模仿一个固定的特权轨迹。附录B给出了具体流程形式。

4.3 优势加权蒸馏目标

特权优势定义了学生视角的目标。对于离散节点,我们构建

(11)

学生模型最小化

(12)

其中排除和。对于文本节点,我们将特权优势转化为归一化的候选权重,并优化加权对数似然:

(13)
(14)

结合离散节点的KL散度目标和文本节点的加权似然,得到优势蒸馏损失:

(15)

完整的训练目标还包括协议SFT和模拟调用惩罚:

(16)

与GRPO(Shao等人,2024)等结果层面的强化学习不同,PF-OPSD将信用分配至中间的具体推理决策,例如是否进行模拟、是否拒绝幻觉式的推演结果、以及是否依赖抽象推理。

4.4 推理

在测试时,和协议生成工作流均被移除。部署时采用学习到的模拟控制策略,仅使用学生视角的状态和每个样本的硬性重试上限:

(17)

第一个动作控制模拟的开关:

(18)

如果,策略通过抽象推理作答。否则,每次尝试采样或解码,查询,并预测。重试门控为

(19)

因此,被拒绝或不确定的推演结果仅在达到每个样本上限之前触发新一轮提示。在停止于后,模型形成依赖状态

(20)

这种形式使得推理成为一个闭环策略,涵盖模拟选择、推演验证、重试、推演依赖和作答。世界模型仍然是一个可能出错的具体推理来源:被拒绝的推演结果不会被机械地丢弃,而是在没有可接受的推演结果时,通过进行折扣处理。

5 实验

5.1 实验设置

我们在第3节介绍的两个未来预测基准——VRQABench和OpenWorldQA上评估了PF-OPSD。除非另有说明,学生模型为Qwen3.5-9B(Qwen团队,2026a);外部世界模型为Helios(Yuan等人,2026),其中VRQABench使用经过VR-Bench微调的Helios模型,OpenWorldQA使用通用Helios模型;协议轨迹由特权Gemini-3.1-Pro + 智能体教师(Pichai等人,2025)离线生成。我们采用第一阶段协议SFT训练,随后进行第二阶段PF-OPSD自蒸馏,并使用准确率、模拟决策质量和展开验证指标,与零样本/无模拟MLLM、基于Qwen的训练基线以及我们的工作流智能体提示基线进行评估。详细的数据集划分、主干网络/世界模型选择、优化超参数、推理协议、基线定义和指标实现见附录A;数据集类别分类和分布见附录D。

5.2 主要结果

表2总结了基准测试结果。PF-OPSD在两个基准上均取得了最佳准确率(VRQABench为72.4%,OpenWorldQA为70.5%),相比SFT和SFT+GRPO均有提升。SFT基线本身已是一个学习型控制器基线,因为它在包含模拟决策、模拟提示词、展开验证、展开依赖和最终答案的结构化轨迹上进行了训练。带有提示词级别Helios访问权限但未经PF-OPSD训练的提示词工作流智能体基线,其表现甚至不如纯图像监督模型,这表明仅靠世界模型访问权限,而没有学习到的模拟选择和展开验证,是不够的。这些提升在两个基准设计上保持一致,而非由单一数据集驱动:相对于SFT,PF-OPSD在VRQABench上提升了10.6个百分点,在OpenWorldQA上提升了10.9个百分点。这表明学习型控制器不仅仅是增加了世界模型的使用频率,而是学会了判断何时展开可能有用,以及何时应拒绝或降低其权重。

媒体内容 · 前往原文查看
模型/方法 VRQABench OpenWorldQA
零样本/无模拟基线
Gemini-3-Flash(Pichai等人,2025) 45.9% 48.2%
GPT-5.4(OpenAI,2026) 43.2% 53.4%
HY3 腾讯 HY(2026) 38.2% 35.0%
Qwen3.6-27B 通义千问团队(2026b) 33.0% 41.4%
Qwen3.5-9B 通义千问团队(2026a) 33.2% 39.8%
Qwen2.5-VL-7B Bai 等人(2025) 32.7% 14.2%
工作流智能体基线
工作流智能体(Qwen3.5-9B) 32.6% 38.6%
工作流智能体(Gemini-3-Flash) 47.2% 49.5%
Qwen3.5-9B 训练基线
SFT 通义千问团队(2026a) 61.8% 59.6%
GRPO Shao 等人(2024) 63.5% 61.2%
PF-OPSD 72.4% 70.5%
表 2:两个基准测试的整体准确率。完整的分类别结果见附录中的表 8 和表 9。

5.3 消融实验

表 3 展示了 PF-OPSD 各组件的贡献。SFT 移除了第二阶段的自蒸馏,但保留了相同的结构化推理链监督,因此它充当了学习型控制器的冷启动。对所有样本强制进行模拟会使模型暴露于不必要的噪声 rollout 中。移除 rollout 验证或依赖会削弱模型评估和平衡具体证据的能力,而移除优势加权则会使训练退化为未经校准的教师视角模仿。仅答案蒸馏进一步表明,仅监督最终答案是不够的。总体而言,性能提升来自于对中间具体推理动作进行效用校准的监督,尤其是 rollout 验证和优势加权,而非仅仅添加生成的视频。

媒体内容 · 前往原文查看
变体 VRQA OWQA 调用率 调用次数
PF-OPSD 72.4% 70.5% 42.5% 0.45
无模拟决策 68.5% 67.2% 100% 1.00
无 Rollout 验证 65.2% 64.8% 42.5% 0.45
无 Rollout 依赖 67.8% 66.5% 42.5% 0.45
无优势加权 66.4% 65.2% 45.2% 0.48
仅答案蒸馏 64.5% 63.8% 35.4% 0.38
SFT 61.8% 59.6% 23.0% 0.23
表 3:训练机制和具体推理节点的消融实验结果。调用率表示触发世界模型模拟的样本百分比,调用次数表示每个样本的平均模拟调用次数。

5.4 跨世界模型诊断

我们通过将默认的 Helios 生成器替换为 Wan 2.2 进行推理时测试跨世界模型迁移,同时保持学生策略和提示词不变。图 4 将 PF-OPSD 与“始终模拟(无门控)”变体进行了比较,后者保留了训练好的策略,但强制对每个示例进行一次世界模型查询。Wan 2.2 的准确率略高,但速度明显更慢,因此我们仅将其用作诊断性 rollout 生成器。其性能提升证实了更强的世界模型能够提供更好的具体证据,但使用 Wan 2.2 的始终模拟变体仍然落后于使用 Helios 的 PF-OPSD,这表明世界模型质量并不能替代学习到的模拟控制。

Refer to caption
图 4:跨世界模型诊断。将 Helios 替换为 Wan 2.2 后,始终模拟变体和 PF-OPSD 均得到提升,而 PF-OPSD 在使用更强 rollout 生成器的情况下仍优于始终模拟。

5.5 模拟决策分析

Refer to caption
图 5:模拟决策质量。PF-OPSD 将整体调用率保持在远低于始终模拟的水平,同时增加了对 OWQA 困难样本的调用,并保持了与特权评估器派生的模拟辅助标签的高度一致性。“减少”表示相对于始终模拟策略所避免的不必要模拟调用比例,而非调用率的补集。
Refer to caption
图 6:PF-OPSD 下的实际模拟深度与性能。Attempts 表示策略为某个示例实际选择的世界模型调用次数,而非外部强加的全局约束。图 (a) 中尝试次数为一到三次的行相加得到学习到的调用率;图 (b) 显示重复重试对应的是准确率更低、误判率更高的困难样本。

图 5 评估了模拟选择,使用的指标包括调用率、与基于特权评估器得出的“模拟有帮助”标签的一致性,以及相对于始终模拟策略所避免的调用次数;详细的子集结果见附录表 5。PF-OPSD 会选择性地调用世界模型,对于动态或空间要求较高的样本调用更频繁,而在静态线索足够时则避免调用。图 6 进一步分解了实际的模拟尝试次数。整体行为与表 3 一致:42.5% 的样本调用了模拟,平均每个样本调用 0.45 次。多次尝试的情况对应于更困难的样本,其中早期的 rollout 被拒绝或结果不确定,导致准确率较低且误判率较高。

5.6 Rollout 验证分析

图 7 总结了在受控的 rollout 质量条件下,PF-OPSD 是否决定信任生成的 rollout。该模型以高比率接受高质量的 rollout,同时大幅降低对损坏、冲突、不完整或物理不一致的 rollout 的接受率。完整的诊断表,包括验证精度、召回率、误接受率、误拒绝率以及最终准确率,见附录表 6。图 8 将这些受控条件压缩为 rollout 质量严重性诊断。随着 rollout 质量从经过验证的有用未来状态退化到不完整、错误但看似合理以及严重损坏的 rollout,PF-OPSD 的接受率从 92.5% 降至 5.2%。最终准确率是优雅地下降而非崩溃,这表明该策略能够忽略不可靠的具体证据,并退回到抽象推理。

Refer to caption
图 7:在受控的 rollout 质量条件下的 rollout 验证行为。接受率衡量 PF-OPSD 信任生成 rollout 的频率,而误接受和误拒绝分别衡量错误接受误导性 rollout 和错误拒绝有用 rollout 的情况。使用断裂的 y 轴仅是为了提高低频错误的可见性,每个柱形上标注了精确数值。
Refer to caption
图 8:展开质量严重性诊断。当生成的未来状态变得不太有用或更具冲突性时,PF-OPSD 会急剧降低展开接受度,同时在具有误导性的展开下保持未崩溃的最终准确率。

5.7 展开依赖与冲突分析

图 9 总结了具有代表性的诊断子集,其中抽象推理与展开相互冲突或互为补充。该图可视化了模型是遵循展开、拒绝展开,还是将其与静态线索结合使用;完整的子集级表格(包括最终准确率和恢复率)见附录表 7。PF-OPSD 的目标并非始终信任模拟。相反,模型应在展开能提供纠正性的具体推理时使用它们,在展开具有误导性时拒绝它们,并在两种信息来源互为补充时将展开与静态线索结合使用。结果表明,当抽象推理错误但展开正确时,模型能纠正许多错误;而当静态线索更强时,模型通常会拒绝产生幻觉或具有误导性的展开。

Refer to caption
图 9:具有代表性的冲突解决行为。PF-OPSD 在展开能纠正抽象推理时遵循它,拒绝具有误导性或产生幻觉的展开,并在两种信息来源互为补充时将展开与静态线索结合使用。

6 结论

我们研究了基于当前图像或事件前锚定帧的多模态未来结果预测,并将世界模型辅助定位为受控的具体推理,而非天真的世界模型依附。为了评估这一设定,我们引入了经人工验证的 VRQABench 和 OpenWorldQA,涵盖可控空间规划与开放域物理预测。我们进一步提出了 PF-OPSD,该方法利用训练时的未来视频和答案作为特权教师端上下文,以校准模拟、展开验证、展开依赖和答案决策。实验表明,该方法在准确率上有所提升,并且对噪声或冲突性展开具有更强的鲁棒性。

局限性

本工作聚焦于基于图像条件的未来预测,并可选地结合生成式世界模型的具体推理。其结论最直接适用于世界模型能够生成至少部分与给定场景和问题相关的未来场景。当生成的展开轨迹与输入对齐不佳时,PF-OPSD 旨在减少对其不必要的依赖,而非替代世界模型质量的改进。

我们的实验涵盖了两个互补的基准测试和一个具体的世界模型接口,但并未穷尽所有形式的物理推理或所有可能的世界模型设计。更专业的领域、更长的时间跨度以及交互式环境可能需要额外的基准覆盖范围和特定于任务的提示词策略。

最后,PF-OPSD 仅在训练期间使用特权未来视频来估计动作效用。这使得部署的策略无需依赖真实未来输入,同时使该方法依赖于训练时特权信号的可用性和对齐性。将该框架扩展到更弱或更隐式的未来监督形式是未来工作的一个有前景的方向。

参考文献

  • M. Assran, Q. Duval, I. Misra, P. Bojanowski, P. Vincent, M. G. Rabbat, Y. LeCun, 和 N. Ballas (2023) 基于联合嵌入预测架构的图像自监督学习。收录于:IEEE/CVF 计算机视觉与模式识别会议,CVPR 2023,加拿大温哥华,2023年6月17-24日,第15619–15629页。外部链接:链接,文献标识符。引用自:§C.2。
  • S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, W. Ge, Z. Guo, Q. Huang, J. Huang, F. Huang, B. Hui, S. Jiang, Z. Li, M. Li, M. Li, K. Li, Z. Lin, J. Lin, X. Liu, J. Liu, C. Liu, Y. Liu, D. Liu, S. Liu, D. Lu, R. Luo, C. Lv, R. Men, L. Meng, X. Ren, X. Ren, S. Song, Y. Sun, J. Tang, J. Tu, J. Wan, P. Wang, P. Wang, Q. Wang, Y. Wang, T. Xie, Y. Xu, H. Xu, J. Xu, Z. Yang, M. Yang, J. Yang, A. Yang, B. Yu, F. Zhang, H. Zhang, X. Zhang, B. Zheng, H. Zhong, J. Zhou, F. Zhou, J. Zhou, Y. Zhu, and K. Zhu (2025) Qwen3-VL 技术报告。arXiv 预印本,编号 2511.21631。外部链接:Link, Document, 2511.21631。被表 8、表 9、§C.1、§1、§2、表 2 引用。
  • A. Bakhtin, L. van der Maaten, J. Johnson, L. Gustafson, and R. B. Girshick (2019) PHYRE:一个用于物理推理的新基准。收录于《神经信息处理系统进展 32:2019 年神经信息处理系统年度会议,NeurIPS 2019,2019 年 12 月 8-14 日,加拿大温哥华》,H. M. Wallach, H. Larochelle, A. Beygelzimer, F. d’Alché-Buc, E. B. Fox, and R. Garnett 编,第 5083–5094 页。被 §C.2、§2 引用。
  • Y. Bisk, A. Holtzman, J. Thomason, J. Andreas, Y. Bengio, J. Chai, M. Lapata, A. Lazaridou, J. May, A. Nisnevich, N. Pinto, and J. P. Turian (2020) 经验为语言奠定基础。收录于《2020 年自然语言处理实证方法会议论文集,EMNLP 2020,在线,2020 年 11 月 16-20 日》,B. Webber, T. Cohn, Y. He, and Y. Liu 编,第 8718–8735 页。外部链接:Link, Document。被 §C.1 引用。
  • Y. Cao, Y. Zhong, Z. Zeng, L. Zheng, J. Huang, H. Qiu, P. Shi, W. Mao, and W. Guanglu (2026) MobileDreamer:面向 GUI 智能体的生成式草图世界模型。arXiv 预印本,编号 2601.04035。被 §C.3、§2 引用。
  • W. Chen, X. Ma, X. Wang, and W. W. Cohen (2023) 思维程序提示:为数值推理任务分离计算与推理。《机器学习汇刊》2023 年卷。外部链接:Link。被 §C.1、§2 引用。
  • K. Drozdov、R. Shwartz-Ziv 和 Y. LeCun(2024)《基于联合嵌入预测架构的视频表示学习》。arXiv 预印本 abs/2412.10925。外部链接:链接,文档,2412.10925。引用自:§C.3,§2。
  • G. Gendron、Q. Bao、M. Witbrock 和 G. Dobbie(2024)《大语言模型并非强大的抽象推理者》。收录于《第三十三届国际人工智能联合会议论文集》,IJCAI 2024,韩国济州岛,2024年8月3日至9日,第6270–6278页。外部链接:链接。引用自:§C.1。
  • G. Hinton、O. Vinyals 和 J. Dean(2015)《神经网络中的知识蒸馏》。arXiv 预印本 arXiv:1503.02531。引用自:§C.4,§2。
  • D. A. Hudson 和 C. D. Manning(2018)《面向机器推理的组合注意力网络》。收录于《第六届国际学习表征会议》,ICLR 2018,加拿大不列颠哥伦比亚省温哥华,2018年4月30日至5月3日,会议论文集。外部链接:链接。引用自:§C.2。
  • D. A. Hudson 和 C. D. Manning(2019)《GQA:面向真实世界视觉推理与组合式问答的新数据集》。收录于《IEEE 计算机视觉与模式识别会议》,CVPR 2019,美国加利福尼亚州长滩,2019年6月16日至20日,第6700–6709页。外部链接:文档。引用自:§C.2,§2。
  • J. Johnson、B. Hariharan、L. van der Maaten、F. Li、C. L. Zitnick 和 R. B. Girshick(2025)《CLEVR:面向组合语言与基础视觉推理的诊断性数据集(版本1)》。Zenodo。注:https://doi.org/10.5281/zenodo.14936905。外部链接:链接,文档。引用自:§C.2,§2。
  • T. Kojima、S. S. Gu、M. Reid、Y. Matsuo 和 Y. Iwasawa(2022)《大语言模型是零样本推理者》。收录于《第三十五届神经信息处理系统大会年度会议》,NeurIPS 2022,美国路易斯安那州新奥尔良,2022年11月28日至12月9日,S. Koyejo、S. Mohamed、A. Agarwal、D. Belgrave、K. Cho 和 A. Oh 编。引用自:§C.1,§2。
  • D. Luo、B. Tang、K. Li、G. Papoudakis、J. Song、S. Gong、J. Hao、J. Wang 和 K. Shao(2025)《ViMo:面向应用智能体的生成式视觉 GUI 世界模型》。arXiv 预印本 arXiv:2504.13936。引用自:§C.3,§2。
  • OpenAI(2026)推出 gpt-5.4。注:https://openai.com/zh-Hans-CN/index/introducing-gpt-5-4/ 访问日期:2026-05-25 引用自:表 8、表 9、表 2。
  • M. Oquab, T. Darcet, T. Moutakanni, H. V. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby, M. Assran, N. Ballas, W. Galuba, R. Howes, P. Huang, S. Li, I. Misra, M. Rabbat, V. Sharma, G. Synnaeve, H. Xu, H. Jégou, J. Mairal, P. Labatut, A. Joulin, and P. Bojanowski(2024)DINOv2:无需监督学习鲁棒视觉特征。机器学习研究汇刊,2024。外部链接:链接 引用自:§C.2。
  • E. Perez, F. Strub, H. de Vries, V. Dumoulin, and A. C. Courville(2018)FiLM:基于通用条件层的视觉推理。载于第三十二届 AAAI 人工智能大会论文集(AAAI-18)、第三十届人工智能创新应用会议(IAAI-18)及第八届 AAAI 人工智能教育进展研讨会(EAAI-18),美国路易斯安那州新奥尔良,2018年2月2-7日,S. A. McIlraith 与 K. Q. Weinberger 编,第3942–3951页。外部链接:链接,文献标识码:Document 引用自:§C.2。
  • S. Pichai, D. Hassabis, and K. Kavukcuoglu(2025)Gemini 3:智能的新纪元。引用自:附录 A、表 8、表 9、§3.2、§4.2、§5.1、表 2。
  • C. Qian, E. C. Acikgoz, B. Li, X. Chen, Y. Zhang, B. He, Q. Luo, D. Hakkani-Tür, G. Tur, Y. Li, 等(2026)当前智能体未能利用世界模型作为前瞻工具。arXiv 预印本 arXiv:2601.03905。引用自:§C.3、§1、§2。
  • Qwen 团队(2026a)Qwen3.5:迈向原生多模态智能体。外部链接:链接 引用自:附录 A、表 10、表 8、表 8、表 9、表 9、§5.1、表 2、表 2。
  • Qwen 团队(2026b)Qwen3.6-27B:27B 密集模型中的旗舰级编程能力。外部链接:链接 引用自:表 8、表 9、表 2。
  • R. Riochet, M. Y. Castro, M. Bernard, A. Lerer, R. Fergus, V. Izard, and E. Dupoux(2018)IntPhys:视觉直觉物理推理的框架与基准。arXiv 预印本 abs/1803.07616。外部链接:链接,1803.07616 引用自:§C.2、§2。
  • A. Santoro、D. Raposo、D. G. T. Barrett、M. Malinowski、R. Pascanu、P. W. Battaglia 和 T. Lillicrap(2017)《用于关系推理的简单神经网络模块》。收录于《神经信息处理系统进展 30:2017 年神经信息处理系统年度会议,2017 年 12 月 4-9 日,美国加利福尼亚州长滩》,I. Guyon、U. von Luxburg、S. Bengio、H. M. Wallach、R. Fergus、S. V. N. Vishwanathan 和 R. Garnett 编,第 4967–4976 页。引用于:§C.2。
  • T. Schick、J. Dwivedi-Yu、R. Dessì、R. Raileanu、M. Lomeli、E. Hambro、L. Zettlemoyer、N. Cancedda 和 T. Scialom(2023)《Toolformer:语言模型可以自学使用工具》。收录于《神经信息处理系统进展 36:2023 年神经信息处理系统年度会议,NeurIPS 2023,2023 年 12 月 10-16 日,美国路易斯安那州新奥尔良》,A. Oh、T. Naumann、A. Globerson、K. Saenko、M. Hardt 和 S. Levine 编。引用于:§C.1、§2。
  • J. Schulman、F. Wolski、P. Dhariwal、A. Radford 和 O. Klimov(2017)《近端策略优化算法》。arXiv 预印本 arXiv:1707.06347。引用于:§C.4、§2。
  • Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等(2024)《Deepseekmath:推动开放语言模型数学推理的极限》。arXiv 预印本 arXiv:2402.03300。引用于:附录 A、表 10、表 8、表 9、§4.3、表 2。
  • W. Tao、Y. Zhou、Y. Wang、W. Zhang、H. Zhang 和 Y. Cheng(2024)《Magis:基于大语言模型的多智能体框架用于 GitHub 问题解决》。《神经信息处理系统进展》37,第 51963–51993 页。引用于:§C.1。
  • T. H. F. M. Team(2025)《HunyuanVideo 1.5 技术报告》。arXiv 预印本 abs/2511.18870。外部链接:链接,文档,2511.18870。引用于:§C.3、§1、§2。
  • 腾讯 HY(2026)《HY3 预览》。注:https://hy.tencent.com/research/hy3。访问日期:2026-05-25。引用于:表 8、表 9、表 2。
  • Z. Tong、Y. Song、J. Wang 和 L. Wang(2022)《VideoMAE:掩码自编码器作为自监督视频预训练的数据高效学习器》。载于《神经信息处理系统进展》第35卷:2022年神经信息处理系统年度大会(NeurIPS 2022),美国路易斯安那州新奥尔良,2022年11月28日至12月9日,S. Koyejo、S. Mohamed、A. Agarwal、D. Belgrave、K. Cho 和 A. Oh 编。引用于:§C.3、§2。
  • V. Vapnik 和 A. Vashist(2009)《一种新的学习范式:利用特权信息进行学习》。《神经网络》第22卷第5-6期,第544–557页。引用于:§C.4、§2。
  • T. Wan、A. Wang、B. Ai、B. Wen、C. Mao、C. Xie、D. Chen、F. Yu、H. Zhao、J. Yang、J. Zeng、J. Wang、J. Zhang、J. Zhou、J. Wang、J. Chen、K. Zhu、K. Zhao、K. Yan、L. Huang、M. Feng、N. Zhang、P. Li、P. Wu、R. Chu、R. Feng、S. Zhang、S. Sun、T. Fang、T. Wang、T. Gui、T. Weng、T. Shen、W. Lin、W. Wang、W. Wang、W. Zhou、W. Wang、W. Shen、W. Yu、X. Shi、X. Huang、X. Xu、Y. Kou、Y. Lv、Y. Li、Y. Liu、Y. Wang、Y. Zhang、Y. Huang、Y. Li、Y. Wu、Y. Liu、Y. Pan、Y. Zheng、Y. Hong、Y. Shi、Y. Feng、Z. Jiang、Z. Han、Z. Wu 和 Z. Liu(2025)《Wan:开放且先进的大规模视频生成模型》。arXiv 预印本 arXiv:2503.20314。引用于:§C.3、§1、§2。
  • X. Wang、J. Wei、D. Schuurmans、Q. V. Le、E. H. Chi、S. Narang、A. Chowdhery 和 D. Zhou(2023)《自一致性提升语言模型中的思维链推理》。载于第十一届国际学习表征大会(ICLR 2023),卢旺达基加利,2023年5月1日至5日。外部链接:链接。引用于:§C.1、§2。
  • J. Wei、X. Wang、D. Schuurmans、M. Bosma、B. Ichter、F. Xia、E. H. Chi、Q. V. Le 和 D. Zhou(2022)《思维链提示激发大语言模型中的推理能力》。载于《神经信息处理系统进展》第35卷:2022年神经信息处理系统年度大会(NeurIPS 2022),美国路易斯安那州新奥尔良,2022年11月28日至12月9日,S. Koyejo、S. Mohamed、A. Agarwal、D. Belgrave、K. Cho 和 A. Oh 编。引用于:§C.1、§2。
  • T. Wiedemer、Y. Li、P. Vicol、S. S. Gu、N. Matarese、K. Swersky、B. Kim、P. Jaini 和 R. Geirhos(2025)《视频模型是零样本学习者和推理者》。arXiv 预印本 abs/2509.20328。外部链接:链接,文献,2509.20328 引用自:§C.3,§2。
  • C. Yang、H. Wan、Y. Peng、X. Chen、Z. Yu、J. Zhang、J. Yu、X. Yu、X. Zheng、D. Zhou 和 C. Wu(2025)《通过视频进行推理:通过迷宫求解任务对视频模型推理能力的首次评估》。arXiv 预印本 abs/2511.15065。外部链接:链接,文献,2511.15065 引用自:§C.2,§1,§3.3。
  • S. Yao、J. Zhao、D. Yu、N. Du、I. Shafran、K. R. Narasimhan 和 Y. Cao(2023)《ReAct:协同语言模型中的推理与行动》。载于第十一届国际学习表征大会,ICLR 2023,卢旺达基加利,2023年5月1日至5日。外部链接:链接 引用自:§C.1,§2。
  • S. Yin、C. Fu、S. Zhao、K. Li、X. Sun、T. Xu 和 E. Chen(2024)《多模态大语言模型综述》。国家科学评论 11 (12),页码 nwae403。ISSN 2095-5138,文献,链接 引用自:§C.1,§1,§2。
  • H. Yoon、J. Jung、J. Kim、H. Choi、H. Shin、S. Lim、H. An、C. Kim、J. Han、D. Kim、C. Eom、S. Hong 和 S. Kim(2025)《多模态大语言模型的视觉表征对齐》。arXiv 预印本 abs/2509.07979。外部链接:链接,文献,2509.07979 引用自:§C.1,§1,§2。
  • S. Yuan、Y. Yin、Z. Li、X. Huang、X. Yang 和 L. Yuan(2026)《Helios:真正的实时长视频生成模型》。arXiv 预印本 arXiv:2603.04379。引用自:附录 A,§1,§3.2,§3.3,§4,§5.1。
  • J. Yue、Z. Huang、Z. Chen、X. Wang、P. Wan 和 Z. Liu(2025)《用人工智能模拟视觉世界:路线图》。arXiv 预印本 abs/2511.08585。外部链接:链接,文献,2511.08585 引用自:§C.3,§1,§1,§2。
  • X. Zhang、C. Ma、Y. Huang、W. Huang、S. Qi、S. Zhu、X. Feng 和 Y. Yang(2025)《世界模型应优先统一物理与社会动力学》。arXiv 预印本 abs/2510.21219。外部链接:链接,文献,2510.21219 引用自:§C.3,§1,§1,§2。
  • S. Zhao、Z. Xie、M. Liu、J. Huang、G. Pang、F. Chen 与 A. Grover(2026)《自蒸馏推理器:面向大语言模型的在线策略自蒸馏》。arXiv 预印本 arXiv:2601.18734。外部链接:Link。附录 A 引用。
  • Y. Zhou、X. Geng、T. Shen、C. Tao、G. Long、J. Lou 与 J. Shen(2023)《思维线程:解开混乱语境》。arXiv 预印本 arXiv:2311.08734。§C.1 引用。
  • Y. Zhou、X. Li、Q. Wang 与 J. Shen(2024)《面向大型视觉语言模型的视觉上下文学习》。载于《计算语言学协会发现:ACL 2024》,第 15890–15902 页。§C.1 引用。

附录 A 详细实验设置

数据集与划分。

所有训练与评估均使用第 3 节介绍的划分:VRQABench 提供 5 个空间类别的 4,000 道训练谜题和 636 道评估谜题,OpenWorldQA 提供 12 个物理类别的 3,904 个训练锚帧问题和 500 个评估锚帧问题。两个数据集均先由自动评审器筛选,再逐项人工验证;保留的样本必须包含有效的初始观测、唯一答案、合理的干扰项,且未明显泄露未来结果。第一阶段协议 SFT 与第二阶段 PF-OPSD 自蒸馏在合并后的两个训练划分上运行;所有报告数值均基于保留的评估划分计算,这些划分在训练期间从未被模型见过。详细的类别分类体系及各划分分布见附录 D。

骨干网络、世界模型与协议教师。

除非另有说明,学生 MLLM 为 Qwen3.5-9B(Qwen 团队,2026a);外部世界模型为 Helios(Yuan 等人,2026)。我们在 VRQABench 上使用经过 VR-Bench 微调的 Helios 模型,在 OpenWorldQA 上使用通用 Helios 模型;两种情况下,仅在策略输出 时才查询 Helios。第一阶段协议轨迹由 Gemini-3.1-Pro + 智能体工作流(Pichai 等人,2025)生成,该工作流将特权未来视频作为教师端上下文;此工作流仅用于离线数据生成,在 PF-OPSD 训练或测试期间不会被调用。

训练。

遵循 OPSD Zhao 等人(2026)中报告的紧凑型后训练配置,我们仅在学生多模态大语言模型上调整 LoRA 适配器,其秩、缩放因子以及目标模块为 q_proj、k_proj、v_proj、o_proj、gate_proj、up_proj 和 down_proj;视觉编码器和外部世界模型保持冻结。两个阶段均使用 AdamW 优化器,学习率、有效批量大小 32、bfloat16 精度、梯度检查点和 FlashAttention-2。第一阶段 SFT 在过滤后的协议轨迹上优化一个周期,最大序列长度为 16k。第二阶段 PF-OPSD 运行 100 个策略内更新步骤并进行优化。除非另有说明,我们使用、、优势温度 以及文本节点处的候选样本;文本候选样本以温度 1.1 采样,强制 rollout 以贪婪方式完成。所有可训练的基于 Qwen 的基线均使用相同的优化器和适配器设置,仅改变训练目标。

推理。

在测试时,学生模型仅接收图像(或锚定帧)、问题和选项;特权未来信息、答案和协议教师被移除。策略根据第 4 节的推理目标,在硬性每示例模拟上限 下,解码出一个结构化的轨迹。离散控制节点的解码是确定性的(贪婪),文本节点则使用低温度。

基线。

我们与三类方法进行比较,这些方法涵盖了受控集成的自然替代方案:(i)零样本/无模拟多模态大语言模型,包括闭源参考模型如 Gemini-3-Flash、GPT-5.4 和 HY3,以及直接从图像和问题回答的 Qwen 系列多模态大语言模型;(ii)基于 Qwen 的训练基线,包括在相同主干网络和数据上进行的 SFT 和 SFT+GRPO Shao 等人(2024);以及(iii)工作流智能体基线,其中 Qwen3.5-9B 或 Gemini-3-Flash 被赋予提示级别的 Helios rollout 访问权限,但未接受 PF-OPSD 训练。SFT 在与 PF-OPSD 相同的结构化轨迹格式上进行训练,但没有进行策略内特权效用校准。

评估指标。

我们报告了以下指标:(1)两个基准测试的整体及按类别划分的多选题准确率;(2)每个样本的平均模拟调用次数及调用率;(3)通过调用精确率、召回率和 F1 值衡量的决策质量,其依据是特权评估器得出的“模拟有帮助”标签;(4)在受控的展开质量条件下,展开验证的精确率、召回率以及误接受率和误拒绝率。除非另有说明,所有数值均在固定的评估集划分上计算得出。

特权评估器得出的标签。

表 4 总结了由特权评估器生成的操作性标签。这些标签是通过将生成的展开结果与使用 Qwen3.6-27B 得到的真实未来结果进行比较而得出的;它们并非人工标注。

媒体内容 · 前往原文查看
标签 操作性定义
有用展开 评估器判定生成的展开结果与任务相关的未来结果一致,并且对回答 具有信息量。
误接受 学生模型接受了评估器标记为与 不一致或对回答 无用的展开结果。
误拒绝 学生模型拒绝了评估器标记为与 一致且对回答 有用的展开结果。
模拟有帮助 一个诊断性标签,表示展开证据能够纠正或实质性支持最终答案。
表 4:特权评估器得出的标签的操作性定义。
媒体内容 · 前往原文查看
数据集 / 子集 # 调用率 精确率 召回率 F1 值 调用时准确率 未调用时准确率 降低幅度
VRQABench 整体 636 45.2% 82.5% 78.4% 80.4% 78.5% 67.2% 42.5%
VRQABench 迷宫 275 38.6% 84.2% 81.5% 82.8% 76.4% 65.8% 52.4%
VRQABench 不规则 171 45.2% 86.5% 85.2% 85.8% 75.2% 62.4% 48.5%
VRQABench 推箱子 190 55.4% 75.4% 68.5% 71.8% 85.6% 72.5% 35.2%
OpenWorldQA 整体 500 38.4% 79.6% 75.2% 77.3% 76.8% 66.5% 48.2%
OWQA 困难 84 65.5% 88.2% 86.4% 87.3% 72.4% 55.6% 28.5%
表 5:详细的模拟决策质量。模型优先对动态或空间要求较高的样本调用模拟。
媒体内容 · 前往原文查看
展开条件 # 接受率 精确率 召回率 误接受 误拒绝 准确率
高质量展开 300 92.5% 95.4% 92.5% 4.6% 7.5% 88.5%
低质量展开 150 18.4% 85.2% 22.5% 14.8% 12.4% 65.2%
损坏的展开 100 5.2% 92.5% 8.4% 7.5% 4.2% 62.8%
与图像线索冲突 120 12.5% 88.4% 15.2% 11.6% 8.5% 64.5%
遗漏关键交互 140 15.8% 86.5% 18.4% 13.5% 10.2% 63.4%
物理不一致 130 14.2% 89.2% 16.5% 10.8% 9.4% 64.8%
表 6:在受控展开质量条件下的完整展开-验证诊断。接受率衡量 PF-OPSD 信任所生成展开的频率;精确率和召回率评估针对特权评估器导出的展开有用性标签的验证决策;误接受和误拒绝分别衡量错误接受误导性展开和错误拒绝有用展开的情况。
媒体内容 · 前往原文查看
冲突子集 # 跟随展开 拒绝展开 融合 最终准确率 恢复
摘要错误,展开正确 150 82.5% 8.4% 9.1% 85.2% 78.5%
摘要正确,展开具有误导性 120 12.5% 78.4% 9.1% 81.5% 75.2%
两者都不确定 100 45.2% 15.8% 39.0% 62.4% 55.8%
展开幻觉 130 8.5% 85.2% 6.3% 76.8% 72.4%
静态线索不足 160 75.4% 12.5% 12.1% 78.5% 74.2%
静态线索与展开互补 140 25.4% 5.2% 69.4% 88.2% 85.6%
表 7:摘要推理与展开之间的完整冲突分析。跟随展开、拒绝展开和融合衡量 PF-OPSD 如何在摘要推理和基于展开的具体推理之间进行仲裁;最终准确率和恢复报告了由此产生的任务准确率和错误恢复率。
媒体内容 · 前往原文查看
模型 / 方法 总体 C1 C2 C3 C4 C5
零样本 / 无模拟基线
Gemini-3-Flash Pichai 等人 (2025) 45.9% 43.5% 41.2% 56.5% 46.3% 37.2%
GPT-5.4 OpenAI (2026) 43.2% 48.4% 46.1% 38.8% 31.6% 51.2%
HY3 腾讯 HY (2026) 38.2% 38.7% 47.9% 29.3% 30.5% 46.5%
Qwen3.6-27B 通义千问团队 (2026b) 33.0% 34.4% 31.5% 36.7% 27.4% 32.6%
Qwen3.5-9B 通义千问团队 (2026a) 33.2% 41.4% 44.2% 25.9% 11.6% 27.9%
Qwen2.5-VL-7B Bai 等人 (2025) 32.7% 29.0% 44.8% 21.1% 34.7% 37.2%
工作流智能体基线
工作流智能体 (Qwen3.5-9B) 32.6% 40.8% 43.6% 25.2% 11.0% 27.3%
工作流智能体 (Gemini-3-Flash) 47.2% 44.8% 42.5% 57.8% 47.6% 38.5%
Qwen3.5-9B 训练基线
SFT 通义千问团队 (2026a) 61.8% 59.7% 58.2% 70.1% 66.3% 46.5%
GRPO Shao 等人 (2024) 63.5% 61.2% 60.5% 71.8% 67.4% 48.2%
PF-OPSD 72.4% 70.5% 69.8% 78.4% 76.2% 61.5%
表 8:VRQABench 详细评估结果。类别缩写对应回合数、回合方向、推箱子推动次数、方向计数和推动方向计数。
媒体内容 · 前往原文查看
模型 / 方法 总体 C1 C2 C3 C4 C5 C6 C7 C8 C9 C10 C11 C12
零样本 / 无模拟基线
Gemini-3-Flash Pichai 等人 (2025) 48.2 61.0 35.7 61.0 35.7 65.9 40.5 71.4 50.0 21.4 53.7 40.5 42.9
GPT-5.4 OpenAI (2026) 53.4 58.5 19.0 65.9 50.0 68.3 57.1 71.4 47.6 28.6 65.9 54.8 54.8
HY3 腾讯 HY (2026) 35.0 39.0 16.7 48.8 33.3 43.9 31.0 35.7 42.9 28.6 48.8 33.3 19.0
Qwen3.6-27B 通义千问团队 (2026b) 41.4 68.3 0.0 65.9 21.4 53.7 47.6 59.5 38.1 0.0 34.1 45.2 64.3
Qwen3.5-9B 通义千问团队 (2026a) 39.8 68.3 0.0 68.3 2.4 36.6 54.8 57.1 35.7 0.0 31.7 52.4 71.4
Qwen2.5-VL-7B Bai 等人 (2025) 14.2 12.2 0.0 36.6 2.4 48.8 2.4 23.8 11.9 0.0 19.5 4.8 9.5
工作流智能体基线
工作流智能体 (Qwen3.5-9B) 38.6 66.8 0.0 66.5 1.8 35.2 52.4 55.8 34.2 0.0 30.5 50.8 69.8
工作流智能体 (Gemini-3-Flash) 49.5 62.3 37.0 62.3 37.0 67.2 41.8 72.7 51.3 22.7 55.0 41.8 44.2
Qwen3.5-9B 训练基线
SFT 通义千问团队 (2026a) 59.6 75.6 31.0 78.0 40.5 61.0 69.0 71.4 61.9 19.0 68.3 57.1 83.3
GRPO Shao 等人 (2024) 61.2 76.8 33.5 79.2 42.8 62.5 70.4 72.8 63.5 21.4 69.5 58.8 84.5
PF-OPSD 70.5 81.7 47.8 84.9 55.7 71.8 77.9 80.5 72.8 37.9 78.7 67.8 89.5
表 9:OpenWorldQA 详细测试结果。数值为百分比;类别名称遵循数据集分类体系。

A.1 OpenWorldQA 宏观平均与资源分组结果

由于 OpenWorldQA 训练集特意从自然视频中收集,且未按类别进行平衡,我们额外报告了宏观平均和按资源分组的结果。宏观平均对 12 个物理类别赋予相同权重。我们还根据每个类别的训练样本数量对类别进行分组:低资源类别训练样本少于 100 个(C1、C3、C5、C7、C10、C12),中资源类别有 100–800 个样本(C6、C8、C11),高资源类别有超过 800 个样本(C2、C4、C9)。测试集保持大致平衡,每个类别有 41–42 个问题。

媒体内容 · 前往原文查看
模型 / 方法 宏观平均 低资源 中资源 高资源
SFT 通义千问团队 (2026a) 59.7 72.9 62.7 30.2
GRPO Shao 等人 (2024) 61.3 74.2 64.2 32.6
PF-OPSD 70.6 81.2 72.8 47.1
PF-OPSD SFT +10.9 +8.3 +10.1 +16.9
表 10:OpenWorldQA 宏观平均与按资源分组结果。数值为百分比。资源组由每个类别的训练样本数量定义,而评估在各类别间保持平衡。

PF-OPSD 在所有资源组中均优于 SFT,包括训练样本少于 100 个的类别。这表明性能提升并不仅仅是最大训练类别中重复模式的结果。高资源组仍然是最困难的,因为它包含空间关系、支撑稳定性和工具使用类问题,且结果在视觉上差异细微;尽管如此,PF-OPSD 在该组中取得了最大的绝对增益,表明当静态线索和生成的 rollout 容易混淆时,仿真控制尤其有用。

A.2 重试深度诊断

表 11 报告了与图 6 相同的实际仿真深度统计。尝试次数是内生的:进行两次或三次尝试的样本,是因为早期的 rollout 被拒绝或结果不确定。因此,其较低的准确率应主要被解读为策略将更困难的样本导向更深的重试路径的证据,而非重试本身导致错误的证据。

媒体内容 · 前往原文查看
尝试次数 占比 VRQA 准确率 OWQA 准确率 误判率
0 57.5% 67.2% 66.5% –
1 40.5% 80.1% 76.4% 4.0%
2 1.5% 70.8% 68.2% 7.5%
3 0.5% 62.4% 60.5% 11.0%
表 11:PF-OPSD 下的实际重试深度诊断。尝试深度由策略选择,因此与样本难度相关。

附录 B PF-OPSD 算法

算法 1 总结了正文中用于构建优势加权目标的训练流程。

媒体内容 · 前往原文查看
算法 1 特权未来在线策略自蒸馏(PF-OPSD)

0:训练样本 ,世界模型 ,学生策略 ,特权评估器 ,仿真上限

0:更新后的学生策略

1:对于每个训练步骤执行

2:生成一个隐藏 的学生视角轨迹

3:对于 中访问到的每个决策节点 执行

4:如果 则

5:将 设为有效的离散动作集合

6:否则

7:从 中采样

8:结束条件判断

9:对于每个候选动作 执行

10:在节点 处强制执行 ,并在相同的学生视角 rollout 协议下贪心完成

11:使用教师侧上下文 对 进行评分

12:设置

13:结束循环

14:计算 和

15:构建离散目标 或文本权重

16:结束循环

17:使用 更新

18:结束循环

附录 C 相关工作

C.1 多模态与工具增强推理

大语言模型通过结构化提示和中间推理过程展现了强大的基于语言的推理能力,包括思维链提示、自一致性以及零样本推理(Wei et al., 2022; Wang et al., 2023; Kojima et al., 2022; Zhou et al., 2023; Tao et al., 2024)。后续研究通过外部计算和交互进一步扩展了这一推理过程:程序辅助推理将符号推理与可执行计算分离(Chen et al., 2023),而ReAct和Toolformer则证明语言模型能够将推理与工具调用及观察结果交织在一起(Yao et al., 2023; Schick et al., 2023)。这些研究工作确立了外部资源的重要性,但大多数工具返回的是相对明确的文本、符号或数值输出。

多模态大语言模型进一步将语言推理与视觉感知相结合,实现了图文对话、视觉问答以及复杂的多模态指令跟随(Yin et al., 2024; Yoon et al., 2025; Bai et al., 2025; Zhou et al., 2024)。然而,面向未来的推理仍然困难重重,因为所需的未来状态在输入图像中可能并不可见。模型必须从静态状态推断运动趋势、空间约束、接触变化以及因果后果。这暴露了以语言为中心的抽象与基于实体的动态预测之间的差距,印证了更广泛的观察结论,即纯语言或弱实体化的模型可能缺乏稳定的经验基础(Bisk et al., 2020; Gendron et al., 2024)。

C.2 视觉推理、物理预测与基准测试

视觉推理长期以来一直研究模型如何将感知与组合结构及物理规律相结合。诸如 CLEVR 和 GQA 等诊断性基准测试用于评估组合性视觉问答(Johnson 等人,2025;Hudson 和 Manning,2019),而 PHYRE 和 IntPhys 等物理推理基准测试则侧重于直觉物理学和结果预测(Bakhtin 等人,2019;Riochet 等人,2018)。这些基准测试启发了用于关系推理和组合推理的架构,包括关系网络、FiLM 和组合注意力机制(Santoro 等人,2017;Perez 等人,2018;Hudson 和 Manning,2018)。更近期的自监督视觉表示也能从大规模图像数据中捕获有用的结构规律(Oquab 等人,2024;Assran 等人,2023)。

尽管取得了这些进展,许多现有的视觉推理任务要么侧重于静态识别,要么评估基于已观测视频的感知。我们的设定则不同:智能体仅接收当前图像或事件前的锚定帧,并且必须回答关于未来结果的问题。这使得该任务更接近于具身智能体和交互式智能体的前瞻能力。VRQABench 基于 VR-Bench(Yang 等人,2025)构建,用于测试在迷宫和类推箱子环境中的可控空间前瞻能力,而 OpenWorldQA 则通过来自真实世界锚定帧的开放域物理预测对其进行补充。两者共同关注的是,模型能否从静态初始条件推断出未来状态,而不仅仅是识别已发生的事件。

C.3 生成式世界模型作为具体推理的来源

视频表示学习与视频生成已将视觉推理从静态感知扩展到时序动态领域。预测性视频表示方法与掩码视频建模能从视频数据中学习时序规律(Tong 等人,2022;Drozdov 等人,2024),而近期研究表明,视频模型能够通过逐帧生成展现出零样本的物理与空间推理能力(Wiedemer 等人,2025)。与此同时,大规模生成式视频模型正日益被视为世界模型,能够根据初始图像与文本指令合成合理的未来推演(Wan 等人,2025;Team,2025;Yue 等人,2025;Zhang 等人,2025)。

将此类模型用作具象推理源对于未来预测极具吸引力,因为生成的推演结果可能揭示静态输入中不存在的物体运动、路径演变、接触变化及时序后果。近期智能体相关研究已在结构化数字环境中探索世界模型,例如面向应用智能体的图形界面过渡模拟(Luo 等人,2025;Cao 等人,2026)。然而,世界模型并非精确的预言机。它们可能产生视觉上合理但与任务不符的未来幻觉,改变重要的几何结构,忽略微小的因果因素,或生成任务效用不确定的推演结果。最新证据进一步表明,当前智能体往往无法有效利用世界模型进行前瞻性推理(Qian 等人,2026)。因此,世界模型辅助应被视为带有噪声的具象推理,而非无条件的事实。

C.4 学习控制具象推理

上述观察促使我们从简单的世界模型依附转向受控的具体推理。生成式世界模型与传统工具不同,因为它返回的是高维、连续且可能具有误导性的视觉展开结果。因此,多模态大语言模型必须判断是否需要模拟,制定合适的查询,验证生成的展开结果是否可信,并解决抽象推理与基于展开结果的具体推理之间的冲突。这使得世界模型辅助推理成为一个关于模拟选择、展开结果验证以及展开结果依赖的问题,而不仅仅是工具调用。

我们的 PF-OPSD 框架与知识蒸馏、利用特权信息学习以及在线策略学习相关(Hinton 等人,2015;Vapnik 和 Vashist,2009;Schulman 等人,2017)。标准蒸馏将教师模型的监督信号迁移到可部署的学生模型中,而特权信息设置则使用仅在训练阶段可用、测试阶段不可用的信号。PF-OPSD 应被视为这些思想在世界模型辅助的未来问答任务中的一种具体实例化,而非一种新的通用蒸馏原则。其具体贡献在于让特权信号作用于模拟控制节点:是否调用世界模型,是否接受或拒绝某个展开结果,如何依赖它,以及生成哪个最终答案。在我们的案例中,真实未来视频提供了特权上下文,用于校准展开结果以及中间具体推理决策是否有用。与离线模仿固定演示不同,该策略首先在测试时输入下采样自身的轨迹,而特权未来信息仅用于为当前策略所访问的决策节点生成软目标。这种在线策略设计使得训练与可部署智能体实际遇到的状态保持一致,同时在推理过程中保持真实未来不可用。

附录 D 数据集详情

本节提供主论文中总结的两个基准测试的完整类别定义和划分分布。

D.1 基准测试验证协议

两个基准测试在自动筛选后均经过人工验证。人工验证被用作最终的质量把关环节,而非模型输入的来源。保留的样本必须包含有效的初始观察结果、唯一的答案、合理的干扰项,并且不能泄露未来的结果。模棱两可、视觉上不一致或选项无效的项目会被移除。

媒体内容 · 前往原文查看
数据集 人工验证检查项 被移除的案例类型
VRQABench 视觉一致性;由求解器推导出的唯一答案;合理的选项 无效的问题文本;不合理的选项;模糊的谜题状态
OpenWorldQA 锚点有效性;答案唯一性;无未来信息泄露;选项合理性 模糊的结果;泄露的锚点;视觉上不一致的问题;无效的选项
表 12:两个基准测试套件的最小验证协议。

D.2 VRQABench 类别分类与分布

VRQABench 由三个 VR-Bench 任务族构建而成:二维迷宫导航、不规则迷宫路径追踪以及推箱子(Sokoban)。每个样本都是一个基于初始谜题图像生成的四选一问题。表 13 定义了五个保留的空间问题类别,表 14 报告了它们的训练/评估分布,表 15 总结了任务族的分布。

媒体内容 · 前往原文查看
类别 适用任务 所需推理
C1_转弯次数 迷宫,不规则迷宫 统计最优路径上的总转弯次数。
C2_转弯方向 迷宫,不规则迷宫 统计最优路径上的左转或右转次数。
C3_推箱子 推箱子(Sokoban) 推断最小推动次数或首次推动方向。
C4_方向步数 迷宫 统计最优路径上指定方向的步数。
C5_方向推动次数 推箱子(Sokoban) 统计最优解中指定方向的推动次数。
表 13:VRQABench 类别定义。
媒体内容 · 前往原文查看
类别 训练集 评估集 总计
C1_转弯次数 1,194 186 1,380
C2_转弯方向 1,033 165 1,198
C3_推箱子 928 147 1,075
C4_方向步数 637 95 732
C5_方向推动次数 208 43 251
总计 4,000 636 4,636
表 14:VRQABench 在训练集和评估集上的类别分布。
媒体内容 · 前往原文查看
任务类型 训练集 评估集 总计
迷宫 1,756 275 2,031
不规则迷宫 1,108 171 1,279
推箱子(Sokoban) 1,136 190 1,326
总计 4,000 636 4,636
表 15:VRQABench 任务族分布。

D.3 OpenWorldQA 类别分类与分布

OpenWorldQA 包含来自真实世界短视频的四选一选择题。每道题使用结果可见之前的锚定帧,要求模型预测未来的物理事件。表 16 定义了 12 个物理推理类别,表 17 报告了训练/测试集的类别分布,表 18 报告了问题类型分布。

媒体内容 · 前往原文查看
类别 名称 描述
C1_fit_clearance 间隙适配 推断刚性物体穿过有限间隙所需的中间姿态或方向。
C2_spatial 空间关系 预测物理事件后的最终位置或区域。
C3_containment 容纳 推理溢出、填充、液体分布,或容器是否能容纳该物质。
C4_support 支撑稳定性 预测稳定性、倾倒方向、坍塌或平衡。
C5_friction 摩擦 预测滑动距离、打滑与抓握,或停止位置。
C6_inertia 惯性 预测施加或移除力之后的轨迹、方向或距离。
C7_fluidity 流动性 预测流动路径、溢出阈值、飞溅模式或吸收。
C8_deformability 可变形性 预测拉伸、撕裂、起皱、断裂点,或弹性变形与永久变形。
C9_tool_use 工具使用 预测工具作用于物体后的物理结果。
C10_chain_reaction 连锁反应 预测超出首个接触点的间接或下游效应。
C11_process_race 过程竞赛 判断两个并发物理过程中哪一个先完成。
C12_multi_body 多体运动 推理多个物体之间的动量传递、竞争作用力或空间冲突。
表 16:OpenWorldQA 类别定义。
媒体内容 · 前往原文查看
类别 训练集 训练集占比 % 测试集 测试集占比 % 总计
C1_fit_clearance 34 45.3 41 54.7 75
C2_spatial 1,062 96.2 42 3.8 1,104
C3_containment 31 43.1 41 56.9 72
C4_support 843 95.3 42 4.7 885
C5_friction 63 60.6 41 39.4 104
C6_inertia 168 80.0 42 20.0 210
C7_fluidity 87 67.4 42 32.6 129
C8_deformability 443 91.3 42 8.7 485
C9_tool_use 853 95.3 42 4.7 895
C10_chain_reaction 33 44.6 41 55.4 74
C11_process_race 200 82.6 42 17.4 242
C12_multi_body 87 67.4 42 32.6 129
总计 3,904 88.6 500 11.4 4,404
表 17:OpenWorldQA 数据集在训练集和测试集上的类别分布。测试集在各类别间大致均衡,每个类别有 41–42 道题。
媒体内容 · 前往原文查看
问题类型 数量 占比
[ORDER] 1,458 33.1
[FIRST-CONTACT] 1,213 27.5
[INTERMEDIATE] 1,093 24.8
[COUNT] 254 5.8
[COUNTERFACTUAL] 208 4.7
[FAILURE] 178 4.0
总计 4,404 100.0
表 18:OpenWorldQA 问题类型分布。

附录 E 工作流-智能体提示词模板

对于工作流-智能体基线方法,我们使用一个固定的提示词,该提示词将 Helios 作为一个可选的世界模型工具暴露出来,同时将所有模拟决策留给基础多模态大语言模型。智能体仅接收初始图像或锚定帧、问题以及答案选项;它永远不会接收到真实未来或真实答案。一次 Helios 查询会返回一个 100 帧的展开结果,并且每个示例中智能体最多可以发起三次模拟查询。

附录 F 数据集构建提示词

为保证可复现性,我们附上了用于构建这两个基准测试的数据集构建提示词材料。每个数据集都以一段简短的散文式概述作为背景介绍,随后逐字展示实际的阶段或智能体提示词;仅非 ASCII 装饰符号(如制表符、箭头以及警告/勾选图标)会被标准化为 ASCII 格式以兼容 LaTeX。在这些自动化阶段之后,两个数据集中所有保留的条目均由人工标注员进行手动验证,并且会移除那些答案模糊、锚定无效、选项不合理或存在视觉不一致的样本。

F.1 完整的 VRQABench 数据集构建提示词

VRQABench v2 流程用程序化求解器取代了原先基于 VLM 的解题追踪,从而消除了答案生成阶段的模型幻觉。VLM 的调用仅限于编写问题文本和审查问题质量。整体构建流程为:state.json → 程序化求解器 → build_qa_items() → QuestionWriter → SmallModelProbe → Reviewer → 人工验证 → output/reviewed/。实际的阶段提示词和规范如下所示。

F.2 完整的 OpenWorldQA 数据集构建提示词

OpenWorldQA 数据集通过一个五阶段多智能体流水线构建而成,这五个阶段分别是:场景分析师、问题设计师、干扰项锻造器、小模型探针和审核员。该流水线从视频帧序列开始,生成结构化的场景报告和锚定帧,设计问题骨架,填充合理的干扰项,通过两个小模型探针对问题进行筛选,并应用五维审核员进行审核。通过审核的条目随后由人工标注员进行人工验证,之后才被写入训练集/测试集划分中。实际的智能体提示词如下所示。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org