NVIDIA Research 发布 SpatialClaw:免训练空间推理框架
NVIDIA AI Introduce SpatialClaw: A Training-Free Agent That Treats Code as the Action Interface for Spatial Reasoning
NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。
NVIDIA 把空间推理的动作接口从工具调用换成代码,这个思路很巧,20 个基准平均拉升到 59.9%,无训练即插即用,做机器人和视频理解的人该直接跑一下 repo。
NVIDIA Research 发布了 SpatialClaw,这是一个无需训练的空间推理框架。它针对的是视觉语言模型(VLM)中一个长期存在的弱点。这些模型在判断物体位于何处、彼此如何关联以及在 3D 中如何运动方面仍然表现不佳。
SpatialClaw 不会重新训练模型。相反,它改变了智能体用来调用感知工具的动作接口。研究团队认为,接口才是瓶颈所在。他们的解决方案是将代码视为动作接口。在 20 个基准测试中,SpatialClaw 达到了 59.9% 的平均准确率。它比近期的空间智能体 SpaceTools 高出 11.2 个百分点。
什么是 SpatialClaw
SpatialClaw 是一个包裹在有状态 Python 内核之外的智能体循环。该内核预加载了输入帧和一组原语。感知工具是普通的 Python 可调用对象。它们的输出,包括掩码、深度图、相机几何和轨迹,都是普通的 Python 变量。
该内核暴露了六个公共入口点。InputImages 保存采样的帧。Metadata 携带帧率、时长和帧索引。tools 暴露感知和几何原语。show() 将图像嵌入智能体的下一个上下文。vlm 将查询分派到单独的 VLM 会话。ReturnAnswer() 提交最终答案。
两个感知工具是核心。tools.Reconstruct 封装了 Depth Anything 3,返回逐帧深度、相机内参、外参和稠密点图。tools.SAM3 封装了 SAM 3,可根据文本、点或框提示词生成图像或视频掩码。该框架还添加了轻量级实用工具:tools.Geometry、tools.Mask、tools.Time、tools.Graph 和 tools.Draw。
它是免训练的。相同的系统提示词、工具集和超参数在每一个基准测试和骨干网络上运行。

为什么动作接口很重要
研究团队针对同一个问题研究了三种动作接口。以测量加热器与门之间的最近距离为例。
- 单次代码编写一个完整的程序并运行一次。它在看到任何中间掩码或深度图之前就确定了完整策略。一个错误的假设会直接传播到答案。
- 结构化工具调用通过固定的 JSON schema 调用命名工具。它无法自由地将输出与 NumPy 或 SciPy 结合来表达测试时的计算。最近点操作没有预注册的工具,因此结果是错误的。
- SpatialClaw 用代码组合工具,检查结果,然后进行修正。它首先计算质心距离,随后注意到质心使用的是中位数。该智能体转而使用
scipy.spatial.KDTree来找到真正最近的点。它提交了 0.9439 m,而真值为 0.9 m。
基准测试
SpatialClaw 在涵盖五个类别的 20 个基准测试上接受了测试。这些基准测试横跨单图、多视图、通用、视频与 4D,以及通用视频理解。在所测试的全部六个骨干模型上,它都优于无工具基线。骨干模型涵盖 Qwen3.5/3.6 和 Gemma4 系列,参数量从 26B 到 397B。
一项受控对比隔离了接口的影响。三个变体共享相同的工具集和提示词。只有动作接口不同。
| 动作接口 | 平均(20 个基准测试) | 相对无工具的 Δ |
|---|---|---|
| 无工具基线 | 53.4 | – |
| 单次代码 | 55.2 | +1.8 |
| 结构化工具调用 | 56.7 | +3.3 |
| SpatialClaw(代码即动作) | 59.9 | +6.5 |
Gemma4-31B 主干,20 项基准平均分。
在相同的 Gemma4-31B 主干上,与先前的空间智能体相比,差距进一步拉大。
| 方法 | 接口 | 平均 | 相对 SpatialClaw 的 Δ |
|---|---|---|---|
| VADAR | 单次通过 | 40.5* | −19.4 |
| pySpatial | 单次通过 | 47.8 | −12.1 |
| SpaceTools-Toolshed | 结构化工具调用 | 48.7 | −11.2 |
| SpatialClaw | 代码即动作 | 59.9 | 最佳 |
最大的提升出现在动态任务上。在 Gemma4-31B 上,DSI-Bench 上升了 +17.6 分,MindCube 上升了 +15.3 分。这些类别需要跨帧和跨视角的链式几何计算。
一项以 LLM 作为评判者的归因分析解释了相较结构化工具调用的胜出原因。代码组合占其中的 52.2%。控制流占 19.5%,其余 28.3% 为界面无关。
五阶段循环内部
每个样本运行一个五阶段循环:规划、代码生成、代码执行、反馈汇总和答案提交。规划器在看不到图像的情况下起草策略。随后主智能体每一步编写一个 Python cell。静态 AST 检查器在执行前拒绝不安全代码。循环重复进行,直到调用 ReturnAnswer() 或经过 30 步。
官方仓库运行在 LangGraph 工作流和持久化 Jupyter kernel 之上。骨干模型通过 vLLM 提供服务。感知模块运行在 FastAPI GPU 服务之后。一个快速启动脚本在一台机器上运行一个基准测试:
git clone --recursive https://github.com/NVlabs/SpatialClaw.git
cd SpatialClaw
bash spatial_agent/scripts/setup.sh
cp .env.example .env # add API keys, or self-host vLLM
python -m spatial_agent.entrypoints.run \
--dataset spatial_agent/config/dataset/erqa.json \
--model spatial_agent/config/model/gemini-3-pro.json \
--concurrency 4一个具有代表性的智能体 cell 将感知与几何结合,然后进行修正:
# Reconstruct the scene, then segment both objects in one video pass
recon = tools.Reconstruct.Reconstruct(InputImages)
seg = tools.SAM3.segment_video_by_text(["radiator heater", "door"])
show(seg.visualize(1)) # inspect the masks first
# Closest-point distance via KD-tree, not centroids
pts_h = seg.get_masked_points(recon, frame=1, object=0) # object 0 = heater
pts_d = seg.get_masked_points(recon, frame=2, object=1) # object 1 = door
dists, _ = scipy.spatial.KDTree(pts_d).query(pts_h, k=1)
ReturnAnswer(float(dists.min()))智能体从问题本身选取基本操作。距离问题调用 KD-tree 搜索和向量范数。方向问题依赖点积。未应用任何类别特定的路由。
用例
该设计适用于需要逐步几何推理的问题。具体示例包括:
- 机器人与具身智能体,在行动前测量物体之间的度量距离。
- 多视角检查,从多个相机角度恢复物体的朝向。
- 视频与 4D 分析,跨帧追踪物体或相机运动。
- 室内场景问答,例如“门相对于水槽在哪里?”
由于无需训练,团队无需新数据或微调即可扩展已部署的 VLM。
交互式讲解器
核心要点
- 以代码作为动作接口:SpatialClaw 让 VLM 在每一步向一个持久化内核写入一个 Python 单元,对感知输出进行组合与修订,而非固守一个固定计划。
- SOTA、无需训练:在 20 个空间基准上平均达 59.9%,较此前的智能体 SpaceTools 提升 +11.2 个点,且无需针对基准或模型进行调优。
- 接口即杠杆:仅在 Gemma4-31B 上更换动作接口,准确率便从 56.7(结构化工具调用)提升至 59.9,且 52.2% 的胜出可归因于代码组合。
- 几何链式推理处增益最大:动态 4D 与多视角任务提升领先(DSI-Bench +17.6,MindCube +15.3),这些任务要求步骤跨帧、跨视角进行组合。
- 感知是天花板: 增益可跨六种骨干模型(26B–397B)迁移,但剩余的瓶颈在于感知质量,且许可证为非商用。
来源:MarkTechPost(RSS) · marktechpost.com