AI 快讯 编译自 marktechpost #模型发布#空间推理#NVIDIA

NVIDIA SpatialClaw 发布:无需训练,用代码作为动作接口实现 3D 空间推理

NVIDIA 推出 SpatialClaw,一种无需训练的智能体框架,通过将代码作为动作接口,在 20 个基准测试中平均准确率达 59.9%,超越 SpaceTools 11.2 个百分点。本文详解其工作原理、性能对比及对中文开发者的实际意义。

编译发布 2026/06/19 原文发布 2026/06/19

一句话看懂

NVIDIA 发布 SpatialClaw,一个无需微调的智能体,用 Python 代码作为动作接口,在 20 个空间推理基准上平均准确率 59.9%,比同类工具 SpaceTools 高 11.2 个百分点。

详细发生了什么

SpatialClaw 是 NVIDIA Research 推出的训练无关框架,专门解决视觉语言模型(VLM)在 3D 空间推理中的短板——判断物体位置、关系和运动。它不重新训练模型,而是改变智能体调用感知工具的动作接口,将代码作为接口核心。

框架围绕一个持久化 Python kernel 构建,预加载输入帧和基础工具集。感知工具是普通 Python 可调用对象,输出(如 mask、深度图、相机几何、轨迹)都是 Python 变量。核心入口包括:InputImages 存储帧,Metadata 携带帧率、时长,tools 暴露感知和几何原语,show() 嵌入图像到上下文,vlm 分发查询到独立 VLM 会话,ReturnAnswer() 提交最终答案。

两个核心感知工具:tools.Reconstruct 封装 Depth Anything 3,返回每帧深度、相机内参、外参和密集点云;tools.SAM3 封装 SAM 3,从文本、点或框提示生成图像/视频 mask。此外还有轻量工具如 tools.Geometrytools.Masktools.Timetools.Graphtools.Draw

在 20 个基准测试中,SpatialClaw 在 Gemma4-31B 骨干上平均准确率 59.9%,比无工具基线高 6.5 个百分点,比结构化工具调用高 3.2 个百分点,比单次代码高 4.7 个百分点。动态任务提升最大:DSI-Bench 提升 17.6 点,MindCube 提升 15.3 点。

中文圈视角

对国内开发者意味着什么? SpatialClaw 无需训练的特性降低了使用门槛——你不需要 GPU 集群或大量标注数据,只需一个 VLM 后端(如通过 vLLM 自托管或调用 API)即可部署。但注意,核心感知工具 Depth Anything 3 和 SAM 3 均来自海外,国内用户可能需要考虑 API 访问稳定性或寻找替代方案(如 ModelScope 上的中文版深度估计模型)。

国产平替可能性? 国内类似空间推理工作较少,但 DeepSeek、Kimi 等模型在视觉理解上已有进展。SpatialClaw 的“代码作为接口”思路可复用到国产模型上——只需将感知工具替换为国内开源模型(如 Depth Anything 的中文优化版、SAM 的国产复现),即可构建类似系统。对于机器人、自动驾驶等场景,这一框架能直接提升空间问答能力。

监管与合规:SpatialClaw 本身不涉及数据出境,但若调用海外 API,需注意数据安全。建议国内团队使用本地部署的 VLM(如 Qwen3.5 系列)和感知模型,完全合规。

几条值得记住的细节

  • 无需训练:同一系统提示、工具集和超参数在所有基准和骨干上运行,无需微调。
  • 五阶段循环:每个样本经历规划、代码生成、代码执行、反馈组装、答案提交,最多 30 步。
  • 代码安全:静态 AST 检查器在代码执行前拒绝不安全代码。
  • 性能对比:在 Gemma4-31B 上,SpatialClaw 比 VADAR 高 19.4 点,比 pySpatial 高 12.1 点。
  • 开源可用:代码在 GitHub 上,支持 LangGraph 工作流和 Jupyter kernel,单机即可运行基准。

一句话总结

SpatialClaw 让 VLM 通过写代码来“思考”空间关系,无需训练即可显著提升 3D 推理能力,对机器人、多视图检测等场景价值明显。