蚂蚁集团 Robbyant 开源 LingBot-Vision:1B 参数边界中心视觉模型,密集空间感知性能超 7B 模型
蚂蚁集团旗下 Robbyant 开源了自监督视觉 Transformer 系列 LingBot-Vision,采用掩码边界建模,将图像边界作为原生训练信号。1B 参数旗舰模型在深度估计、语义分割等密集空间任务上超越 7B DINOv3,并驱动深度补全模型 LingBot-Depth 2.0。本文详解技术原理、性能对比及中文用户如何上手。
一句话看懂
蚂蚁集团旗下 Robbyant 开源了 LingBot-Vision,一种以边界为中心的视觉基础模型,1B 参数在密集空间感知任务上超越 7B 模型,并驱动深度补全模型 LingBot-Depth 2.0。
详细发生了什么
蚂蚁集团旗下的具身智能公司 Robbyant 开源了 LingBot-Vision,这是一个自监督 Vision Transformer 系列,专为密集空间感知设计。模型权重以 Apache-2.0 协议发布在 Hugging Face 上,提供四种尺寸:ViT-giant(1.1B)、ViT-large(300M)、ViT-base(86M)和 ViT-small,同时附带技术报告和推理代码。
大多数视觉基础模型训练目标是语义不变性:它们学习回答图像中“有什么”,却丢弃了精细的空间结构——物体边界、轮廓、深度不连续性——而这些正是机器人等具身系统所依赖的。LingBot-Vision 反转了这一优先级:它将边界作为原生预训练信号,而非下游输出。其 1B 参数骨干网络在密集空间任务上匹配甚至超越大 7 倍的模型(包括 7B 的 DINOv3)。
核心技术是掩码边界建模(Masked Boundary Modeling),基于 DINO/iBOT 自蒸馏范式。教师网络在线预测密集边界场,识别出边界令牌,强制它们进入学生的掩码集。边界令牌除了语义自蒸馏目标,还接收显式几何目标,而内部掩码令牌仅保留标准语义目标。边界场被离散化为 32 个 bin 的分类任务,并利用 NFA 检验验证解码的线段。
在基准测试中,LingBot-Vision ViT-g 在 NYU-Depth v2 上取得最佳 RMSE(0.296),超越 7B DINOv3(0.309);在 KITTI 上也是 2B 参数以下最佳模型。语义分割方面,与 DINOv3 ViT-H+ 相当,在 ADE20K 上落后 1.3 mIoU,在 Cityscapes 上持平,在 VOC12 上领先。视频目标分割在 DAVIS-2017 上达到 70.0 J&F,与 DINOv3 系列接近。
中文圈视角
LingBot-Vision 对中文用户有直接价值:
-
完全开源且可商用:Apache-2.0 协议,无使用限制。国内开发者可直接从 Hugging Face 下载权重,无需额外审批。对于机器人、自动驾驶、工业检测等场景,这是一个高性价比的视觉基础模型。
-
国产替代与对比:相比 Meta 的 DINOv3(7B 参数),LingBot-Vision 以 1B 参数在深度估计上更优,且训练数据量小一个数量级。国内类似模型如上海 AI 实验室的 InternViT(6B)在语义任务上更强,但 LingBot-Vision 在空间感知上更专注。对于需要高精度深度和边界信息的场景(如机械臂抓取、无人机避障),LingBot-Vision 可能是更好的选择。
-
中文场景适配:模型在 1.61 亿张网络图像上训练,包含大量中文场景数据(蚂蚁集团业务覆盖全球)。国内用户可直接用于中文街景理解、室内导航等任务。不过,模型依赖 PyTorch ≥ 3.10,建议使用 GPU 推理。
-
监管合规:模型权重托管在 Hugging Face,国内访问需梯子。建议国内用户通过 ModelScope 或阿里云镜像下载。数据层面,训练数据来自公开网络,不涉及用户隐私,合规风险较低。
几条值得记住的细节
- 旗舰模型 ViT-g/16 约 1.1B 参数,训练于 1.61 亿张图像,无人工标注、无外部边缘检测器。
- 掩码边界建模将边界令牌强制加入掩码集,并赋予几何目标,与语义目标协同训练。
- 在 NYU-Depth v2 上 RMSE 0.296,超越 7B DINOv3(0.309),参数少 7 倍。
- 蒸馏版 ViT-L(300M)在 NYUv2 深度上 RMSE 0.310,接近 7B DINOv3(0.309)。
- 模型权重已开源至 Hugging Face,提供四种尺寸,支持 frozen features 直接用于下游任务。
一句话总结
LingBot-Vision 让中文开发者用 1B 参数获得超越 7B 模型的密集空间感知能力,开源可商用,是机器人、自动驾驶等场景的优质视觉基础模型。