蚂蚁灵波发布LingBot-Depth 2.0空间感知模型,12项指标世界第一
蚂蚁灵波发布空间感知模型LingBot-Depth 2.0,在多个数据集取得12项世界第一,并开源其预训练基座LingBot-Vision。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
蚂蚁灵波今日发布LingBot-Depth 2.0空间感知模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,宣称在行业公开数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身与私有测试集中取得12项世界第一。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身针对玻璃、镜子、透明物体等复杂场景优化,提升了物体边缘轮廓和细小结构的深度感知能力,在反光、透明、极暗等恶劣条件下仍能生成平滑深度图。商业化方面,蚂蚁灵波与3D视觉厂商奥比中光达成合作,LingBot-Depth 2.0已通过奥比中光深度视觉实验室认证,并推出EGO-RGBD数采设备、SDK集成及一体化相机等软硬一体化方案。
技术核心在于全新的预训练视觉基座LingBot-Vision,这是全球首个面向具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身的“空间原生”视觉基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,采用基于几何的预训练机制和“边界强迫”自监督范式,替代了行业常用的DINOv3。在NYUv2深度估计基准上,仅11亿参数的LingBot-Vision以约七分之一的参数量和不足三分之一的训练样本超越DINOv3(70亿参数)。此外,蚂蚁灵波推出ViT-L/B/S蒸馏系列,其中3亿参数模型深度估计精度与DINOv3相当。LingBot-Vision已全面开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身,权重、代码及技术报告发布于HuggingFace、ModelScope、GitHub及arXiv。