CamVLA:无需标定的视点鲁棒视觉-语言-动作模型
CamVLA模型通过预测相机坐标系下的末端执行器动作与手眼矩阵,实现免标定、免深度、单目RGB的视点鲁棒操控。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
来自阿里巴巴达摩院等机构的研究人员提出CamVLA(Camera-Centric VLA),一种新的视觉-语言-动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,旨在解决机器人部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身中相机几何变化导致的鲁棒性问题。现有视点鲁棒策略常需显式相机外参,而CamVLA通过解耦操控与相机几何:预测相机坐标系下的末端执行器动作以及6自由度DoF机器人能独立运动的方向数量;自由度越多,动作通常越灵活,控制也更复杂。◆ 小白科普 · 现身手眼矩阵,再经确定性几何变换合成基坐标系动作。该方法在部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身时仅需单目RGB图像和任务指令,无需标定与深度信息。在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实机器人数据上的评估显示,CamVLA在多种未见过的视角下一致地提升了任务成功率。论文发表于arXiv,项目页面提供演示。