正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身大模型/VLA编辑精选

面向多机械手泛化的任务自适应视觉-语言-抓取框架 AdaRoboVLG

研究人员提出AdaRoboVLG框架,将基础模型先验与可泛化抓取合成解耦,实现跨机械手泛化和功能抓取。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1456

来自多所机构的研究团队在arXiv上发表论文,提出任务自适应视觉-语言-抓取(VLG)框架AdaRoboVLG。不同于将基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身端到端指「从眼睛到手」由一个 AI 模型直接完成的技术路线:输入画面和指令,直接输出动作,中间不再由工程师人工拆分步骤。◆ 小白科普 · 现身抓取策略紧密耦合的现有方法,AdaRoboVLG通过学习高效的可泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身基础策略,利用显式运动学映射和基于力闭合的稳定性估计,生成并评估物理可行的抓取候选;同时将任务相关的理解功能卸载到专门的基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身模块,这些模块提供可组合先验,无需重新训练底层抓取策略即可实现情境自适应的抓取合成。大量仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实世界实验表明,基础策略具有高效学习和跨手泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身能力;框架能有效整合空间、认知和时间先验,应对三类代表性抓取挑战,性能不逊于现有最先进方法;这些先验还可联合作用于杂乱动态环境中的功能性抓取。

研究认为,解耦物理抓取合成与任务理解提供了可扩展的机器人抓取范式,未来基础模型的进步可直接转化为抓取能力的提升。视频见项目主页。