正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
算法模型编辑精选

MA-VLA:多臂视觉-语言-动作模型实现协作与组合泛化

MA-VLA通过原子动作分配和臂洗牌机制,实现多臂机器人的组合泛化与协作,在未见协作模式中表现优异。

文 / 现身编辑部来源 / 开源动态1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

MA-VLA:多臂视觉-语言-动作模型实现协作与组合泛化
资料图片 · 来源:开源动态 · 加载失败时显示生成封面

多臂协作正成为具身操作的核心能力。近期视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身虽整合感知、语言与控制,但多数将语言视为单一全局指令,缺乏分配和组合特定臂行为的显式机制,限制了对未见协作模式的迁移。为此,研究者提出MA-VLA,一种通过原子动作分配实现多臂协作的统一框架。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身将协作行为分解为中层原子提示,并分配给各机械臂像人的手臂一样伸展抓取的装置,是工业自动化里最成熟的机器人形态,也是人形机器人「胳膊」的技术前辈。◆ 小白科普 · 现身,支持显式子目标指定和跨任务组合复用。为降低对固定执行角色的依赖,引入臂洗牌(Arm Shuffle)训练时策略,对每个臂的观测、状态及原子提示进行排列,强制角色无关的指令遵循,支持重组成未见协调模式,即多臂组合泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身。研究者构建了测试时协作模式在训练集中缺失的基准。

仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实世界评估中,先前最先进的VLA在未见协作下大多失败,而MA-VLA持续成功。结果表明,基于每臂结构化原子动作分配为多臂具身系统的可扩展泛化提供了实用路径。代码、模型和数据已开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身