DSWAM:面向精细机器人操作的双系统世界动作基础模型
DSWAM结合系统1的世界动作执行器与系统2的语言视觉子任务规划器,实现精细机器人操作,并在DeMaVLA环境下与VLA模型进行公平对比。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
世界动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身(WAM)通过基于视频的世界建模为机器人动作学习提供密集监督,是视觉-语言-动作(VLA)策略的一种有前景替代方案。现有WAM擅长物理执行,但缺乏VLM基VLA中用于分解粗粒度指令的显式语言级规划接口,这在家庭多步复杂任务中尤为关键。为填补这一缺口并实现WAM与VLA的公平对比,研究团队提出DSWAM——一种面向精细机器人操作的双系统世界动作基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。DSWAM保持系统1的WAM执行器作为默认控制路径,并在需要任务分解时可选激活系统2的视觉语言子任务规划器。规划器基于短期视觉历史和全局任务提示预测可执行子任务,WAM执行器则为每条指令或子任务进行世界感知动作生成。
执行器通过动作预测和视频联合训练,推理时直接预测动作块而无需显式生成未来视频。DSWAM还集成了TensorRT加速、异步执行和实时分块技术,使策略查询不阻塞机器人控制。为与VLA策略进行公平真实机器人对比,团队在DeMaVLA真实世界可变形操作设定下,使用匹配的机器人平台、预训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身、后训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身和评估标准构建并评估了DSWAM。