正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
VLA模型编辑精选

面向VLA的表示中心持续预训练方法VLAct发布

研究提出VLAct方法,以有限机器人数据提升VLA模型表现,在多个基准上超越工业级系统。

文 / 现身编辑部来源 / 开源动态1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

面向VLA的表示中心持续预训练方法VLAct发布
资料图片 · 来源:开源动态 · 加载失败时显示生成封面

机器人数据规模是构建通用视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身的关键,但实体采集成本高昂且覆盖稀疏,数据扩展难度远超图文数据。在此约束下,表示质量成为核心瓶颈。研究团队提出VLAct,一种面向VLA的视觉语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身骨干,在广泛异构多本体机器人数据上训练,再针对具体任务微调。该方法通过保留VLM先验、多头连续动作协同监督和部分统一跨本体动作布局,鼓励不同本体间的共享动作语义。在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身、真实世界和未见本体迁移中,VLAct均提升下游性能。在LIBERO-Plus和RoboTwin 2.0上,VLAct超越ABot-M0和LingBot-VLA等工业系统,成功率分别为82.6%和92.5%。

在RoboDojo上,VLAct成功率排名第六,并优于所有明确指定的世界动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。在RoboCasa-GR1未见人形本体上,仅用20%下游轨迹即超过全数据GR00T-N1.6基线。所有结果基于完全开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身数据和16-GPU设置,表明表示中心持续预训练可成为独立于数据扩展的VLA进展方向。