TECHNOLOGY · 技术
具身大模型
JoyAI-RA 0.5提出双动作对齐框架,扩展机器人操作学习
JoyAI-RA 0.5提出双动作对齐框架,利用人类视频等异构数据扩展操作学习,基准测试表现优异。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
针对机器人数据稀缺且异构数据难以融合的问题,研究团队提出JoyAI-RA 0.5,一种通用视觉-语言-世界-动作(VLWA)框架。该框架通过双动作对齐机制,耦合物理世界动力学先验与视觉语义,实现跨人类第一视角视频、仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实机器人数据的操作学习扩展。隐式动作对齐从视觉转换中推断潜在动作,使无动作标注的数据引导世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身学习物理动力学;显式对齐则通过规范动作表示和相机帧块相对末端执行器动作,将可靠的人类和机器人轨迹统一到物理动作空间。内外环强化阶段兼顾任务适应与基础策略提升。在真实AgiBot基准测试中,JoyAI-RA在已知任务和未见变体上均表现良好,且任务得分随人类视频预训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身量增加持续提升,未见平台期,表明弱标注的人类经验可转化为可迁移的训练信号,成为扩展操作能力的主要途径。