正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身大模型

EXIMO:利用视觉语言模型引导VLA策略微调的新方法

EXIMO算法通过探索、模仿、优化三阶段,利用视觉语言模型规划,提升VLA策略微调的样本效率和最终性能。

文 / 现身编辑部来源 / 开源动态1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

EXIMO:利用视觉语言模型引导VLA策略微调的新方法
资料图片 · 来源:开源动态 · 加载失败时显示生成封面

针对大规模视觉语言动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身微调新任务时依赖大量遥操作Teleoperation由人在远端控制机器人完成动作,并把这些示范记录为训练数据。◆ 小白科普 · 现身数据、样本效率低的问题,研究者提出EXIMO算法。该方法分三阶段运行:探索阶段,视觉语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身作为规划者,将长时程任务分解为短任务,并与VLA协作采集新任务数据;模仿阶段,利用采集数据微调VLA;优化阶段,采用离策略残差强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身进一步优化策略。实验表明,EXIMO在样本效率和最终性能上显著优于现有方法。