ExToken框架:面向VLA模型的高效结构化探索微调方法
研究提出强化学习探索令牌,通过结构化行为先验提升视觉-语言-动作模型在机器人操作中的样本效率。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
中国科学院自动化研究所等机构的研究团队提出ExToken框架,旨在解决视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在复杂操作任务中强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身微调时的高交互成本问题。研究首先揭示了当前VLA-RL框架中存在的探索停滞瓶颈,指出轨迹多样性对样本效率的影响远大于原始数据收集量。基于此,ExToken通过将离线演示中的离散行为先验作为条件融入VLA策略,在轨迹收集过程中引导智能体探索不同的行为模式,显著改善了状态-动作覆盖率和探索效率。此外,该框架还引入状态条件令牌选择器,可在部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身时自适应预测未见场景的有效行为模式。在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实机器人操作任务上的实验表明,ExToken在严格有限的交互预算下能够加速收敛、提升任务性能并展现强鲁棒性。相关工作已在arXiv预印本发布。