TECHNOLOGY · 技术
强化学习
基于智能体强化学习的机器人操作鲁棒执行方法
提出两种执行质量评估指标与智能体强化学习框架,使机器人操作在干扰下成功率提升最高39.2%。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
机器人操作面临不确定性、长时程执行和误差累积等挑战。近期视觉-语言-动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身虽具备泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身能力,但缺乏评估执行稳定性及偏离后恢复的机制。本文提出两种运行时执行质量评估指标,并构建智能体强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身框架,通过高层决策而非底层动作学习来恢复有效执行。该框架让智能体基于近期执行历史推理,从少量执行模式中选择以调控过程,并在执行退化时触发恢复机制,使机器人回到之前的标称状态。在LIBERO基准测试中,该方法在标准设置下成功率提升13.7%,在扰动设置下提升39.2%。