TECHNOLOGY · 技术
机器人学习
QDOS:面向离线到在线强化学习的质量-多样性技能学习新方法
东京大学团队提出QDOS方法,通过优势加权质量-多样性预训练从离线数据中提取多样且高价值的技能,提升机器人操作和运动任务性能。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
近日,一篇来自东京大学的论文提出了一种名为QDOS(Quality-Diversity Offline Skill learning)的统一管线,用于提升机器人强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身从离线到在线的学习能力。该方法引入优势加权质量-多样性预训练目标,根据每个轨迹片段的估计优势对技能提取和多样性目标进行加权,使模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身能够从离线数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身中提取多样且高价值的技能。研究团队将QDOS与双重数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身重用策略结合,离线数据既用于技能预训练,也用于通过伪标签填充在线经验回放缓冲区。实验结果显示,QDOS在结构化的机械臂像人的手臂一样伸展抓取的装置,是工业自动化里最成熟的机器人形态,也是人形机器人「胳膊」的技术前辈。◆ 小白科普 · 现身操作任务和非结构化的运动任务上均显著优于强基线方法,验证了其在稀疏奖励场景下加速探索和提升最终回报的能力。相关论文已发表于arXiv平台。