正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
强化学习

斯坦福研究利用自由形式偏好实现机器人长时域信用分配

斯坦福大学团队提出利用自由形式偏好生成的密集奖励,解决机器人强化学习在长时域任务中的信用分配难题。

文 / 现身编辑部来源 / X·Chelsea Finn·PI1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

斯坦福研究利用自由形式偏好实现机器人长时域信用分配
资料图片 · 来源:X·Chelsea Finn·PI · 加载失败时显示生成封面

斯坦福大学团队针对机器人强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身中长时域任务信用分配的挑战,提出一种新方法。传统机器人强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身多局限于短时域任务,主要因为稠密时序奖励难以获取。该研究利用自由形式的偏好反馈,无需显式子任务分段,即可为子任务生成密集奖励信号,从而缓解长时域任务中的奖励稀疏问题,有望拓展机器人学习在复杂长时间任务中的应用。