TECHNOLOGY · 技术
强化学习
斯坦福研究利用自由形式偏好实现机器人长时域信用分配
斯坦福大学团队提出利用自由形式偏好生成的密集奖励,解决机器人强化学习在长时域任务中的信用分配难题。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

斯坦福大学团队针对机器人强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身中长时域任务信用分配的挑战,提出一种新方法。传统机器人强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身多局限于短时域任务,主要因为稠密时序奖励难以获取。该研究利用自由形式的偏好反馈,无需显式子任务分段,即可为子任务生成密集奖励信号,从而缓解长时域任务中的奖励稀疏问题,有望拓展机器人学习在复杂长时间任务中的应用。