正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
强化学习

离线强化学习策略解耦提取新范式

研究提出离线强化学习策略解耦提取范式,将策略改进从训练解耦到推理阶段,优于联合学习方法。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1368

离线强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身(Offline RL)方法通常联合训练actor和critic,利用critic引导actor选择高价值动作。然而,离线数据固定,actor的策略改进无法产生新数据来验证或修正critic,导致actor更新可能漂移至分布外高价值动作,加剧critic过估计。为此,研究者提出将策略改进从actor训练中解耦:actor仅建模行为分布,推理时通过独立学习的critic对多个候选动作重新排序实现策略改进。实验表明,该范式优于行为克隆和联合学习离线RL方法,即使使用朴素Q-learning critic也有效。该研究为离线RL提供新思路,有望提升具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身中基于固定数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身训练策略的可靠性和性能。