正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身智能

Dream2Reward:基于正向演示的过渡对齐奖励模型助力机器人操作

研究团队提出Dream2Reward奖励模型,无需失败标注即可从成功演示中学习,提升机器人操作策略学习效果。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1332

研究人员提出Dream2Reward,一种从正向演示中学习语言条件成功潜在过渡场的奖励模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。该方法基于过渡开始前的视觉历史,预测成功执行对应的潜在位移,并通过有符号方向与对称幅度一致性对实际位移评分。这一过渡级比较能在观测看似取得进展时,仍对错误方向、超调及停滞动作施加惩罚。Dream2Reward无需失败标注、进展标签或合成负样本,即可生成稠密因果奖励。在机制诊断与共享轨迹评估中,较基于进展的替代方案,该方法展现出更强的成功—失败区分度,并能对低质量行为提供更有效反馈。在在线与离线策略学习中,同一冻结奖励模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身可减少奖励黑客攻击,并支撑更强下游性能,包括真实机器人操作。结果表明,将实际运动与预测成功变化比较,是将正向演示转化为机器人学习稠密奖励的有效途径。