DenseReward: 通过失败合成实现密集奖励学习的机器人操作模型
研究团队提出DenseReward密集机器人奖励模型,通过自动化生成物理真实的失败轨迹,提供逐帧奖励信号,提升强化学习效率。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身有望突破模仿学习的上限,但实际应用受限于缺乏可靠的视觉语言奖励模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。现有方法主要面临两大挑战:获取多样化失败数据成本高,且奖励信号稀疏。为此,研究团队提出DenseReward密集机器人奖励模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身通过自动化失败数据生成管道,在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身中合成物理真实的失败轨迹,涵盖碰撞、抓取失败、物体掉落和恢复行为等多种模式,无需人工标注。DenseReward能够基于视觉观察和语言指令预测密集逐帧奖励分数,从而在任务全程提供细粒度进度估计。实验结果显示,在模拟和真实环境操作中,DenseReward在密集奖励预测上均优于通用视觉语言模型和现有机器人奖励模型。研究还表明,DenseReward可为下游的模型预测控制和强化学习提供有效奖励引导。团队已发布数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身、预训练模型及评估套件,以支持面向故障感知的密集奖励建模研究。