正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身智能研究编辑精选

ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性

新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1471

卡内基梅隆大学与韩国科学技术院等研究机构联合发表论文,指出视觉语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在作为机器人学习奖励函数时,对语义等价的任务描述缺乏释义不变性。相同轨迹在改写指令下可能获得明显不同的进度评分,甚至导致机器人行为被判定为成功或失败的结果发生反转。为量化该缺陷,团队推出ROBORMBENCH基准,包含2,390条真实机器人轨迹、真实进度标注及21,673条经过验证的释义,覆盖词法、句法和动作目标改写。实验显示,商用及开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身视觉语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身普遍存在严重的不稳定现象,改写差异越大越明显,且模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身规模或显式推理并不能可靠改善。相比之下,利用轨迹监督训练的专业奖励模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身稳定性显著更高。研究认为释义鲁棒性是可靠机器人奖励建模的核心要求。