正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身智能算法

新研究提出基于拓扑图的宏观动作强化学习方法,提升连续环境视觉语言导航性能

研究提出拓扑图宏观动作强化学习框架,在视觉语言导航任务中取得领先表现。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1459

浙江大学等机构的研究团队在arXiv发表论文,针对连续环境下的视觉语言导航(VLN-CE)任务,提出一种基于拓扑图的宏观动作强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身框架。现有模仿学习流程在闭环设置中面临分布偏移和专家动作歧义等问题,而直接应用强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身于微观动作空间则因奖励稀疏而效率低下。为此,团队将VLN-CE重构为分层马尔可夫决策过程,将高层规划与低层控制解耦。通过将环境抽象为拓扑图,高层策略在包含前沿节点的宏观动作空间中运行,并由无需训练的低层控制器作为状态转移,显著压缩了决策范围,使闭环强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身变得可行。此外,团队设计了动作感知价值头,以在动态前沿动作空间中有效评估状态价值,并支撑基于图的PPO算法。实验表明,该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在R2R-CE和RxR-CE基准上达到了当前最优性能。