GeniWorld:通过视觉动作实现泛化的机器人交互世界模型
新研究提出GeniWorld世界模型,利用URDF渲染将动作转为视觉表示,提升机器人操作在未知场景的泛化能力。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
一篇来自arXiv的论文提出GeniWorld,这是一种面向机器人操作的交互式世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,旨在提升策略在复杂与未知环境中的鲁棒性。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身基于预训练视频生成模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,通过URDF渲染将数值动作转换为视觉动作表示,实现空间上可控的动作引导。GeniWorld将本体运动学与环境动力学明确解耦,以减轻场景过拟合并促进机器人-环境交互的建模。为达成闭环控制,研究者构建了自回归视频预测模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,并与高频机器人运动控制让机器人的身体按想法精准动起来、并保持平衡的技术,相当于人类的「小脑」。◆ 小白科普 · 现身集成,支持与机器人策略及人类远程操作者的交互。实验显示,即使仅在有限的固定场景数据上训练,模型也能在域内取得优势,并对高度随机化的未见环境实现零样本泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身。在下游应用中,GeniWorld可作为可规模化的策略评估器,在环境扰动下保持可靠性。
此外,基于有限的真实世界演示,该模型能在世界模型内生成多样化操作轨迹,提升下游策略在复杂环境中的性能与鲁棒性。