TECHNOLOGY · 技术
世界模型编辑精选
Masked Visual Actions实现统一世界建模
提出Masked Visual Actions,通过像素空间控制接口实现统一世界建模,仅需15小时微调即可预测场景响应。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
斯坦福大学与普林斯顿大学联合团队提出Masked Visual Actions,一种像素空间控制接口,可将机器人动作表达为视频中任意实体的部分轨迹。该方法利用视频模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在视觉世界中学习到的交互先验,实现动作与视觉空间的统一。通过仅15小时的真实视频和仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身掩码示例微调,单个模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身即可在多种场景和具身形态下保持高视觉保真度和可控性。在下游操作任务中,模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身可生成与真实执行结果高度相关的想象轨迹,用于策略评估;通过排序候选未来态改进模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身规划决策;还能从期望物体动作反向合成机器人运动。