世界-行动模型(WAM)崛起:从预训练世界模型到具身智能政策
世界-行动模型利用预训练视频或世界模型作为骨干进行视觉预测,并输出动作序列,开创具身智能新范式。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

世界-行动模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身(WAM)是一种新兴的机器人学习范式,它从预训练的世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身或视频骨干网络出发,将其适配为能同时预测场景变化和输出对应动作的策略。与视觉-语言-行动模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身(VLA)不同,WAM的核心在于利用视频预测能力来指导物理交互。其关键组件包括:预训练的视频模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身作为骨干,以及逆动力学、联合预测、动作分块等技术。视频骨干网络可复用Wan、Cosmos等大视频生成模型。逆动力学由观测推断最优动作序列;联合预测则同时预测未来观测和动作。动作分块如ACT和Diffusion Policy允许单次策略调用输出短视线动作序列。WAM通过混合Transformer(MoT)处理多模态,并结合扩散Transformer(DiT)进行去噪。
此外,VAE用于压缩图像和视频为潜在表征,提升效率。该范式的兴起得益于Cosmos、Wan等基础模型以及DROID、RoboArena等大规模数据集按统一格式整理好的大批量数据集合,是训练 AI 模型的「教材库」。开源数据集相当于整个行业的公共基础设施。◆ 小白科普 · 现身和基准。WAM有望弥合语言到动作的鸿沟,推动机器人从模拟走向真实部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身。