正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
世界模型

世界模型与VLA融合:UniPi、V-JEPA 2与DreamZero的技术路径解析

本文解析世界模型如何驱动机器人,对比显式与隐式世界动作模型路线。

文 / 现身编辑部来源 / Bilibili 具身智能检索1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1421

近日,一段关于具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身的科普报告引发关注。报告指出,现有视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身和规划方面存在局限,世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身通过学习环境动态和预测未来状态,可增强机器人决策能力。报告重点比较了两条技术路线:显式规划以UniPi为代表,利用视频生成作为策略,通过预测未来视频帧来指导动作;隐式方法如JEPA和V-JEPA 2,则在潜在表征空间中预测未来状态,降低计算复杂度。此外,DreamZero联合预测未来视频与连续动作,实现了世界动作模型的零样本策略能力。报告还讨论了训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身需求、物理一致性校验以及世界模型评估方法等挑战。