上海交大提出WLA模型,融合语言意图与物理动态提升机器人长程任务能力
上海交大DENG Lab提出WLA模型,将子任务语言进度与物理动态预测分离,在长程任务中成功率56.5%,推理延迟仅40毫秒。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
上海交通大学DENG Lab提出WLA(World-Language-Action Model)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,旨在解决机器人长程任务中的进度跟踪难题。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身将“下一状态”拆解为高层文本意图与低层物理动态:语言模块以自回归方式生成子任务并写入记忆缓冲区,作为可追踪的执行记录;物理模块则通过meta-queries从上下文中压缩关键状态变化,用于训练但无需在推理时全量运行。高效模式下,WLA-0仅激活约2B参数,在RTX 5090上单次推理耗时约40毫秒。
在长程依赖的RMBench基准上,WLA-0平均成功率达56.5%,远超Fast-WAM的13.3%和VLA基线的5.5%;消融实验显示,去掉子任务预测后成功率骤降至17.25%,证实语言进度跟踪的关键作用。在RoboTwin 2.0 Clean中,WLA-0达到92.94%,真机动态任务中推理延迟比Motus低约40倍。不过,真机验证仅覆盖单一双臂平台的少量任务,且从真实人类第一视角视频学习未见任务尚未成功,作者归因于域差异。模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身权重、训练及部分评测代码已开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身,但高效模式、TTS模式及视频学习代码尚未完全开放。