蚂蚁灵波开源全球首个具身智能MoE视频模型LingBot-Video
蚂蚁集团旗下蚂蚁灵波发布并开源LingBot-Video,这是全球首个面向具身智能的MoE视频基础模型,旨在为机器人提供符合物理规律的世界模拟器。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

蚂蚁集团旗下蚂蚁灵波今日正式开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身LingBot-Video——全球首个面向具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身的大规模MoE(混合专家)视频基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身,也被称为视频物理引擎。该模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身总参数量达30B,但得益于MoE架构,单次推理仅激活3B参数,显著降低计算成本。
与通用视频生成模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身追求画质和美观不同,LingBot-Video的核心优化目标是物理规律符合度。训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身包含超过70,000小时的具身相关视频,覆盖机器人操作、导航、第一视角等场景。模型采用多维奖励系统,从感知、物理和执行三个维度约束生成结果,确保物体不穿透、运动符合重力惯性、动作可落地。
在评测方面,LingBot-Video在文本到图像到视频(TI2V)任务上达到开源模型最佳,在General Quality和Embodied Domain两项得分中均列第一。此外,它在机器人评测基准RBench上超越通用视频生成标杆模型。
蚂蚁灵波表示,LingBot-Video旨在作为机器人的数据引擎、策略评估器和动作规划器,为机器人提供低成本、可反复试错的物理世界模拟环境。模型已在GitHub、HuggingFace和ModelScope等平台开源,技术报告同步发布。