上海交大团队发布轻量级VLA模型Evo-1:仅0.8B参数,获CVPR、HuggingFace和欧莱雅三方认证
上海交大MINT实验室推出仅0.8B参数的VLA模型Evo-1,推理显存仅需2.3GB,单张4090即可训练,并在欧莱雅产线30天内完成部署,获CVPR高效能徽章和HuggingFace集成。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
上海交通大学MINT实验室(赵波副教授团队)近日发布轻量化具身大模型用海量数据训练出来的超大规模 AI 程序,具备一定的理解和推理「常识」。ChatGPT 是语言大模型,机器人用的是能输出动作的大模型。◆ 小白科普 · 现身Evo-1,仅0.8B参数,以极致的效率与性能获得三项顶级认证:CVPR 2026授予Efficient CVPR Badge、HuggingFace LeRobot官方仓库集成、在欧莱雅苏州工厂产线工厂里按工序排布的生产线。人形机器人的卖点是:换任务时不用改造产线,只换「脑子里的模型」。◆ 小白科普 · 现身30天内完成落地部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身。Evo-1采用创新的模态融合机制和两阶段后训练缓解语义漂移,避免经典预训练-后训练流程。在Meta-World多任务操Benchmark上,Evo-1平均成功率达80.6%,同期SmolVLA为68.2%、pi0仅47.9%、TinyVLA为31.6%。
在LIBERO榜单上Evo-1达94.8%,与pi0的94.2%持平;long-horizon任务达92.3%。真机实验中,Evo-1在xArm6机械臂像人的手臂一样伸展抓取的装置,是工业自动化里最成熟的机器人形态,也是人形机器人「胳膊」的技术前辈。◆ 小白科普 · 现身四个操作任务上平均成功率78%,超过pi0(73%)、OpenVLA-OFT(55%)和SmolVLA(50%)。推理效率方面,Evo-1在RTX 4090D上频率达16.4Hz,比pi0的11.5Hz快43%,显存仅2.3GB,不到pi0(17.9GB)的八分之一。团队表示,Evo-1的代码、模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身权重和训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身已全部开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身,旨在推动具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身脱离算力和数据竞赛,转向广泛落地应用。