VLA
Vision-Language-Action
把视觉、语言理解和机器人动作连接起来的模型:看见环境、听懂指令,再输出动作。
LOADING
页面加载中START HERE · 从零开始
这一页不预设你知道任何背景。我们不堆术语、不甩公式,只用大白话回答七个问题:具身智能到底是什么、机器人身体里都有什么、哪些黑话必须懂、哪些公司在做、去哪里继续看。
如果把 ChatGPT 装进一个会走、会看、会抓东西的身体里,你就得到了具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身。过去两年刷屏的人形机器人,本质上都是它的载体:AI 负责动脑,机器人负责动手。它和工厂里那些只会重复同一个动作的机械臂完全不同——具身智能的目标,是让机器像人一样,在没见过的环境里也能随机应变。
「随机应变」为什么这么难?因为真实世界的大部分知识是说不清的:杯子拿多重会滑、门把手要往下压还是往里拧、地毯和瓷砖走起来有什么差别——这些只能靠身体去试。所以机器人的身体本身就是一门大学问:自由度DoF机器人能独立运动的方向数量;自由度越多,动作通常越灵活,控制也更复杂。◆ 小白科普 · 现身决定它能不能做出某个动作,灵巧手Dexterous Hand安装在机械臂末端、可以完成多指抓握和精细操作的机器人手。◆ 小白科普 · 现身是它干活的「最后一厘米」,六维力传感器该术语的解释暂未收录,编辑部正在补充。◆ 小白科普 · 现身则让它知道自己下手重了还是轻了。
那它怎么学会干活?两条路一起跑:一条是让人通过遥操作Teleoperation由人在远端控制机器人完成动作,并把这些示范记录为训练数据。◆ 小白科普 · 现身手把手「代打」,把示范录下来给 AI 反复学;另一条是先在电脑模拟的虚拟世界里练熟,再迁移到真机,行话叫仿真到现实Sim2Real先让机器人在虚拟环境训练,再把学到的能力迁移到真实机器。◆ 小白科普 · 现身。而最终指挥这一切的「大脑」,是一个叫VLAVision-Language-Action把视觉、语言理解和机器人动作连接起来的模型:看见环境、听懂指令,再输出动作。◆ 小白科普 · 现身的大模型——看懂画面、听懂人话、输出动作,一气呵成。
人形机器人可以拆成三层:「大脑」负责思考,「五官和皮肤」负责感知,「四肢关节」负责出力。下面这张图上标了 8 个关键部件,点任意一条,去部件库看更细的拆解。
新闻里反复出现的 6 个黑话,每张卡一句话讲清。看懂它们,你就超过了 90% 的围观群众。
Vision-Language-Action
把视觉、语言理解和机器人动作连接起来的模型:看见环境、听懂指令,再输出动作。
End-to-End
一个 AI 模型从「看见」到「动手」全包圆,中间不靠人工拆分感知、规划、控制等小模块。好处是更灵活、会举一反三;代价是像个黑盒子,出了问题不好修。
Sim2Real
先让机器人在虚拟环境训练,再把学到的能力迁移到真实机器。
Teleoperation
由人在远端控制机器人完成动作,并把这些示范记录为训练数据。
DoF (Degree of Freedom)
机器人能独立运动的方向数量;自由度越多,动作通常越灵活,控制也更复杂。
Embodied Foundation Model
装进机器人身体里的大模型。相当于把 ChatGPT 的「常识」移植进机器人体内,让它理解「杯子会碎」「门要拉开才能进」这类物理世界的规矩。
这里按本站公开报道中的出现频次列出代表性主体,点击即可继续查看相关资讯。
蚂蚁灵波携手机器人智慧药房方案入选WAIC镇馆之宝,其跨本体具身基座模型实现“一脑多机”协同作业。
去公司库了解 →02逐际动力发布全尺寸人形机器人Oli全自主完成长程家务的演示,并推出三层架构大脑系统LimX COSA 0.5,技术水平与Figure相当。
去公司库了解 →03中国电子学会组织召开世界模型专家座谈会,并调研光轮智能等企业,强调世界模型对具身智能的支撑作用。
去公司库了解 →04云深处科技四足机器人在瑞士莱布施塔特核电站实现巡检部署,替代人力进入高危环境执行全天候自主作业。
去公司库了解 →05逐际动力完成近2亿美元Pre-IPO轮融资,投后估值150亿元,资金将用于大小脑融合技术突破和数千台人形机器人规模化部署。
去公司库了解 →06蚂蚁灵波开源LingBot-VLA 2.0,支持20种机器人构型,预训练数据达6万小时,在双臂协同和移动操作评测中领先。
去公司库了解 →概念看完了想再深入一点?这里列出正式资讯库中最新的技术与产品文章。
短期内,机器人先接手的是「重复、危险、缺人」的活:工厂搬运、夜班巡检、危险环境作业。历史上每一轮自动化都淘汰了部分岗位、也创造了新岗位——机器人运维、数据采集、训练师这些职业几年前还不存在。与其担心被替代,不如现在开始了解它,你正在读的这篇文章就是第一步。
差距很大:面向科研和开发者的机型已经打到 10 万元人民币上下(宇树 G1 起售价 9.9 万元);全尺寸工业机型目前普遍在几十万到上百万元;马斯克给 Optimus 定的长期目标是 2-3 万美元,和一辆汽车相当。整体趋势和当年的电脑一样:性能涨、价格跌。
路线基本确定:先进工厂,再进商场酒店,最后才进家庭——家里环境最乱、安全要求最高,是最后一关。1X 的 NEO 已开始家庭试点,能做一些取物、叠衣的演示,但离「随便使唤」普遍估计还有 5-10 年。先把期待调到「能帮忙搭把手的笨拙室友」比较现实。
不一定。很多惊艳视频背后是人在远程遥控(行话叫遥操作),或是拍了几十遍才成功的精选片段。判断含金量看三点:是不是全程自主完成、成功率高不高、能不能连续干几小时不出错。看到「100% 自主 + 一镜到底」的演示,才值得真激动。
因为它会在十年内影响你的工作、消费和生活:哪些岗位在消失、哪些在出现;家电、汽车、物流会不会因此变便宜;甚至你父母未来的养老照护。具身智能是继互联网、智能手机之后,最有可能重塑日常的硬科技浪潮——早看懂的人,早做准备。