闭源到现实差距:灵巧力控抓取与操作的零样本仿真到现实部署
研究提出仿真到现实强化学习方法,结合触觉与关节扭矩传感,实现五指灵巧手零样本抓取与物体重定向。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
该研究提出一种仿真到现实Sim2Real先让机器人在虚拟环境训练,再把学到的能力迁移到真实机器。◆ 小白科普 · 现身(sim-to-real)强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身方法,通过密集触觉反馈与关节机器人身上可以转动或弯曲的连接部位。每多一个关节,就多一种动作的可能,也多一份重量、成本和故障点。◆ 小白科普 · 现身扭矩传感的融合显式调节物理交互,使多指灵巧手Dexterous Hand安装在机械臂末端、可以完成多指抓握和精细操作的机器人手。◆ 小白科普 · 现身在真实硬件上实现零样本部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身。为克服接触动力学与驱动不完善带来的挑战,研究引入了三种关键技术:一是基于并行正向运动学的快速触觉仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身,通过计算密集虚拟触觉单元与物体间的距离,提供强化学习所需的高速率、高分辨率触觉信号;二是电流-扭矩标定方法,利用电机电流映射至关节扭矩,消除了灵巧手上扭矩传感器把力、光、距离等物理信号转换成电信号的元件,相当于机器人的「感官」。◆ 小白科普 · 现身的需求;三是执行器动力学建模与随机化处理,通过模拟非理想扭矩-速度效应弥合驱动差距。采用非对称演员-评论家PPO流水线,完全在仿真中训练策略后直接部署至五指灵巧手。
实验展示了两种类人灵巧操作技能:基于指令的可控抓取力跟踪与手掌内物体重定向,均在无需机器人微调的情况下稳健执行。据作者称,这是首次在完全仿真训练的多指灵巧手上实现可控抓取并零样本迁移至真实硬件。