正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
在线强化学习编辑精选

星尘智能发布SmoothRL框架,解决机器人异步执行中在线强化学习难题

星尘智能发布SmoothRL,实现在线强化学习适配异步推理,真机测试成功率大幅提升。

文 / 现身编辑部来源 / 量子位1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

星尘智能发布SmoothRL框架,解决机器人异步执行中在线强化学习难题
资料图片 · 来源:量子位 · 加载失败时显示生成封面

星尘智能基座模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身团队发布异步执行的在线强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身框架SmoothRL,旨在解决大模型用海量数据训练出来的超大规模 AI 程序,具备一定的理解和推理「常识」。ChatGPT 是语言大模型,机器人用的是能输出动作的大模型。◆ 小白科普 · 现身异步推理成为真实部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身常态后,在线强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身应如何适配的问题。在传统在线强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身中,模型生成的动作与机器人执行的动作一致,但异步推理打破了这种对应关系,导致部分动作被替换或未执行,若整体优化则可能错误归因。SmoothRL将动作块按执行状态分为已提交区域、执行区域和丢弃区域,只对真正执行的执行区域进行梯度更新,并在训练过程中直接模拟异步推理,使训练与部署一致。团队在星尘智能S1机器人上测试了三项任务,动态投掷成功率从39%提升至94%,给笔戴帽成功率从8%提升至83%,快递开箱成功率从30%提升至90%。

此外,在线强化学习后末端执行器的加速度均方根下降52%,急动度下降47%。该框架采用稀疏的任务成功或失败奖励,操作员可在必要时介入,属于面向部署的在线后训练机制。下一步团队计划探索更大范围的策略更新和更广泛的任务分布。