正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
算法研究

面向太空机器人的无奖励持续适应框架

研究提出一种无奖励的持续学习框架,利用潜在状态世界模型,使太空机器人在硬件严重退化时无需新奖励即可适应,并在多项模拟任务中验证。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1376

太空机器人运行在极端环境中,硬件退化会严重影响传统控制策略。虽然持续强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身提供了一种在线适应的潜在机制,但它在部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身期间需要访问奖励信号,而太空中精确计算奖励往往不可行,因为缺乏外部追踪系统且环境复杂。为此,研究人员提出一种无奖励的持续学习框架,利用潜在状态世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。通过在多种模拟环境中预训练基于模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身的智能体,世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在其潜在空间内学习奖励结构的稳健预测器。部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身到硬件严重退化的环境后,冻结观测编码器和奖励预测器,仅通过无监督滚动更新世界模型的转移动力学。通过在更新后的世界模型生成的想象轨迹上训练策略,智能体无需接受新奖励即可适应变化的动力学。研究在遭受严重形态故障的模拟行星穿越、轨道导航和精密装配任务中展示了该方法。