TECHNOLOGY · 技术
算法
Guided Riemannian Optimization (GuRO):连接模型预测控制与决策Transformer
新框架GuRO结合MPC与RL,用黎曼优化提升四足控制训练效率。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
研究人员提出一种名为Guided Riemannian Optimization(GuRO)的框架,旨在将模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身预测控制(MPC)与强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身(RL)集成到序列决策框架中,并利用曲率感知优化高效处理非凸损失景观。MPC提供局部最优轨迹预测,引导决策Transformer的训练,从而无需大量离线预训练。为缓解传统优化器收敛慢且不稳定的问题,该方法在黎曼参数空间中采用高效的曲率感知优化方法,实现更快、更稳健的训练。研究团队在高维四足控制任务上评估了该框架,结果显示其在与TRPO、SAC和在线决策Transformer等强基线的对比中一致胜出,获得更高回报和更快收敛。该工作为具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身中的运动控制让机器人的身体按想法精准动起来、并保持平衡的技术,相当于人类的「小脑」。◆ 小白科普 · 现身提供了新的技术思路。