TECHNOLOGY · 技术
机器人控制
ProxPI:用于学习先验失配下基于采样的MPC的邻近先验注入方法
研究提出ProxPI方法,通过软邻近代价整合策略先验,提升MPPI控制在先验失配时的性能。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
来自韩国的研究者提出一种名为ProxPI(邻近先验注入)的方法,用于改进策略引导的模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身预测路径积分(MPPI)控制。当学习到的策略先验与任务不匹配时,现有方法将采样分布以策略输出为中心,限制了探索并阻碍优化器向任务最优解恢复。ProxPI保留以标称轨迹为中心的MPPI采样,并通过软邻近代价整合策略输出,从而在策略处于分布内时保持同等的性能,同时在策略失配时能够摆脱不准确的先验,恢复至基础MPPI的性能水平。理论分析表明,以先验为中心的重新定位会丢弃优化器每次的修正,而以标称轨迹为中心的采样则保留修正并收敛至任务代价与先验共同决定的解集,且增大预算也无法消除该问题。仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身与真实机器人实验验证了方法在分布内外任务中的鲁棒性。相关论文已发表于arXiv。