TECHNOLOGY · 技术
具身大模型编辑精选
Latent Memory Palace:将控制推理转化为自回归变分推断的框架
研究者提出Latent Memory Palace框架,将控制策略的推理过程建模为自回归变分推断,实现可适应的测试时计算分配,并在仿真和真实世界中获得良好表现。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
本研究提出了一种名为Latent Memory Palace(LMP)的新框架,旨在将连续控制策略中的推理过程形式化为自回归变分推断。该方法借鉴了“记忆宫殿”思想,通过在自回归潜在空间中组织信息,并采用迭代自适应检索机制,克服了直接利用语言空间进行推理在空间理解和精确运动方面的局限性。LMP框架从变分推断的角度重新审视控制中的推理问题,并推导出一种潜在空间强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身技术,以可计算地优化其变分下界。基于该框架的策略LMP-π在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实世界任务中均展现出强劲性能,同时具备可解释性和测试时计算的自适应分配能力。此外,同一框架还衍生出可变长动作分词器LMP-tok,能够显著提升下游自回归策略的表现。这些成果为通过变分推断实现控制中的潜在推理提供了新的视角。