正在发生
现身看见具身智能正在发生
TECHNOLOGY · 技术
具身大模型

iARCS:面向可控三维场景生成的迭代式智能体强化学习框架

iARCS框架通过迭代智能体强化学习,提升合成三维场景生成的功能约束满足度,并改善下游具身智能训练数据质量。

文 / 现身编辑部来源 / arXiv1 分钟读完技术 · XIANSHEN

AI 编撰 · 内容基于所列来源,重要信息请以原文为准

现身编辑封面 · 几何图形由站内算法生成 · article-1236

近期研究指出,合成三维场景生成在计算机视觉和具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身领域常被用作训练数据用来「喂」给 AI 模型学习的教材。对机器人来说,主要是「看到的画面 + 做出的动作」一一配对的操作示范。◆ 小白科普 · 现身来源,但现有生成器往往侧重感知层面的逼真度,难以稳定满足可通行性、可达性等任务关键约束,这限制了合成数据在电脑模拟的虚拟世界里批量生成的训练数据。成本低、速度快,但要跨过「虚拟与现实的差距」这道坎才能真正好用。◆ 小白科普 · 现身在下游训练中的实用价值。为此,研究者提出iARCS,一种迭代式智能体强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身框架,可将预训练场景生成器适配至自然语言任务需求。该方法采用两阶段策略:首先通过通用奖励预训练增强物理合理性与布局质量,随后利用大语言模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身生成的奖励程序进行任务特定微调,并根据训练反馈迭代优化。实验结果显示,该方法在可步行性、可达性及净空相关任务上提升了约束保真度,实现了有效的任务特定约束优化,同时保持了有竞争力的场景多样性。此外,研究还表明,由iARCS生成的数据可改进基础生成器的性能,这支持其作为实用合成数据在电脑模拟的虚拟世界里批量生成的训练数据。成本低、速度快,但要跨过「虚拟与现实的差距」这道坎才能真正好用。◆ 小白科普 · 现身生成工具的价值,而不只是可控场景编辑方法。