TECHNOLOGY · 技术
算法/模型
从简单奖励揭示机器人集群涌现行为机制
研究人员提出EEC解释框架,通过Agent响应图发现多智能体强化学习隐藏的几何结构。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
多智能体强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身在机器人集群中潜力巨大,但神经策略的黑箱特性限制了其应用。本文提出两阶段EEC解释框架,包含名为Agent响应图的分析工具,可揭示机器人在空间中的决策模式,识别聚集和避让区域。ARM显示机器人隐式学习环境几何场,并利用这些结构实现协调运动。在协作形状装配任务中,ARM将未占据目标内部识别为导航目的地;在竞争捕食任务中,ARM发现捕食者维诺图边界是猎物收敛目标。