TECHNOLOGY · 技术
具身基础模型
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1通过慢速推理与快速控制的解耦架构,在城市场景导航中实现35.0%的POI到达率提升,达到77.3%。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

视觉语言导航基础模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身旨在将深度推理与空间决策统一,以应对多样的具身任务。当前方法通常采用整体策略将观测直接映射到动作,但易受坐标漂移和长尾语义问题影响。ABot-N1通过慢-快架构将认知与控制解耦:慢速视觉语言推理器执行显式思维链推理,生成像素级目标作为通用接口,支持点目标、对象目标、兴趣点目标、指令跟随和人物跟随等任务;快速动作专家利用文本线索和像素引导,以原生控制频率生成连续航点。该方法在仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身和真实世界基准测试中展现了鲁棒性、泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身性和可解释性。ABot-N1在城市级导航中创下新纪录,兴趣点到达率提升35.0%至77.3%,在复杂室内外场景中实现95.4%和92.9%的成功率。此外,研究团队开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身了新的点目标和兴趣点目标基准,以推动城市级导航领域发展。