TECHNOLOGY · 技术
VLA模型编辑精选
StreamPI:面向VLA模型的流式多模态时间建模框架
StreamPI框架为单帧VLA模型赋予时间推理能力,无新增参数,在真实机器人和LIBERO基准上超越pi0.5。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在机器人操作中展现出有效性,但当前最优模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身如pi0.5采用单帧范式,限制了其对历史观测的保留和精确空间感知。针对此问题,研究者提出StreamPI,一种流式多模态时间建模框架,在不引入额外参数的情况下为单帧VLA赋予时间推理能力。其核心设计为指令锚定时间建模,将每个(视觉观测,语言指令)对视为原子时间单元:对内双向注意力实现跨模态融合,跨对因果注意力保持自回归流式推理,使语言指令在整个任务执行中成为持续语义锚点。为弥合同步训练与异步真实机器人部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身的差距,引入随机间隔流式训练策略,合适的帧间隔(如每3帧)可实现更快更平滑的动作执行,间隔随机化则提升对帧时序扰动的鲁棒性。
凭借LLM主干的外推能力,StreamPI无缝继承预训练单帧权重,支持灵活的单帧和多帧推理。在依赖记忆和精确感知的真实机器人任务以及仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身基准LIBERO上的实验表明,StreamPI在多样任务上优于pi0.5。