算法-架构协同设计的VLA推理加速框架SpecVLA
研究提出SpecVLA,利用机器人环境状态切换实现长动作长度推测与验证,降低延迟并保持任务成功率。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
上海交通大学等机构的研究人员提出SpecVLA,一种面向视觉-语言-动作(VLA)模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身的算法-系统协同设计框架,旨在加速具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身推理并支持实时部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身。研究团队观察到机器人与环境交互中,动作状态具有活跃与非活跃的交替模式,据此提出在非活跃状态下进行长动作长度推测,并在活跃状态下选择性验证的新调度策略。算法层面,SpecVLA引入了状态感知的VLA推理执行范式,并利用差分残差和块级混合精度量化构建更小的验证模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身sVLA。系统层面,设计了由GPU和专用机器人硬件模块组成的异构架构,通过推测数据流实现VLA与sVLA的并行执行。
在OpenVLA和RDT模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身上,基于LIBERO和ManiSkill基准的评估显示,SpecVLA在保持任务成功率的同时显著降低了端到端指「从眼睛到手」由一个 AI 模型直接完成的技术路线:输入画面和指令,直接输出动作,中间不再由工程师人工拆分步骤。◆ 小白科普 · 现身推理延迟,实现了高效且可靠的实时机器人操作。该研究成果已在arXiv平台发布。