TECHNOLOGY · 技术
VLA
解码VLA表征中的任务进度
研究发现从VLA模型π_{0.5}的残差流中可线性读取任务进度信号,并用作无标签OOD检测器。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
一篇发表于arXiv的研究探讨了从视觉-语言-动作模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身(VLA)的内部表征中解码任务进度的可能性。研究人员受机械可解释性启发,对π_{0.5}模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身的残差流进行探测,发现任务进度(轨迹中剩余时间的归一化量)可从激活中线性读取。该信号在预训练的PaliGemma骨干网络中存在,早于机器人数据训练。单一线性探针可泛化指 AI 面对没见过的新东西、新场景时也能举一反三做出正确反应的能力。这是「通用机器人」和「专用机器」的分水岭。◆ 小白科普 · 现身至未见任务,并在多提示训练下对语言反事实产生变化,但无法实现有意义的策略引导。这一特性使该信号可用于部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身VLA的监控。研究者将探针用作无标签的OOD检测器,能检测停滞的任务进度,性能与先进方法相当。结果表明,VLA拥有丰富的、可线性读取的内部表征,如任务进度,学习读取这些信号可为监控部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身的视觉运动策略提供轻量可解释的路径。