自变量发布跨模态具身动作分词器 X-Tokenizer
自变量机器人提出跨模态动作分词器X Tokenizer,通过语义残差量化实现动作语义与几何分离,提升多模态对齐与长程任务性能。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准
自变量机器人发布跨模态具身动作分词器X-Tokenizer,重新定义了VLA中的动作离散化问题。该分词器采用编码器-语义残差量化解码器架构,在涵盖17个机械臂像人的手臂一样伸展抓取的装置,是工业自动化里最成熟的机器人形态,也是人形机器人「胳膊」的技术前辈。◆ 小白科普 · 现身系列的240万条轨迹上进行预训练。不同于传统分词器仅以最小化重建误差为目标,X-Tokenizer通过掩码动作建模学习粗粒度动作意图,并引入与预训练VLM表征空间的对比对齐及未来帧视觉语言特征预测两类跨模态监督信号。实验结果显示,相比FAST分词器,多模态对齐能力提升13.5%,长程任务性能提升8.25%。在RoboTwin 2.0基准评测上,采用X-Tokenizer的WALL-OSS模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身在简单和困难任务上均超越Pi 0、Pi 0.5等业界主流模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身。真机测试中,7个桌面任务的表现表明X-Tokenizer在长程推理任务上有8.25%的提升。