TECHNOLOGY · 技术
世界模型编辑精选
世界模型新框架WorldTrace:突破长程视频记忆瓶颈
WorldTrace框架解决交互式视频世界模型长程视觉记忆问题,在LoopBench基准上分别提升时序一致性与情景回忆能力15.5%和19.5%。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

交互式视频世界模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身依赖键值缓存作为不断增长的视觉记忆,以延续先前生成的帧。然而研究表明,当推演超出训练范围时,由于时间旋转位置嵌入(RoPE)偏移超出训练时所见范围,模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身难以通过注意力可靠地检索相关视觉信息。此外,在RoPE旋转空间中朴素压缩缓存会因平均不兼容的相位而破坏记忆。为此,研究提出WorldTrace,一种无需训练的内存框架,通过为每个摘要槽分配独特的分布内虚拟位置,保持压缩内存的可寻址性。该框架包含两种压缩方法:WorldTrace-Field为时序一致性压缩历史,WorldTrace-Landmark则在检测到的场景转换处存储逐字场景轨迹以实现情景回忆。
同时引入基准LoopBench,评估压缩缓存能否在长途绕行后重建先前访问的场景。实验表明,WorldTrace-Field在LoopBench上将时序一致性提升15.5%,WorldTrace-Landmark将情景回忆能力提升19.5%,无需重新训练即可扩展视觉持久生成。