ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
PAPERS 论文追踪
具身智能的论文又多又难啃。我们每天替你筛一遍 arXiv,只留下真正重要的工作——每篇都附一句「说人话」的通俗解释,看不懂公式也能知道它牛在哪。
收录 132 篇 · 覆盖 67 个技术部件 · 累计 ▲ 0 次点赞
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
H2INT:面向密集不确定人群的机器人导航交互Transformer
研究者提出H2INT强化学习框架,编码人机交互关系以提升密集人群中的导航安全与鲁棒性,并完成真机验证。
面向多机械手泛化的任务自适应视觉-语言-抓取框架 AdaRoboVLG
研究人员提出AdaRoboVLG框架,将基础模型先验与可泛化抓取合成解耦,实现跨机械手泛化和功能抓取。
综述论文提出统一机器人学习框架:融合表征学习、VLA模型与世界模型
论文梳理机器人学习中表征、VLA模型与世界模型的互补关系,提出统一分类法并指出集成挑战与未来方向。
新研究提出基于拓扑图的宏观动作强化学习方法,提升连续环境视觉语言导航性能
研究提出拓扑图宏观动作强化学习框架,在视觉语言导航任务中取得领先表现。
面向安全关键具身系统的世界模型新视角:风险知情世界模型
研究者提出风险知情世界模型框架,将世界建模的重心转向后果认知与决策支持,以应对安全关键场景下的结构性挑战。
UMR:基于学习点云对应的人形机器人统一运动重定向框架
研究提出统一运动重定向框架UMR,通过学习点云对应实现无需人工映射的人形机器人运动重定向。
ProxPI:用于学习先验失配下基于采样的MPC的邻近先验注入方法
研究提出ProxPI方法,通过软邻近代价整合策略先验,提升MPPI控制在先验失配时的性能。
ADAPT:面向鲁棒且可操控的在线文本驱动人形机器人控制的敏捷扩散动作先验
研究提出ADAPT端到端框架,通过扩散动作先验和强化学习实现文本指令直接控制人形机器人。
CAER:面向世界模型训练的因果动作效应重加权方法
研究者提出CAER训练范式,通过重加权损失聚焦动作因果影响的视频帧,提升世界模型的物理一致性与可控性。
Zeva:面向泛化具身操作的情境因果学习框架
Zeva提出具身智能在线情境学习框架,在保持策略模型冻结时,从机器人自身物理交互经验中提取因果信号,实现部署中自我进化。