ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
PAPERS 论文追踪
具身智能的论文又多又难啃。我们每天替你筛一遍 arXiv,只留下真正重要的工作——每篇都附一句「说人话」的通俗解释,看不懂公式也能知道它牛在哪。
收录 132 篇 · 覆盖 67 个技术部件 · 累计 ▲ 0 次点赞
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
H2INT:面向密集不确定人群的机器人导航交互Transformer
研究者提出H2INT强化学习框架,编码人机交互关系以提升密集人群中的导航安全与鲁棒性,并完成真机验证。
面向多机械手泛化的任务自适应视觉-语言-抓取框架 AdaRoboVLG
研究人员提出AdaRoboVLG框架,将基础模型先验与可泛化抓取合成解耦,实现跨机械手泛化和功能抓取。
综述论文提出统一机器人学习框架:融合表征学习、VLA模型与世界模型
论文梳理机器人学习中表征、VLA模型与世界模型的互补关系,提出统一分类法并指出集成挑战与未来方向。
新研究提出基于拓扑图的宏观动作强化学习方法,提升连续环境视觉语言导航性能
研究提出拓扑图宏观动作强化学习框架,在视觉语言导航任务中取得领先表现。
面向安全关键具身系统的世界模型新视角:风险知情世界模型
研究者提出风险知情世界模型框架,将世界建模的重心转向后果认知与决策支持,以应对安全关键场景下的结构性挑战。
UMR:基于学习点云对应的人形机器人统一运动重定向框架
研究提出统一运动重定向框架UMR,通过学习点云对应实现无需人工映射的人形机器人运动重定向。
ProxPI:用于学习先验失配下基于采样的MPC的邻近先验注入方法
研究提出ProxPI方法,通过软邻近代价整合策略先验,提升MPPI控制在先验失配时的性能。
ADAPT:面向鲁棒且可操控的在线文本驱动人形机器人控制的敏捷扩散动作先验
研究提出ADAPT端到端框架,通过扩散动作先验和强化学习实现文本指令直接控制人形机器人。
CAER:面向世界模型训练的因果动作效应重加权方法
研究者提出CAER训练范式,通过重加权损失聚焦动作因果影响的视频帧,提升世界模型的物理一致性与可控性。
Zeva:面向泛化具身操作的情境因果学习框架
Zeva提出具身智能在线情境学习框架,在保持策略模型冻结时,从机器人自身物理交互经验中提取因果信号,实现部署中自我进化。
ChainSplat:从多视角RGB视频学习可变形线性物体动力学的新型框架
ChainSplat提出从多视角RGB视频学习可变形线性物体动力学,实现实时状态与力估计。
STEP:面向人机协作的状态感知任务估计与规划方法
STEP方法利用多模态大语言模型估计系统状态并预测状态转移,提升工业人机协作任务规划的可执行性。
深海机器人仿真:超越浅水真实感的物理与传感器接地模型
研究提出Stonefish仿真器的深海扩展,增强流体动力学、传感器模型与水下光学,支持实时仿真,服务于深海机器人导航与自主性研究。
具身智能新论文:PhysCaP以物理启发探索增强代码策略代理
PhysCaP论文提出用物理启发探索将代码策略代理应用于真实世界机器人任务,实现物理推理。
EgoNav:结合学习航点与几何感知局部控制的室内导航新方法
EgoNav通过语义分割与自适应局部规划,提升室内机器人导航的成功率与路径效率。
开源框架Code World Model:用代码智能体模拟世界演变
新框架将代码智能体与视频模型结合,实现规则一致的世界状态演化。
StreamPI:面向VLA模型的流式多模态时间建模框架
StreamPI框架为单帧VLA模型赋予时间推理能力,无新增参数,在真实机器人和LIBERO基准上超越pi0.5。
MA-VLA:多臂视觉-语言-动作模型实现协作与组合泛化
MA-VLA通过原子动作分配和臂洗牌机制,实现多臂机器人的组合泛化与协作,在未见协作模式中表现优异。
CARO:用于四足机器人零样本鲁棒移动的接触无关残差观测方法
CARO框架将固定基座欧拉-拉格朗日模型嵌入强化学习,免接触传感实现四足机器人零样本鲁棒移动。
面向太空机器人的无奖励持续适应框架
研究提出一种无奖励的持续学习框架,利用潜在状态世界模型,使太空机器人在硬件严重退化时无需新奖励即可适应,并在多项模拟任务中验证。
Guided Riemannian Optimization (GuRO):连接模型预测控制与决策Transformer
新框架GuRO结合MPC与RL,用黎曼优化提升四足控制训练效率。
自由能门控可塑性实现人机物理交互中的实时在线运动学习
日本研究者提出自由能门控可塑性(FEGP),在真实人机交互中让随机初始化的机器人神经网络在线学习三种循环运动模式,无需预训练。
ParallelWorld:面向具身推理的测试时扩展框架
研究者提出ParallelWorld,一种多步前瞻的具身推理测试时扩展框架,通过验证器引导的树搜索提升主动感知性能。
NeSAM:面向越野移动的神经符号运动动力学与土壤自适应框架
研究提出NeSAM框架,结合解耦式Bekker-Wong地面力学与变压器残差模型,提升越野车辆运动预测精度。
面向人形机器人的专业网球风格:自适应运动规划与跟踪框架AdaPT
上海AI实验室等机构提出AdaPT框架,使人形机器人从转播视频学习网球发球和回合风格,并在G1和Dobat Atom机器人上实现真实部署。
CoToGrasp:基于接触拓扑条件的灵巧抓取合成新框架
法国科研团队提出CoToGrasp框架,在规范工作空间内学习接触流形,无需物体标注即可按接触拓扑生成稳定抓取,并完成真机验证。
GOAG:面向灵巧操作的生成式物体无关抓取规划器
法国研究团队提出GOAG抓取规划器,利用抓取器与物体接触面几何一致性,实现物体无关的训练和高效采样,平均成功率达86.93%
QDOS:面向离线到在线强化学习的质量-多样性技能学习新方法
东京大学团队提出QDOS方法,通过优势加权质量-多样性预训练从离线数据中提取多样且高价值的技能,提升机器人操作和运动任务性能。
CoToGrasp提出接触拓扑条件化灵巧抓取合成方法
新框架CoToGrasp以对象无关方式学习接触流形,实现零样本泛化,在DexGraspNet上达到先进性能并完成实物验证。
EXIMO:利用视觉语言模型引导VLA策略微调的新方法
EXIMO算法通过探索、模仿、优化三阶段,利用视觉语言模型规划,提升VLA策略微调的样本效率和最终性能。
PartialBiGrasp:从部分视角推断隐藏局部几何以进行双臂抓取
研究提出PartialBiGrasp框架,利用部分点云观测生成双臂抓取,通过卷积占用网络和采样优化,实现稳定抓取。
Dream2Reward:基于正向演示的过渡对齐奖励模型助力机器人操作
研究团队提出Dream2Reward奖励模型,无需失败标注即可从成功演示中学习,提升机器人操作策略学习效果。
北大团队用 Franka 机器人完成豆腐精细操作演示
北京大学研究团队借助 Franka Research 3 机器人,在模型自主决策下完成豆腐等柔软物体的精细操作,展示高精度力控能力。
Hydra-0:面向通用世界建模与控制的动作流方法
Hydra-0提出以动作流为统一视觉接口的世界模型,跨本体降低运动误差并支持零样本组合与数据高效适应,在RoboLab基准上达到高相关性。
通用世界模型Hydra-0发布:以动作流为共享控制接口
研究提出Hydra-0通用世界模型,以动作流为共享视觉接口,降低机器人运动误差并支持零样本组合与数据高效适配。
MatchingPolicy:基于语义对应的跨物体上下文模仿学习策略
MatchingPolicy将对应关系识别与策略解耦,实现少样本跨物体泛化的新方法。
Orbit-Planner:面向在轨避障的潜在世界模型
研究者提出两阶段潜在世界模型Orbit-Planner,用于卫星在轨避障,在Isaac Sim中闭环导航成功率达91.7%。
Cyclops:将LiDAR转化为彩色相机的感知框架
新框架Cyclops将稀疏激光雷达强度转化为RGB视频,实现在弱光环境下借助视觉模型完成全天候感知任务。
Tac4Loco:利用足底压力时空表征实现人形机器人稳健行走
该研究提出Tac4Loco框架,利用足底压力阵列的时空表征提升人形机器人在复杂地形上的行走鲁棒性,并开源代码。
算法-架构协同设计的VLA推理加速框架SpecVLA
研究提出SpecVLA,利用机器人环境状态切换实现长动作长度推测与验证,降低延迟并保持任务成功率。
OccPlanner:面向像素目标的占用条件扩散规划器
OccPlanner通过占用条件扩散模型,将像素目标映射到机器人度量空间,显著提升导航成功率。
Mind the Context: 环境-社会解耦实现机器人行为持续学习
剑桥团队提出EDD框架,通过显式解耦环境与社会知识,并采用重放策略,提升社交机器人在多场景下的持续学习能力。
Seeker:从动作中学习注意力,提升策略学习的视觉瓶颈
新方法Seeker从动作监督中学习任务相关区域,提升机器人学习数据效率与鲁棒性,在真实机器人上成功率大幅提升。
NestDex:基于辅助遥操作的嵌套策略学习用于灵巧操作
NestDex框架利用学习到的灵巧手技能辅助遥操作数据采集,再由外层视觉运动策略学习自主控制,提升真机灵巧操作的学习效率与可靠性。
面向执行器功率损失的四足机器人容错运动学习方法
研究者提出容错运动强化学习方法,使用非对称演员-评论家架构与可学习步态频率,在68千克四足机器人上验证。
面向动作分块模仿学习的校准干预新框架
新框架AutoIntervene利用视觉-动作支持记忆,校准阈值,在部署中动态切换策略与操作员控制,提升机器人任务成功率。
世界模型新框架WorldTrace:突破长程视频记忆瓶颈
WorldTrace框架解决交互式视频世界模型长程视觉记忆问题,在LoopBench基准上分别提升时序一致性与情景回忆能力15.5%和19.5%。
GeniWorld:通过视觉动作实现泛化的机器人交互世界模型
新研究提出GeniWorld世界模型,利用URDF渲染将动作转为视觉表示,提升机器人操作在未知场景的泛化能力。
ErgoSurf:基于遍历控制与触觉感知的未知曲面覆盖方法
新方法ErgoSurf利用触觉感知和高斯过程隐式曲面模型,在未知曲面上实现同时遍历覆盖与几何重建。
iARCS:面向可控三维场景生成的迭代式智能体强化学习框架
iARCS框架通过迭代智能体强化学习,提升合成三维场景生成的功能约束满足度,并改善下游具身智能训练数据质量。
JoyAI-RA 0.5提出双动作对齐框架,扩展机器人操作学习
JoyAI-RA 0.5提出双动作对齐框架,利用人类视频等异构数据扩展操作学习,基准测试表现优异。