ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
PAPERS 论文追踪
具身智能的论文又多又难啃。我们每天替你筛一遍 arXiv,只留下真正重要的工作——每篇都附一句「说人话」的通俗解释,看不懂公式也能知道它牛在哪。
收录 132 篇 · 覆盖 67 个技术部件 · 累计 ▲ 0 次点赞
ROBORMBENCH揭示视觉语言奖励模型在同义指令下的脆弱性
新基准ROBORMBENCH证实当前视觉语言奖励模型在同义指令下不稳定,可翻转机器人成败判断。
H2INT:面向密集不确定人群的机器人导航交互Transformer
研究者提出H2INT强化学习框架,编码人机交互关系以提升密集人群中的导航安全与鲁棒性,并完成真机验证。
面向多机械手泛化的任务自适应视觉-语言-抓取框架 AdaRoboVLG
研究人员提出AdaRoboVLG框架,将基础模型先验与可泛化抓取合成解耦,实现跨机械手泛化和功能抓取。
综述论文提出统一机器人学习框架:融合表征学习、VLA模型与世界模型
论文梳理机器人学习中表征、VLA模型与世界模型的互补关系,提出统一分类法并指出集成挑战与未来方向。
新研究提出基于拓扑图的宏观动作强化学习方法,提升连续环境视觉语言导航性能
研究提出拓扑图宏观动作强化学习框架,在视觉语言导航任务中取得领先表现。
面向安全关键具身系统的世界模型新视角:风险知情世界模型
研究者提出风险知情世界模型框架,将世界建模的重心转向后果认知与决策支持,以应对安全关键场景下的结构性挑战。
UMR:基于学习点云对应的人形机器人统一运动重定向框架
研究提出统一运动重定向框架UMR,通过学习点云对应实现无需人工映射的人形机器人运动重定向。
ProxPI:用于学习先验失配下基于采样的MPC的邻近先验注入方法
研究提出ProxPI方法,通过软邻近代价整合策略先验,提升MPPI控制在先验失配时的性能。
ADAPT:面向鲁棒且可操控的在线文本驱动人形机器人控制的敏捷扩散动作先验
研究提出ADAPT端到端框架,通过扩散动作先验和强化学习实现文本指令直接控制人形机器人。
CAER:面向世界模型训练的因果动作效应重加权方法
研究者提出CAER训练范式,通过重加权损失聚焦动作因果影响的视频帧,提升世界模型的物理一致性与可控性。
Zeva:面向泛化具身操作的情境因果学习框架
Zeva提出具身智能在线情境学习框架,在保持策略模型冻结时,从机器人自身物理交互经验中提取因果信号,实现部署中自我进化。
ChainSplat:从多视角RGB视频学习可变形线性物体动力学的新型框架
ChainSplat提出从多视角RGB视频学习可变形线性物体动力学,实现实时状态与力估计。
STEP:面向人机协作的状态感知任务估计与规划方法
STEP方法利用多模态大语言模型估计系统状态并预测状态转移,提升工业人机协作任务规划的可执行性。
深海机器人仿真:超越浅水真实感的物理与传感器接地模型
研究提出Stonefish仿真器的深海扩展,增强流体动力学、传感器模型与水下光学,支持实时仿真,服务于深海机器人导航与自主性研究。
具身智能新论文:PhysCaP以物理启发探索增强代码策略代理
PhysCaP论文提出用物理启发探索将代码策略代理应用于真实世界机器人任务,实现物理推理。
EgoNav:结合学习航点与几何感知局部控制的室内导航新方法
EgoNav通过语义分割与自适应局部规划,提升室内机器人导航的成功率与路径效率。
开源框架Code World Model:用代码智能体模拟世界演变
新框架将代码智能体与视频模型结合,实现规则一致的世界状态演化。
StreamPI:面向VLA模型的流式多模态时间建模框架
StreamPI框架为单帧VLA模型赋予时间推理能力,无新增参数,在真实机器人和LIBERO基准上超越pi0.5。
MA-VLA:多臂视觉-语言-动作模型实现协作与组合泛化
MA-VLA通过原子动作分配和臂洗牌机制,实现多臂机器人的组合泛化与协作,在未见协作模式中表现优异。
CARO:用于四足机器人零样本鲁棒移动的接触无关残差观测方法
CARO框架将固定基座欧拉-拉格朗日模型嵌入强化学习,免接触传感实现四足机器人零样本鲁棒移动。
面向太空机器人的无奖励持续适应框架
研究提出一种无奖励的持续学习框架,利用潜在状态世界模型,使太空机器人在硬件严重退化时无需新奖励即可适应,并在多项模拟任务中验证。
Guided Riemannian Optimization (GuRO):连接模型预测控制与决策Transformer
新框架GuRO结合MPC与RL,用黎曼优化提升四足控制训练效率。
自由能门控可塑性实现人机物理交互中的实时在线运动学习
日本研究者提出自由能门控可塑性(FEGP),在真实人机交互中让随机初始化的机器人神经网络在线学习三种循环运动模式,无需预训练。
ParallelWorld:面向具身推理的测试时扩展框架
研究者提出ParallelWorld,一种多步前瞻的具身推理测试时扩展框架,通过验证器引导的树搜索提升主动感知性能。
NeSAM:面向越野移动的神经符号运动动力学与土壤自适应框架
研究提出NeSAM框架,结合解耦式Bekker-Wong地面力学与变压器残差模型,提升越野车辆运动预测精度。
面向人形机器人的专业网球风格:自适应运动规划与跟踪框架AdaPT
上海AI实验室等机构提出AdaPT框架,使人形机器人从转播视频学习网球发球和回合风格,并在G1和Dobat Atom机器人上实现真实部署。
CoToGrasp:基于接触拓扑条件的灵巧抓取合成新框架
法国科研团队提出CoToGrasp框架,在规范工作空间内学习接触流形,无需物体标注即可按接触拓扑生成稳定抓取,并完成真机验证。
GOAG:面向灵巧操作的生成式物体无关抓取规划器
法国研究团队提出GOAG抓取规划器,利用抓取器与物体接触面几何一致性,实现物体无关的训练和高效采样,平均成功率达86.93%
QDOS:面向离线到在线强化学习的质量-多样性技能学习新方法
东京大学团队提出QDOS方法,通过优势加权质量-多样性预训练从离线数据中提取多样且高价值的技能,提升机器人操作和运动任务性能。
CoToGrasp提出接触拓扑条件化灵巧抓取合成方法
新框架CoToGrasp以对象无关方式学习接触流形,实现零样本泛化,在DexGraspNet上达到先进性能并完成实物验证。
EXIMO:利用视觉语言模型引导VLA策略微调的新方法
EXIMO算法通过探索、模仿、优化三阶段,利用视觉语言模型规划,提升VLA策略微调的样本效率和最终性能。
PartialBiGrasp:从部分视角推断隐藏局部几何以进行双臂抓取
研究提出PartialBiGrasp框架,利用部分点云观测生成双臂抓取,通过卷积占用网络和采样优化,实现稳定抓取。
Dream2Reward:基于正向演示的过渡对齐奖励模型助力机器人操作
研究团队提出Dream2Reward奖励模型,无需失败标注即可从成功演示中学习,提升机器人操作策略学习效果。
北大团队用 Franka 机器人完成豆腐精细操作演示
北京大学研究团队借助 Franka Research 3 机器人,在模型自主决策下完成豆腐等柔软物体的精细操作,展示高精度力控能力。
Hydra-0:面向通用世界建模与控制的动作流方法
Hydra-0提出以动作流为统一视觉接口的世界模型,跨本体降低运动误差并支持零样本组合与数据高效适应,在RoboLab基准上达到高相关性。
通用世界模型Hydra-0发布:以动作流为共享控制接口
研究提出Hydra-0通用世界模型,以动作流为共享视觉接口,降低机器人运动误差并支持零样本组合与数据高效适配。
MatchingPolicy:基于语义对应的跨物体上下文模仿学习策略
MatchingPolicy将对应关系识别与策略解耦,实现少样本跨物体泛化的新方法。
Orbit-Planner:面向在轨避障的潜在世界模型
研究者提出两阶段潜在世界模型Orbit-Planner,用于卫星在轨避障,在Isaac Sim中闭环导航成功率达91.7%。
Cyclops:将LiDAR转化为彩色相机的感知框架
新框架Cyclops将稀疏激光雷达强度转化为RGB视频,实现在弱光环境下借助视觉模型完成全天候感知任务。
Tac4Loco:利用足底压力时空表征实现人形机器人稳健行走
该研究提出Tac4Loco框架,利用足底压力阵列的时空表征提升人形机器人在复杂地形上的行走鲁棒性,并开源代码。
算法-架构协同设计的VLA推理加速框架SpecVLA
研究提出SpecVLA,利用机器人环境状态切换实现长动作长度推测与验证,降低延迟并保持任务成功率。
OccPlanner:面向像素目标的占用条件扩散规划器
OccPlanner通过占用条件扩散模型,将像素目标映射到机器人度量空间,显著提升导航成功率。
Mind the Context: 环境-社会解耦实现机器人行为持续学习
剑桥团队提出EDD框架,通过显式解耦环境与社会知识,并采用重放策略,提升社交机器人在多场景下的持续学习能力。
Seeker:从动作中学习注意力,提升策略学习的视觉瓶颈
新方法Seeker从动作监督中学习任务相关区域,提升机器人学习数据效率与鲁棒性,在真实机器人上成功率大幅提升。
NestDex:基于辅助遥操作的嵌套策略学习用于灵巧操作
NestDex框架利用学习到的灵巧手技能辅助遥操作数据采集,再由外层视觉运动策略学习自主控制,提升真机灵巧操作的学习效率与可靠性。
面向执行器功率损失的四足机器人容错运动学习方法
研究者提出容错运动强化学习方法,使用非对称演员-评论家架构与可学习步态频率,在68千克四足机器人上验证。
面向动作分块模仿学习的校准干预新框架
新框架AutoIntervene利用视觉-动作支持记忆,校准阈值,在部署中动态切换策略与操作员控制,提升机器人任务成功率。
世界模型新框架WorldTrace:突破长程视频记忆瓶颈
WorldTrace框架解决交互式视频世界模型长程视觉记忆问题,在LoopBench基准上分别提升时序一致性与情景回忆能力15.5%和19.5%。
GeniWorld:通过视觉动作实现泛化的机器人交互世界模型
新研究提出GeniWorld世界模型,利用URDF渲染将动作转为视觉表示,提升机器人操作在未知场景的泛化能力。
ErgoSurf:基于遍历控制与触觉感知的未知曲面覆盖方法
新方法ErgoSurf利用触觉感知和高斯过程隐式曲面模型,在未知曲面上实现同时遍历覆盖与几何重建。
iARCS:面向可控三维场景生成的迭代式智能体强化学习框架
iARCS框架通过迭代智能体强化学习,提升合成三维场景生成的功能约束满足度,并改善下游具身智能训练数据质量。
JoyAI-RA 0.5提出双动作对齐框架,扩展机器人操作学习
JoyAI-RA 0.5提出双动作对齐框架,利用人类视频等异构数据扩展操作学习,基准测试表现优异。
GaussianSelector: 轻量级人机协同三维物体选择方法
提出免训练框架GaussianSelector,基于三维高斯溅射实现稀疏视图下的物体分割,计算开销低,可多轮修正。
DASH机器人:接触隐式控制下的极简设计实现最优空地运动
DASH机器人通过涵道风扇与弹簧腿一体化设计,结合接触隐式模型预测控制,实现飞行与跳跃双模式高效运动。
Masked Visual Actions实现统一世界建模
提出Masked Visual Actions,通过像素空间控制接口实现统一世界建模,仅需15小时微调即可预测场景响应。
Agentic Real2Sim:基于视觉语言代理的物理世界建模
提出Agentic Real2Sim框架,利用视觉语言代理将真实机器人交互记录自动转换为可仿真数字孪生,覆盖刚体、变形体和人形场景。
分层大语言模型框架实现无人机群导航与网络切换协同
研究提出分层LLM与DRL结合框架,由云端LLM做全局负载均衡、边缘LLM定战术子目标,由DRL控制器执行无碰撞轨迹。
DPNeXt:用于高效ViT多任务密集预测的轻量级多尺度特征融合框架
DPNeXt提出轻量级多尺度融合解码器,在机器人感知任务中提升效率。
基于强化学习的机器人避碰任务:向量化仿真与基准测试
研究利用MJoCo MJX和Brax库创建机器人臂避碰任务仿真基准,在UR5e和Franka机器人上分别达到96.1%和98.8%的到达成功率。
SeerGuard:通过世界模型预测保障移动GUI代理安全
SeerGuard安全框架通过预执行指令筛选和动作风险评估提升移动GUI代理安全性,实验显示风险评分显著下降。
BadWAM:世界-行动模型在对抗攻击下出现“想对做错”问题
研究者提出BadWAM框架,揭示世界-行动模型易受对抗攻击干扰,导致预测与执行不一致。
面向四足机器人的密集人群敏捷导航方法VOP-Nav
VOP-Nav融合速度障碍法与端到端学习,实现四足机器人在密集动态环境中的安全敏捷导航,并在真实机器人上验证。
LifelongVLA:面向机器人操作的双时序终身学习框架
研究者提出LifelongVLA框架,通过双时序LoRA门控模块与缓存高效重放策略,在机器人操作中实现塑性-稳定性平衡。
PhysClaw-0:基于语言修正的共生式机器人自主操控系统
论文提出名为PhysClaw-0的共生式自主操控系统,通过可重用的语言修正记忆减少人类监督成本,在桌面清洁测试中人类工作时间降至16%。
Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
nuTruck:面向分布式电驱动卡车的自动驾驶规划基准
发布首个针对分布式电驱动卡车的高保真自动驾驶规划基准nuTruck,支持大规模神经网络训练与闭环评估。
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
KnowAct-GUIClaw:面向移动设备GUI的具身智能体框架
提出KnowAct-GUIClaw框架,通过记忆与技能演化提升跨平台GUI任务自动化性能,在MobileWorld基准上超越闭源模型。
GigaWorld-Policy-0.5:面向高效机器人控制的世界动作模型
GigaWorld-Policy-0.5通过混合训练策略和专家架构,在保留视觉动力学训练优势的同时实现高效推理。
DenseReward: 通过失败合成实现密集奖励学习的机器人操作模型
研究团队提出DenseReward密集机器人奖励模型,通过自动化生成物理真实的失败轨迹,提供逐帧奖励信号,提升强化学习效率。
TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
ChunkFlow:面向连续性一致的分块策略学习
ChunkFlow提出一种面向分块策略的连续一致训练执行框架,通过区域划分、确定性混合与连续性损失,改善VLA模型中的边界抖动问题。
MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
ExToken框架:面向VLA模型的高效结构化探索微调方法
研究提出强化学习探索令牌,通过结构化行为先验提升视觉-语言-动作模型在机器人操作中的样本效率。
UR-VC: 无监督机器人价值校正方法用于时间推导进度代理
研究团队提出UR-VC方法,通过跨轨迹相似状态聚合校正时间标签,提升机器人任务进度评估精度。
基于视觉的仿人足球运球研究:通过特权表征学习实现
该研究提出将时间深度编码器嵌入强化学习策略,使仿人机器人在仅依靠深度观测的情况下完成带球突破,无需显式状态估计。
AutoPath:无需人类演示的可迁移目标条件随机路径先验用于安全导航
论文提出AutoPath方法,通过学习可迁移的目标条件随机路径先验,实现机器人在密集静态和动态场景中的安全导航,无需人为演示。
Self-Healing Visual Recovery for Autonomous Ground Vehicles Using Camera-Only Visual Odometry
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
SKooP框架:利用对称性与Koopman预测加速四足机器人强化学习
SKooP框架结合形态对称性和Koopman模型预测,通过自编码器学习系统动力学,为评论家提供平滑特征,显著提升四足机器人强化学习采样效率和收敛速度。
Towards Human-level Dexterous Teleoperation
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
EDAR:机器人操作中依赖环境的动作表示学习方法
研究人员提出EDAR方法,将动作令牌同时映射到可执行控制结构和预期视觉后果,在仿真和真实机器人操作基准中提升了策略学习效果。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1通过慢速推理与快速控制的解耦架构,在城市场景导航中实现35.0%的POI到达率提升,达到77.3%。
[HF热门论文] ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
PanoWorld:面向全景世界模型的旋转等变记忆方法
PanoWorld利用全向表示旋转等变性,通过密集全景射线条件和几何感知记忆增强实现长程记忆,并在新构建的World360数据集上取得领先性能。
ContactMimic: 通过接触控制实现人形机器人物体交互
ContactMimic框架利用接触跟随奖励和轨迹增强,使人形机器人解耦接触行为与关键点几何,实现精确物理接触和接触可控性。
Latent Memory Palace:将控制推理转化为自回归变分推断的框架
研究者提出Latent Memory Palace框架,将控制策略的推理过程建模为自回归变分推断,实现可适应的测试时计算分配,并在仿真和真实世界中获得良好表现。
CamVLA:无需标定的视点鲁棒视觉-语言-动作模型
CamVLA模型通过预测相机坐标系下的末端执行器动作与手眼矩阵,实现免标定、免深度、单目RGB的视点鲁棒操控。
LLM-as-a-Verifier:一种通用验证框架
该框架通过在智能体任务中提供细粒度连续评分,在多个机器人及编程基准上达到最先进性能,并可用于强化学习提升样本效率。
闭源到现实差距:灵巧力控抓取与操作的零样本仿真到现实部署
研究提出仿真到现实强化学习方法,结合触觉与关节扭矩传感,实现五指灵巧手零样本抓取与物体重定向。
DSWAM:面向精细机器人操作的双系统世界动作基础模型
DSWAM结合系统1的世界动作执行器与系统2的语言视觉子任务规划器,实现精细机器人操作,并在DeMaVLA环境下与VLA模型进行公平对比。
[HF热门论文] EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
人机协同示教系统RoboCopilot:双臂操作技能学习的交互式模仿学习框架
RoboCopilot提出人机无缝控制切换的交互示教系统,实现双臂操作技能的高效学习,并在仿真与硬件实验中验证有效性。
灵步机器人发布LingBot-VLA 2.0模型,提升视觉-语言-动作能力
灵步机器人推出LingBot-VLA 2.0,通过多样化数据训练和运动预测建模,提升跨任务与跨本体的操作能力。