LOADING
页面加载中LOADING
页面加载中PAPERS 论文追踪
具身智能的论文又多又难啃。我们每天替你筛一遍 arXiv,只留下真正重要的工作——每篇都附一句「说人话」的通俗解释,看不懂公式也能知道它牛在哪。
收录 48 篇 · 覆盖 25 个技术部件 · 累计 ▲ 0 次点赞
DASH机器人:接触隐式控制下的极简设计实现最优空地运动
DASH机器人通过涵道风扇与弹簧腿一体化设计,结合接触隐式模型预测控制,实现飞行与跳跃双模式高效运动。
Masked Visual Actions实现统一世界建模
提出Masked Visual Actions,通过像素空间控制接口实现统一世界建模,仅需15小时微调即可预测场景响应。
Agentic Real2Sim:基于视觉语言代理的物理世界建模
提出Agentic Real2Sim框架,利用视觉语言代理将真实机器人交互记录自动转换为可仿真数字孪生,覆盖刚体、变形体和人形场景。
分层大语言模型框架实现无人机群导航与网络切换协同
研究提出分层LLM与DRL结合框架,由云端LLM做全局负载均衡、边缘LLM定战术子目标,由DRL控制器执行无碰撞轨迹。
DPNeXt:用于高效ViT多任务密集预测的轻量级多尺度特征融合框架
DPNeXt提出轻量级多尺度融合解码器,在机器人感知任务中提升效率。
基于强化学习的机器人避碰任务:向量化仿真与基准测试
研究利用MJoCo MJX和Brax库创建机器人臂避碰任务仿真基准,在UR5e和Franka机器人上分别达到96.1%和98.8%的到达成功率。
SeerGuard:通过世界模型预测保障移动GUI代理安全
SeerGuard安全框架通过预执行指令筛选和动作风险评估提升移动GUI代理安全性,实验显示风险评分显著下降。
BadWAM:世界-行动模型在对抗攻击下出现“想对做错”问题
研究者提出BadWAM框架,揭示世界-行动模型易受对抗攻击干扰,导致预测与执行不一致。
面向四足机器人的密集人群敏捷导航方法VOP-Nav
VOP-Nav融合速度障碍法与端到端学习,实现四足机器人在密集动态环境中的安全敏捷导航,并在真实机器人上验证。
LifelongVLA:面向机器人操作的双时序终身学习框架
研究者提出LifelongVLA框架,通过双时序LoRA门控模块与缓存高效重放策略,在机器人操作中实现塑性-稳定性平衡。
灵步机器人发布LingBot-VLA 2.0模型,提升视觉-语言-动作能力
灵步机器人推出LingBot-VLA 2.0,通过多样化数据训练和运动预测建模,提升跨任务与跨本体的操作能力。
PhysClaw-0:基于语言修正的共生式机器人自主操控系统
论文提出名为PhysClaw-0的共生式自主操控系统,通过可重用的语言修正记忆减少人类监督成本,在桌面清洁测试中人类工作时间降至16%。
Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
nuTruck:面向分布式电驱动卡车的自动驾驶规划基准
发布首个针对分布式电驱动卡车的高保真自动驾驶规划基准nuTruck,支持大规模神经网络训练与闭环评估。
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
KnowAct-GUIClaw:面向移动设备GUI的具身智能体框架
提出KnowAct-GUIClaw框架,通过记忆与技能演化提升跨平台GUI任务自动化性能,在MobileWorld基准上超越闭源模型。
GigaWorld-Policy-0.5:面向高效机器人控制的世界动作模型
GigaWorld-Policy-0.5通过混合训练策略和专家架构,在保留视觉动力学训练优势的同时实现高效推理。
DenseReward: 通过失败合成实现密集奖励学习的机器人操作模型
研究团队提出DenseReward密集机器人奖励模型,通过自动化生成物理真实的失败轨迹,提供逐帧奖励信号,提升强化学习效率。
TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
ChunkFlow:面向连续性一致的分块策略学习
ChunkFlow提出一种面向分块策略的连续一致训练执行框架,通过区域划分、确定性混合与连续性损失,改善VLA模型中的边界抖动问题。
MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
ExToken框架:面向VLA模型的高效结构化探索微调方法
研究提出强化学习探索令牌,通过结构化行为先验提升视觉-语言-动作模型在机器人操作中的样本效率。
UR-VC: 无监督机器人价值校正方法用于时间推导进度代理
研究团队提出UR-VC方法,通过跨轨迹相似状态聚合校正时间标签,提升机器人任务进度评估精度。
基于视觉的仿人足球运球研究:通过特权表征学习实现
该研究提出将时间深度编码器嵌入强化学习策略,使仿人机器人在仅依靠深度观测的情况下完成带球突破,无需显式状态估计。
AutoPath:无需人类演示的可迁移目标条件随机路径先验用于安全导航
论文提出AutoPath方法,通过学习可迁移的目标条件随机路径先验,实现机器人在密集静态和动态场景中的安全导航,无需人为演示。
Self-Healing Visual Recovery for Autonomous Ground Vehicles Using Camera-Only Visual Odometry
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
SKooP框架:利用对称性与Koopman预测加速四足机器人强化学习
SKooP框架结合形态对称性和Koopman模型预测,通过自编码器学习系统动力学,为评论家提供平滑特征,显著提升四足机器人强化学习采样效率和收敛速度。
Towards Human-level Dexterous Teleoperation
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
EDAR:机器人操作中依赖环境的动作表示学习方法
研究人员提出EDAR方法,将动作令牌同时映射到可执行控制结构和预期视觉后果,在仿真和真实机器人操作基准中提升了策略学习效果。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1通过慢速推理与快速控制的解耦架构,在城市场景导航中实现35.0%的POI到达率提升,达到77.3%。
[HF热门论文] ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
人工强制发布:该稿未通过自动质量门,正文未经过合格改写。
PanoWorld:面向全景世界模型的旋转等变记忆方法
PanoWorld利用全向表示旋转等变性,通过密集全景射线条件和几何感知记忆增强实现长程记忆,并在新构建的World360数据集上取得领先性能。
ContactMimic: 通过接触控制实现人形机器人物体交互
ContactMimic框架利用接触跟随奖励和轨迹增强,使人形机器人解耦接触行为与关键点几何,实现精确物理接触和接触可控性。
Latent Memory Palace:将控制推理转化为自回归变分推断的框架
研究者提出Latent Memory Palace框架,将控制策略的推理过程建模为自回归变分推断,实现可适应的测试时计算分配,并在仿真和真实世界中获得良好表现。
CamVLA:无需标定的视点鲁棒视觉-语言-动作模型
CamVLA模型通过预测相机坐标系下的末端执行器动作与手眼矩阵,实现免标定、免深度、单目RGB的视点鲁棒操控。
LLM-as-a-Verifier:一种通用验证框架
该框架通过在智能体任务中提供细粒度连续评分,在多个机器人及编程基准上达到最先进性能,并可用于强化学习提升样本效率。
闭源到现实差距:灵巧力控抓取与操作的零样本仿真到现实部署
研究提出仿真到现实强化学习方法,结合触觉与关节扭矩传感,实现五指灵巧手零样本抓取与物体重定向。
DSWAM:面向精细机器人操作的双系统世界动作基础模型
DSWAM结合系统1的世界动作执行器与系统2的语言视觉子任务规划器,实现精细机器人操作,并在DeMaVLA环境下与VLA模型进行公平对比。
CONTRIBUTE
刷到值得一看的具身智能论文?发邮件给我们,编辑会用「说人话」的方式讲给所有人听。
papers@embodiedfront.cn · 来稿请附 arXiv 编号或链接