LOADING
页面加载中LOADING
页面加载中PAPERS 论文追踪
具身智能的论文又多又难啃。我们每天替你筛一遍 arXiv,只留下真正重要的工作——每篇都附一句「说人话」的通俗解释,看不懂公式也能知道它牛在哪。
收录 48 篇 · 覆盖 25 个技术部件 · 累计 ▲ 0 次点赞
DASH机器人:接触隐式控制下的极简设计实现最优空地运动
DASH机器人通过涵道风扇与弹簧腿一体化设计,结合接触隐式模型预测控制,实现飞行与跳跃双模式高效运动。
Masked Visual Actions实现统一世界建模
提出Masked Visual Actions,通过像素空间控制接口实现统一世界建模,仅需15小时微调即可预测场景响应。
Agentic Real2Sim:基于视觉语言代理的物理世界建模
提出Agentic Real2Sim框架,利用视觉语言代理将真实机器人交互记录自动转换为可仿真数字孪生,覆盖刚体、变形体和人形场景。
分层大语言模型框架实现无人机群导航与网络切换协同
研究提出分层LLM与DRL结合框架,由云端LLM做全局负载均衡、边缘LLM定战术子目标,由DRL控制器执行无碰撞轨迹。
DPNeXt:用于高效ViT多任务密集预测的轻量级多尺度特征融合框架
DPNeXt提出轻量级多尺度融合解码器,在机器人感知任务中提升效率。
基于强化学习的机器人避碰任务:向量化仿真与基准测试
研究利用MJoCo MJX和Brax库创建机器人臂避碰任务仿真基准,在UR5e和Franka机器人上分别达到96.1%和98.8%的到达成功率。
SeerGuard:通过世界模型预测保障移动GUI代理安全
SeerGuard安全框架通过预执行指令筛选和动作风险评估提升移动GUI代理安全性,实验显示风险评分显著下降。
BadWAM:世界-行动模型在对抗攻击下出现“想对做错”问题
研究者提出BadWAM框架,揭示世界-行动模型易受对抗攻击干扰,导致预测与执行不一致。
面向四足机器人的密集人群敏捷导航方法VOP-Nav
VOP-Nav融合速度障碍法与端到端学习,实现四足机器人在密集动态环境中的安全敏捷导航,并在真实机器人上验证。
LifelongVLA:面向机器人操作的双时序终身学习框架
研究者提出LifelongVLA框架,通过双时序LoRA门控模块与缓存高效重放策略,在机器人操作中实现塑性-稳定性平衡。
灵步机器人发布LingBot-VLA 2.0模型,提升视觉-语言-动作能力
灵步机器人推出LingBot-VLA 2.0,通过多样化数据训练和运动预测建模,提升跨任务与跨本体的操作能力。
CONTRIBUTE
刷到值得一看的具身智能论文?发邮件给我们,编辑会用「说人话」的方式讲给所有人听。
papers@embodiedfront.cn · 来稿请附 arXiv 编号或链接