DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作
DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。
ai
DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。