具身策略模型训练与仿真部署

鹿明机器人科技(深圳)有限公司
时长:1周报名人数:3-5人
项目结业证书、作品集成果、能力标签、达标后可进入岗位推荐池
深度学习进阶具身智能Python

把人类演示的经验数据变成机器自己的决策能力,是具身智能的核心。本项目带你在纯 Python + numpy 环境里亲手走完这条训练链路:手写反向传播训出行为克隆策略,用扩散策略解决多峰动作难题,再用仿真 rollout 的量化数字证明策略可以上线——"模型是怎么从数据里长出来的",从此不再是黑盒。

项目概览

进入工作模拟前

1

对行为克隆(BC) 基本原理的理解,能够识别其分布偏移等缺陷

2

对于扩散策略 核心思想(去噪采样过程)有概念性认知

3

熟悉仿真部署与rollout评估的基本流程,以便解读训练效果

最终能力证据

1

训练 loss 降低,闭环 120 步最终误差,退出码 0,运行日志,README

2

BC 偏置 b、扩散左峰比例,成功率 扩散 vs BC,退出码 0,运行日志,README

3

单次 rollout 成功步数,40 次成功率,平滑度 < 加噪对照 ,退出码 0,运行日志,README

企业任务流

01

行为克隆训练

你是算法组实习生,mentor 说先别急着上大模型,把 baseline 跑通再说。4000 条专家演示已经备好,本任务手写两层 MLP 的"前向→反向→梯度下降"训练闭环,训练 200 轮后让机械臂不看公式、靠网络自己走到目标点;挑战环节把数据砍到 500 条,亲眼看着泛化崩塌

交付物:补全后的 任务一_行为克隆训练_学生动手.py、output_任务、退出码截图、README.md

卡点技能:行为克隆训练

02

扩散策略与 BC 对比

BC baseline 在"左右都能推"的任务上成功率是 0%。画出动作分布才发现:专家数据是双峰的,BC 只学了个两峰平均——直直撞空。本任务手写扩散策略的去噪采样,让成功率对比翻盘,真正理解"策略表达能力"这个抽象概念指什么、什么时候该上扩散

交付物:补全后的 任务二_扩散策略与BC对比_学生动手.py、output_任务二,退出码截图、README.md

卡点技能:扩散策略与 BC 对比

03

仿真部署与成功率评估

策略要上线了,leader 不要"感觉不错",要数据。本任务把训练好的策略放进 2D 点机器人仿真环境:单次 rollout 看完整轨迹,40 次 rollout 统计成功率,再算动作平滑度,产出一份量化评估报告——这是策略能不能进下一阶段的分水岭

交付物:补全后的 任务三_扩散策略与BC对比_学生动手.py、output_任务三、退出码截图、README.md

卡点技能:仿真部署与成功率评估

当前团队

已加入 2 人

算法工程师(TL)

已加入

实训智能助手

已加入

空位