职位描述
岗位职责:
1、策略研发:利用 DRL 算法开发双足机器人的步态控制策略,实现复杂环境下的鲁棒 locomotion;
2、Loco-manipulation 协同:研究全身策略学习,使机器人在保持动态平衡的同时完成抓取、搬运等操作任务;
3、大规模仿真训练:构建基于 GPU 加速的仿真训练环境,进行高效的并行策略训练;
4、Sim-to-Real 迁移:设计 Domain Randomization、System Identification 等方法,缩小仿真与真实机器人之间的 gap;
5、模型部署优化:将训练得到的策略模型导出并优化,使其能够在机器人嵌入式计算平台上实现低延迟实时推理。
岗位要求:
1、全日制本科及以上学历,熟悉强化学习核心理论:马尔可夫决策过程 (MDP)、策略梯度方法、值函数估计;
2、具备一定机器人学基础:坐标变换、刚体动力学、接触约束等
3、熟练使用 PyTorch 进行深度学习模型开发;
4、精通 Python,并能够使用 C++ 完成策略部署或系统集成;
5、熟悉以下物理仿真平台之一:NVIDIA Isaac Gym、Mujoco,Bullet;
6、擅长 Reward Shaping 设计,能够通过训练曲线和策略行为分析问题;
7、理解 RL 在机器人系统中的挑战,例如:Sim-to-Real gap、actuator dynamics、sensor noise;
8、了解 Transformer / RNN (GRU / LSTM) 在处理时序观测数据中的应用。
加分项:
1、真实机器人部署、有将 RL 策略成功部署在真实机器人(双足 / 四足 / 人形)上的经验;
2、有 AMP / Motion Imitation / Mimic 等算法经验。