职位描述
负责机器人领域的强化学习算法研究与开发,探索上肢操作场景的高成功率策略落地;
1. 熟悉机器人端到端操作模型,研究强化学习在ACT、Diffusion Policy、OpenVLA、Pi0等前沿VLA模型中的应用,实现机器人复杂操作技能的快速学习和泛化;
2. 基于Isaac Sim/Lab、MuJoCo等仿真平台,设计并实现上肢操作策略的强化学习训练框架,解决sim2real迁移问题(包括机器人硬件相关的电机建模、通讯及感知模块延时、噪声模拟等);
3. 研究操作模型基于人类或者模型反馈的真机强化学习,提升模型的泛化性和精准性,进一步提升模型的能力;
4. 跟踪机器人强化学习领域最新研究进展,推动算法创新和技术突破。任职要求
1. 在校大学生,具有计算机视觉、人工智能、机器人学、控制工程等相关专业背景,本科及以上学历;
2. 具备扎实的强化学习理论基础,熟悉PPO、SAC、GRPO等主流强化学习算法,有相关项目实践经验;
3. 了解机器人运动学、动力学建模,熟悉机器人操作(manipulation)或运动控制相关技术;
4. 有真机机械臂的强化学习/模仿学习项目经验者优先;
加分项
1. 有flow matching/diffusion head policy的RL finetune经验;
2. 具备分布式训练经验,能够处理大规模数据和模型训练,有过强化学习系统框架开发者优先;
3. 机器人学习、强化学习相关顶级会议论文发表经历或相关比赛获奖经历者优先考虑;