职位描述1. 负责真机强化学习算法的设计与落地,构建从仿真训练到真机部署的完整 RL pipeline,解决 Sim2Real 迁移中的核心挑战 2. 研发高效的 RL 训练方案,提升样本效率,使复杂灵巧操作任务能在有限训练时间内收敛到高成功率 3. 搭建人机协作训练体系,探索人类遥操作干预、奖励信号设计、渐进式自主等策略,降低真机训练成本 4. 构建分布式 RL 训练基础设施,对接多仿真器后端与真机环境,支持多算法并行实验与大规模数据采集 5. 跟踪真机 RL 与机器人操作领域前沿进展(如 SERL 等代表性工作),快速验证并落地到产品任职要求任职要求 1. 硕士及以上,计算机 / 机器人 / 自动化等相关专业 2. 具备真机强化学习的完整项目经验,熟悉从仿真训练到真机策略部署的全流程,了解 Sim2Real 迁移的关键技术(域随机化、阻抗控制、自动重置等) 3. 精通主流 RL 算法(SAC / PPO / TD3 / DrQ 等),有高样本效率训练的实际调优经验 4. 熟练使用 PyTorch 或 JAX,具备分布式训练或并行仿真环境的搭建经验 5. 良好的工程能力,熟悉 Linux 开发环境、ROS 通信、GPU 训练调度 加分项 - 有 SERL / HIL-SERL / RLinf等真机 RL 框架的使用或二次开发经验 - 接触过灵巧手、双臂协同等接触丰富的操作任务 - CoRL / RSS / ICRA / NeurIPS 等顶会 RL 或机器人方向论文