职位描述
1、设计并训练基于强化学习的自动驾驶规划控制模型与端到端模型;
2、研发强化学习、模仿学习、人类反馈强化学习在智驾领域的融合方式,提升系统表现与安全性;
3、开发基于强化学习与生成式模型的闭环仿真算法和基础设施,实现大规模场景的闭环训练。任职要求
1、具有计算机视觉,机器学习,电子信息,机器人等相关学科硕士/博士学历,AI相关研究方向;
2、精通强化学习主流算法(PPO/SAC/GRPO等),有结合世界模型/神经渲染方法进行闭环训练的项目经验;
3、熟悉大规模分布式RL训练,在自动驾驶或机器人领域有完整的RL落地项目经验;
4、能够紧跟学术界和产业界技术动态,对新技术进行调研和原型验证。有相关领域顶会文章发表经历优先;
5、精通Python/C++编程,熟练掌握PyTorch等深度学习框架;
6、具有良好的工作态度,团队合作精神,主观能动性和沟通能力。