职位描述
一、岗位职责:
1. 负责具身大模型(VLA/世界模型)后训练中的分布式系统架构设计、吞吐量和效率优化、多机多卡多核scaling;
2. 负责后训练中的神经网络架构研发。熟悉主流VLA/世界模型的架构,在此基础上为后训练做专属的surgery;
3. 负责真机强化学习和test-time training。打通机器人控制到在线学习算法运转的全链路,专属harness engineering、专属代码框架设计、实验调优;
4. 负责真机后训练的autoresearch。调研和研发真机上后训练的loop engineering(如ENPIRE等autoresearch类的算法);
5. 负责模拟器搭建。熟悉Issac/genesis world/MuJoCo等业界SOTA,为大规模并行RL开发拟真、高速模拟器完成sim2real;
6. 负责后训练中的评测环境搭建。设计模拟器、真机等分层评测体系,搭建和运维一键提交式评测平台,维护内部/外部的算法、模型榜单。
二、任职要求:
1. 本科及以上学历,计算机科学、电子工程、自动化、机械工程、应用数学(计算力学)等相关专业;
2. 对强化学习基础知识和概念有较深理解,如off-/on-policy, value, advantage, policy gradient, actor-critic等;
3. 理解大模型分布式训练原理,对数据并行、张量并行、流水线并行、序列并行等分布式策略有深入研究与实战经验;
4. 有强化学习代码框架和多机多卡多核并行训练的使用经验;
5. 熟练掌握Python, C/C++等编程语言,熟悉PyTorch等主流深度学习框架的底层实现,具备良好的工程开发规范与系统设计能力;
6. 具备良好的问题排查能力与技术攻坚能力,有强烈的技术自驱力与团队协作意识。
三、加分项:
1. 在NeurIPS/ICML/ICLR/CVPR/ECCV/ICCV/ICRA/IROS/CoRL等行业顶会或顶刊上有发表记录;
2. 知名开源AI框架/项目的核心贡献者;
3. 掌握vibe coding, agentic coding并重度或全量使用。针对手头的代码开发、算法实验验流程等日常工作开发过agentic workflow, skill, agent team等;
4. 有AI算法机器人真机部署的经验;
5. 有模拟器开发或其中的场景定制的实际经验。
立即投递