职位描述
岗位职责
1.主导或参与 WAM(全身动作模型)与 VLA(视觉语言动作模型) 的架构设计与训练优化,攻克感知-理解-决策-执行端到端链路中的核心难题;
2.探索视觉-语言-动作联合预训练的新范式,研究扩散策略、自回归动作生成、时序建模等前沿方法在机器人控制中的高效落地;
3.构建高质量多模态数据集(图像、视频、语言、全身动作等),设计数据标注标准与质量评估体系,开发大规模训练Pipeline;
4.推进模型推理优化与部署,平衡性能与效率,支撑真机实时控制需求;
5.跟踪并复现 NeurIPS/ICML/ICLR/CVPR 等顶会最新成果,结合业务场景进行创新性改进与工程化落地;任职要求
一、基本要求
1.海内外顶尖高校(如C9、985头部、全球QS/THE排名前50等)计算机科学、人工智能、机器人学、自动化等相关专业,2027届博士优先,特别优秀的硕士亦可;
2.具备扎实的数理基础与极强的自驱力,对具身智能有深刻理解与长期投入意愿。
二.、学术研究能力
1.须以第一作者(含导师一作、本人二作)身份,在以下领域满足至少一项:
2.在 NeurIPS / ICML / ICLR / CVPR / ECCV / ICCV / RSS / CoRL 等CCF-A类或机器人顶会/期刊发表至少1篇(博士要求2篇及以上)高水平论文,且论文须具备以下特征之一:
3.提出创新性方法论,对该方向有实质性推动;
4.开源代码获得较高社区关注度(如GitHub Stars ≥300);
5.被后续工作高频引用,具备领域影响力;
6.在 RoboCup / DARPA Robotics Challenge / ICRA DJI RoboMaster AI Challenge 等国际顶级机器人赛事中获得全球前三成绩
三、专业技术能力
1.深入理解 VLA 模型架构(如RT系列、OpenVLA、π0等),熟悉视觉-语言-动作对齐的核心技术路线;
熟悉 WAM 相关方法(全身动作表征、全身运动规划、人形/双臂机器人控制等),了解扩散策略、流匹配等生成式动作2.建模方法;
掌握强化学习(RLHF/PPO/DPO)、模仿学习(行为克隆/DAgger)、世界模型等具身学习范式;
对多模态大模型(LLM/VLM)的预训练、指令微调、对齐技术有系统认知。
3.工程实践:
精通 PyTorch,具备从零搭建大规模分布式训练框架的能力;
扎实的 Python/C++ 功底,熟悉 CUDA 编程、模型量化/蒸馏/推理加速者优先;
熟练使用 Isaac Gym / MuJoCo / PyBullet 等仿真平台,有真机部署经验者优先;