职位描述
一、岗位职责
1. 负责具身智能领域VLA(视觉-语言-动作)、世界模型(WAM)基座大模型的架构设计、核心算法研发与全流程预训练落地,打造行业领先的具身智能基座能力;
2. 主导视觉、语言、动作、多传感器时序数据等多模态信息的统一表征学习与跨模态对齐算法研发,解决具身场景下的时空建模、环境理解、动作决策等核心技术问题;
3. 设计并优化大规模预训练范式,包括但不限于掩码建模、对比学习、生成式预训练等,持续提升基座模型的泛化能力与下游任务适配性;
4. 搭建分布式预训练全链路流程,解决大规模训练中的稳定性、效率与性能优化问题,保障大模型预训练任务的高效落地;
5. 跟踪具身智能、多模态大模型、世界模型领域的前沿技术进展,开展前沿算法的复现、创新与落地,推动技术成果向产品能力的转化。
二、任职要求
1. 硕士及以上学历,计算机科学、人工智能、机器人学等相关专业,具备扎实的深度学习理论基础与数学功底;
2. 深入理解Transformer架构核心原理,精通多模态大模型预训练全流程,有VLA、世界模型、视觉语言大模型、生成式大模型的预训练研发经验;
3. 熟练掌握PyTorch等主流深度学习框架,具备大规模分布式训练的实战经验,能独立解决大模型训练中的核心技术问题;
4. 具备优秀的算法创新能力与工程落地能力,能够独立完成算法设计、代码实现、实验验证与效果调优全流程工作;
5. 具备强烈的技术好奇心与自驱力,良好的团队协作能力与沟通能力,能承受高强度的研发工作节奏。
三、加分项
1. 在ICML、NeurIPS、ICLR、CVPR、ICCV、CoRL等顶级学术会议上以第一作者身份发表具身智能、大模型、计算机视觉相关论文;
2. 有百亿参数以上多模态大模型/具身基座模型从0到1的预训练落地经验;
3. 知名开源大模型项目核心贡献者,或有高质量开源项目研发与维护经验;
4. 具备真实机器人场景下的模型落地与调优经验。
立即投递