Ivyea Jobs 5948 roles · 69 companies · 1 小时前
智元机器人 · 具身智能

AI Infrastructure Lead

上海 / 北京 社招 · 全职 AI Infra / 训练系统

职位描述

职位背景 我们正在建设一个面向 具身智能(Embodied AI)与机器人学习 的大规模研究中心,拥有 大规模 GPU 集群与真实机器人数据闭环。团队致力于研发 多模态大模型(Multimodal Foundation Model)、VLA(Vision-Language-Action)、强化学习(Reinforcement Learning)与世界模型(World Model) 等核心技术。 我们在招聘 ML Infrastructure Lead,负责设计和建设支持大规模模型训练的 机器学习平台与分布式训练基础设施,包括 训练系统、GPU 集群调度、实验平台与数据训练 pipeline,以支持研究团队在大规模计算环境下高效进行模型训练与算法迭代。 工作职责 负责机器学习基础设施与训练平台的架构设计与建设 设计并维护 大规模 GPU 集群训练系统(H100/H200 等) 构建支持 大模型(LLM / Multimodal / VLA) 的分布式训练系统 搭建 训练 pipeline(dataset → preprocessing → training → evaluation → deployment) 设计和实现 实验管理系统(Experiment Tracking)、模型版本管理(Model Registry) 优化 GPU 利用率、通信效率与训练稳定性 与研究团队合作支持 大模型训练、强化学习训练与多模态模型训练 与机器人系统团队合作,实现模型 推理部署(Inference / Serving) 组建并领导 ML Infrastructure 团队

任职要求

任职要求 计算机、人工智能或相关专业 硕士及以上学历 5年以上机器学习工程或 AI 平台经验 熟悉主流深度学习框架:PyTorch / JAX / TensorFlow 熟悉分布式训练技术:FSDP / Megatron / DeepSpeed / Horovod 熟悉 GPU 集群与训练调度系统:Slurm / Kubernetes / Ray 熟悉机器学习训练 pipeline 与数据系统:dataset pipeline / experiment tracking / model registry 熟悉 GPU 计算优化:CUDA / NCCL / mixed precision / memory optimization 具备良好的系统架构能力与团队协作能力 加分项 有大模型训练(LLM / Multimodal Foundation Model) 经验 有强化学习(RL / RLHF / Offline RL) 训练平台经验 有自动驾驶 ML Infra 或 AI 平台团队经验 有管理 数百至上千 GPU 集群训练任务 的经验 有构建 AI Training Platform / ML Platform 的经验