【源点顶尖人才计划】AI Infra工程师-训练方向实习生
职位描述
1、参与大模型训练平台、任务调度系统与 GPU 集群资源管理的设计与建设,支撑大规模预训练与后训练;
2、优化数据并行、张量并行、流水线并行、序列并行等分布式训练方案,设计高可用容错与弹性训练机制;
3、深度分析计算、通信(NCCL/RDMA)、存储与数据加载瓶颈,优化集群利用率、训练吞吐与端到端训练稳定性;
4、开发高性能训练算子、通信原语与混合精度训练方案,与算法团队协作设计硬件友好的模型结构;
5、建设训练全链路监控、故障自动诊断与研发效率工具,持续提升大模型训练效率与研发体验。任职要求
1、2027年及以后毕业的在校生,计算机、软件工程等相关专业,硕士及以上学历;
2、扎实的操作系统、计算机网络、数据结构与算法基础,熟悉 Linux 环境与 C++/Python/Rust 中至少一门语言;
3、深入理解分布式系统原理,在并行计算、GPU 体系结构、高性能计算或分布式存储中至少一个方向有实践经验;
4、了解 PyTorch、Megatron-LM、DeepSpeed 等训练框架,对大规模分布式训练有强烈兴趣和动手能力;
5、具备优秀的系统分析、工程实现和问题定位能力,追求代码质量与系统性能,对复杂系统有掌控欲。
6、实习期间表现优异并通过考核,可获得转正机会。
加分项:
1、有大规模分布式训练、超算集群管理、系统性能优化或 AI 基础设施项目经验;
2、熟悉 CUDA 编程、NCCL 通信库、RDMA 网络或高性能算子开发;
3、有 Kubernetes、Slurm 等集群调度系统或分布式存储系统开发经验;
4、在 OSDI/SOSP/ATC/SC 等系统顶会发表过论文,或在主流开源训练框架中有核心贡献。