Ivyea Jobs 5948 roles · 69 companies · 刚刚
百川智能 · 大模型

【日常实习】AI Infra工程师-训练方向实习生

北京 实习 AI Infra / 训练系统

职位描述

1、参与大模型训练平台、任务调度系统与 GPU 集群资源管理的设计与建设,支撑大规模预训练与后训练; 2、优化数据并行、张量并行、流水线并行、序列并行等分布式训练方案,设计高可用容错与弹性训练机制; 3、深度分析计算、通信(NCCL/RDMA)、存储与数据加载瓶颈,优化集群利用率、训练吞吐与端到端训练稳定性; 4、开发高性能训练算子、通信原语与混合精度训练方案,与算法团队协作设计硬件友好的模型结构; 5、建设训练全链路监控、故障自动诊断与研发效率工具,持续提升大模型训练效率与研发体验。

任职要求

1、2027年及以后毕业的在校生,计算机、软件工程等相关专业,硕士及以上学历; 2、扎实的操作系统、计算机网络、数据结构与算法基础,熟悉 Linux 环境与 C++/Python/Rust 中至少一门语言; 3、深入理解分布式系统原理,在并行计算、GPU 体系结构、高性能计算或分布式存储中至少一个方向有实践经验; 4、了解 PyTorch、Megatron-LM、DeepSpeed 等训练框架,对大规模分布式训练有强烈兴趣和动手能力; 5、具备优秀的系统分析、工程实现和问题定位能力,追求代码质量与系统性能,对复杂系统有掌控欲。 加分项: 1、有大规模分布式训练、超算集群管理、系统性能优化或 AI 基础设施项目经验; 2、熟悉 CUDA 编程、NCCL 通信库、RDMA 网络或高性能算子开发; 3、有 Kubernetes、Slurm 等集群调度系统或分布式存储系统开发经验; 4、在 OSDI/SOSP/ATC/SC 等系统顶会发表过论文,或在主流开源训练框架中有核心贡献。