职位描述探索 GPU 算力的终极边界,突破大模型训练与推理的性能天花板,为下一代 AI 打造最强引擎。 1. 大模型推理系统优化:负责多模态大模型在 GPU 上的推理效率优化,通过编译优化、高性能算子开发与模型并行策略,实现极致的部署性能;针对 PyTorch/CUDA 计算任务进行算子级与系统级性能调优。 2. 大模型训练系统优化:参与大模型训练系统优化,提升模型训练效率与稳定性;参与分布式训练框架调优,包括 FSDP、DeepSpeed、Megatron-LM 等。 3. 分布式与通信优化:开发高效的模型并行与通信优化策略,分析并优化训练性能瓶颈,包括 GPU 利用率、显存占用、通信开销、I/O 吞吐、DataLoader 等,充分挖掘 GPU 硬件算力。 4. 大规模集群稳定性保障:参与千卡规模集群训练稳定性保障,包括 NCCL hang/timeout、loss spike、checkpoint 恢复等问题排查与治理。 5. 前沿技术落地:跟进大规模训练与推理相关前沿技术,并在真实业务任务中落地优化方案。任职要求1. 学历与毕业时间:2027 届应届毕业生,本科及以上学历。 2. 专业背景:计算机、人工智能、软件工程、数学、物理、电子工程、自动控制等相关专业。 3. 编程能力:熟练掌握 C/C++ 或 Python,具备优秀的工程实现与调试能力,熟悉 Linux 开发环境。 4. 基础素养:熟悉计算机体系结构,理解 PyTorch 训练 / 推理流程,掌握混合精度、梯度累积、checkpoint、recompute 等训练机制。 5. 并行与分布式:熟悉至少一种并行策略(TP、PP、SP、CP 等),对大模型训练系统、GPU 性能优化、分布式系统有较强兴趣,能够阅读和修改开源项目源码。 加分项: 1. 有 LLM / VLM / DiT 等模型训练或推理优化经验。 2. 有 CUDA 开发经验,或熟悉 TVM、TensorRT、Triton 等推理框架。 3. 有千卡及以上规模 GPU 集群训练、调优或问题排查经验。 4. 熟悉 NCCL、RDMA、IB 网络、多机多卡通信优化。 5. 有 Megatron-LM、DeepSpeed、PyTorch、TorchTitan、verl 等开源项目使用或贡献经验。 6. 具备 NOIP、蓝桥杯、ACM 等编程竞赛经验。