职位描述
岗位职责
负责深度学习模型训练性能优化与加速,提升训练吞吐、资源利用率与系统稳定性。
设计并维护高性能ML 训练基础设施,包括多机多卡分布式训练、任务调度与资源管理。
优化 模型并行与数据并行策略(Data / Model / Pipeline / ZeRO / FSDP),降低通信与显存开销。
深度参与训练框架与算子层优化,包括 CUDA kernel、算子融合、Mixed Precision、Flash Attention 等。
构建和优化大规模数据加载与存储管线,减少 I/O 瓶颈(如 WebDataset、TFRecord、异步 Prefetch)。
推进训练稳定性、可复现性与监控体系建设(Profiling、Tracing、Logging、Failure Recovery)。
与算法团队协作,将新模型结构与训练策略高效落地到生产级训练系统中。
跟进并评估前沿训练加速技术与基础设施方案,推动技术升级。任职要求
计算机科学、软件工程、人工智能等相关专业本科及以上学历。相关工作经验2年以上。
扎实的深度学习系统基础,理解训练过程中的计算、通信与内存瓶颈。
熟练使用 PyTorch,熟悉 DDP / FSDP / DeepSpeed / Megatron 等分布式训练框架。
熟悉 GPU / CUDA / NCCL 基本原理,有性能分析与调优经验。
良好的 Python / C++ 编程能力,具备工程级代码质量意识。
熟悉 Linux 环境与常见性能调试工具(nsys、nvprof、perf 等)。
具备较强的问题定位与系统化优化能力。
立即投递