职位描述1、优化深度学习训练代码:分析和优化现有PyTorch代码,减少计算冗余,提高GPU利用率。 2、提升GPU训练效率:调整混合精度(FP16/BF16)、张量并行、流水线并行等策略,优化内存占用和计算速度。 3、加速分布式训练:使用NCCL、Horovod、DeepSpeed、Megatron-LM等技术优化通信开销,减少节点间的同步瓶颈。 4、构建高性能计算集群:管理和优化Kubernetes、Slurm、Ray等计算资源调度,提升训练任务的吞吐量。 5、数据加载和存储优化:优化TFRecord、Parquet、LMDB等数据格式,加速数据预处理和I/O,减少CPU/GPU等待时间。 6、Profiling和监控:使用nvprof、Nsight、PyTorch Profiler等工具分析训练瓶颈,并提出优化方案。 7、搭建与维护评估基础设施:构建自动化评测管线、指标分析与可视化工具,为大规模模型训练结果提供快速而准确的评估反馈。 8、将评估流程与训练管线或持续集成/持续交付(CI/CD)体系结合,实现评估自动化和高效迭代。 9、优化评估的运行速度和资源占用,提升评估的吞吐量和可扩展性。 10、支持AI研究团队:帮助研究员优化代码、调整超参数,确保模型训练高效稳定。任职要求1、计算机科学、软件工程或相关专业博士,3年以上工作经验, 硕士5年以上经验。 2、精通GPU计算优化(CUDA、cuDNN、TensorRT),能深入理解和优化训练代码。 3、具备良好的工程能力,熟练使用Python或C++优化深度学习代码,具备调优大规模AI模型的经验。 4、熟练掌握分布式计算,理解NCCL、Horovod、DeepSpeed等优化技术。 5、熟悉混合精度训练(FP16/BF16)、张量并行、ZeRO优化等前沿训练策略。 6、熟悉CI/CD、云计算和容器化(Kubernetes、Docker、Ray),能够管理大规模计算任务。 7、具备搭建评估系统或相关自动化工具的经验,对模型指标监控、对比测试、可视化工具(TensorBoard、MLflow 等)和可视化等有深入理解。 加分项 1、有优化PyTorch/TensorFlow核心代码或提交过深度学习框架开源贡献的经验。 2、熟悉多种评估方法(如自动指标、人工评测、用户反馈等)的落地场景。 3、参与或搭建过 ML 数据管理、模型监控、模型可解释性工具的经验。 4、有云平台上构建深度学习评估管线的经验。