职位描述
1、参与大规模具身智能模型的训练Infra建设。
2、负责训练框架架构迭代,提升稳定性、易用性、可运维能力和可观测能力。
3、支持数千卡规模的大规模训练系统性能优化。任职要求
1、熟悉GPU体系结构,熟练掌握CUDA/triton,熟练掌握C++或Python语言。
2、深入了解PyTorch等深度学习框架的架构和运行原理,有自定义开发经验者优先。
3、深入理解大模型训练多维并行架构,如Tensor并行、流水线并行、序列并行等。
4、深入理解多模态模型结构,如ViT、DiT等,了解开源多模态大模型结构,如qwen-vl、llama等。
5、具备良好的沟通协调能力与团队协作精神。
6、加分项:
(1)有大规模多模态大模型训练系统研发经历者优先。
(2)有fp8混合精度训练经验者优先。
(3)有Megatron-LM、DeepSpeed等大模型训练框架的优化经验优先。