职位描述
1.负责 AI 加速器/GPU/NPU 集合通信库设计与开发,包括 AllReduce、AllGather、ReduceScatter 等通信原语。
2.负责 Scale-up 多加速器互联通信架构设计与性能优化,面向 GPU/NPU 集群内部高速互联场景,开展拓扑感知通信、链路调度、带宽利用率优化等工作。
3.负责集合通信 Runtime、内存管理与 Driver 协同开发,包括 设备内存管理、Memory Mapping、P2P 通信、DMA、GPU Direct RDMA(GDR)、GPU Direct Async(GDA)等能力建设,优化数据传输路径,降低通信开销。
4.负责多机多卡分布式训练通信算法设计与优化,研究并实现 Ring、Tree、Pipeline、Hierarchical Collective 等集合通信算法,针对不同网络拓扑和模型训练特点进行通信路径优化。任职要求
1.熟练掌握 C/C++,具备 Linux 系统开发经验。
2.熟悉以下至少一个方向:
2.1.RDMA / RoCE / InfiniBand
2.2.CUDA / HIP Runtime
2.3.GPU/NPU 通信栈
2.4.PCIe P2P / DMA
3.熟悉集合通信算法与分布式训练通信原理。
4.具备高性能系统优化与问题分析能力。
熟悉 NCCL、HCCL、MPI、UCX 等通信框架者优先。