职位描述
工作职责
1. 参与 GPU 高性能通信库的研发、测试和性能优化,支撑 AI 训练、科学计算等场景。
2. 参与多 GPU、多节点通信相关能力建设,包括集合通信、点对点通信等基础模块。
3. 协助完成通信库与 AI 框架、驱动、硬件平台的集成和联调。
4. 跟踪 GPU 计算、分布式训练、高性能网络等方向的前沿技术,参与技术调研和文档整理。任职要求
任职要求
1. 计算机、软件工程、电子信息、自动化、数学等相关专业,本科及以上学历。
2. 具备良好的编程基础,熟悉 C/C++ 或 Python。
3. 具备扎实的计算机基础,了解操作系统、计算机网络、数据结构与算法等基础知识。
4. 对 GPU 计算、分布式系统、高性能计算、AI 基础设施等方向有兴趣,愿意深入底层系统软件研发。
5. 学习能力强,具备良好的问题分析能力和团队协作意识。
加分项
1. 有 GPU 编程、并行计算、分布式训练、高性能网络等相关课程、项目或实习经验。
2. 了解 CUDA、OpenCL、MPI、NCCL、RDMA、PyTorch 等任一相关技术。
3. 有编程竞赛、科研项目、开源项目或系统软件开发经验。
你将获得
1. 参与国产 GPU 核心基础软件研发,接触真实的大规模 AI 训练基础设施。
2. 在导师指导下学习 GPU 通信、分布式训练、高性能网络等前沿系统技术。
3. 与硬件、驱动、编译器、AI 框架团队协作,获得完整的系统软件研发经验。