职位描述
岗位职责
负责大规模深度学习训练/推理框架中 CUDA 内核的性能优化与定制开发
开展与 GPU 体系结构相关的前沿探索性工作,包括新指令集、算子融合、异构计算和硬件趋势研究
与算法研究员合作,推动模型结构与底层实现的协同优化任职要求
计算机、电子工程或相关专业本科及以上学历,或3年以上相关工作经验
精通 CUDA 编程模型,熟悉 Tensor Core、WGMMA、Shared Memory 等底层细节
具备优秀的代码实现能力(C++/CUDA/Triton/CUTLASS),良好的工程化与调试能力
具备良好的沟通与协作能力,能够与算法研究员、硬件工程师及跨团队成员高效配合
熟悉并行算法设计与优化,有大规模矩阵乘 (GEMM)、注意力 (FlashAttention/MLA)、MoE、稀疏算子优化经验者优先
熟悉分布式训练/推理框架(Megatron、vLLM、SGLang、TensorRT-LLM 等)者优先
参与过开源社区(NCCL、CUTLASS、Triton、TileLang、Megatron-LM、vLLM 等)贡献者优先
有 HPC 或超大规模 AI 模型训练经验者优先
允许6个月内投递3个职位,请选择适合的职位进行投递
立即投递