职位描述
GPU 高性能算子专家
岗位职责
负责自研 GPGPU 上 AI 核心算子及高性能 Kernel 的设计与优化,覆盖 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化及算子融合等场景。
基于 CUDA、Triton、CUTLASS 等技术,建立关键算子的性能基线、Benchmark 和优化方法。
开展算子融合及通算融合优化,包括计算与 Collective/P2P 通信的融合、流水和异步重叠。
从算法、Tiling、数据布局、Kernel 实现、编译器生成代码及硬件资源等层面分析性能瓶颈。
与编译器和芯片架构团队协作,推动寄存器使用、occupancy、访存、Tensor/Matrix 指令及异步流水等性能优化。
建立算子性能回归和问题归因体系,支持重点 AI 模型的算子适配与性能交付。任职要求
任职要求
通常具备 5 年以上 GPU 高性能计算、CUDA 算子或 AI 芯片性能优化经验。
精通 CUDA C++,熟悉 CUTLASS、Triton、FlashAttention、FlashInfer 或同类高性能 Kernel 技术。
实际优化过 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化等核心算子中的一种或多种。
深入理解 GPU 性能模型,包括 warp/CTA、occupancy、寄存器压力、spill、shared memory、访存合并、bank conflict、cache 和 latency hiding。
能够阅读和分析 PTX、GPU 汇编或目标 ISA,并结合 Profiling、性能计数器和 Benchmark 定位性能问题。
熟悉 C++ 和 Python,具备良好的工程实现、性能分析和跨团队协作能力。
加分项
有 cuBLAS、cuDNN、CUTLASS、FlashAttention、FlashInfer 或类似高性能算子库研发经验。
有大模型推理、低精度计算或多模态核心算子优化经验。
有 AllGather-GEMM、GEMM-ReduceScatter、MoE Dispatch/Combine 等通算融合经验。
有自研 GPU 或 AI 芯片的预硅验证、A0 Bring-up 或性能调优经验。
有算子、编译器和硬件协同优化经验,能够区分性能问题来自 Kernel、编译器还是硬件。