Ivyea Jobs 10686 roles · 174 companies · 刚刚
云天励飞 · AI 芯片

大模型算子开发优化工程师/专家

深圳 社招 · 全职 推理 / 部署优化

职位描述

GPU 高性能算子专家 岗位职责 负责自研 GPGPU 上 AI 核心算子及高性能 Kernel 的设计与优化,覆盖 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化及算子融合等场景。 基于 CUDA、Triton、CUTLASS 等技术,建立关键算子的性能基线、Benchmark 和优化方法。 开展算子融合及通算融合优化,包括计算与 Collective/P2P 通信的融合、流水和异步重叠。 从算法、Tiling、数据布局、Kernel 实现、编译器生成代码及硬件资源等层面分析性能瓶颈。 与编译器和芯片架构团队协作,推动寄存器使用、occupancy、访存、Tensor/Matrix 指令及异步流水等性能优化。 建立算子性能回归和问题归因体系,支持重点 AI 模型的算子适配与性能交付。

任职要求

任职要求 通常具备 5 年以上 GPU 高性能计算、CUDA 算子或 AI 芯片性能优化经验。 精通 CUDA C++,熟悉 CUTLASS、Triton、FlashAttention、FlashInfer 或同类高性能 Kernel 技术。 实际优化过 GEMM、Attention、Norm、Reduction、KV Cache、MoE、量化等核心算子中的一种或多种。 深入理解 GPU 性能模型,包括 warp/CTA、occupancy、寄存器压力、spill、shared memory、访存合并、bank conflict、cache 和 latency hiding。 能够阅读和分析 PTX、GPU 汇编或目标 ISA,并结合 Profiling、性能计数器和 Benchmark 定位性能问题。 熟悉 C++ 和 Python,具备良好的工程实现、性能分析和跨团队协作能力。 加分项 有 cuBLAS、cuDNN、CUTLASS、FlashAttention、FlashInfer 或类似高性能算子库研发经验。 有大模型推理、低精度计算或多模态核心算子优化经验。 有 AllGather-GEMM、GEMM-ReduceScatter、MoE Dispatch/Combine 等通算融合经验。 有自研 GPU 或 AI 芯片的预硅验证、A0 Bring-up 或性能调优经验。 有算子、编译器和硬件协同优化经验,能够区分性能问题来自 Kernel、编译器还是硬件。
云天励飞去官方页面投递 →