职位描述
负责AI训练/推理场景中计算密集型算子的高性能实现与极致性能调优,覆盖GEMM、Attention、FlashAttention、Conv、LayerNorm、量化GEMM等核心算子。
基于PTX/SASS汇编等低级原语进行算子实现与优化,深入挖掘目标GPGPU架构(NVIDIA Ampere/Hopper/Blackwell或AMD CDNA等)的指令级潜力。
运用cutlass、CuTe、TileLang、cuTile等计算模板语言或Kernel生成框架,构建高效、可复用的算子实现与自动调优流程。
开展深入的微架构分析,基于内存访问模式优化、资源利用率提升、计算通信重叠等技术手段,实现算子的极致性能压榨。
参与AI编译器(TileLang/Triton)的开发与优化,特别是针对特定GPGPU硬件架构的中后端优化Pass(指令选择、调度、寄存器分配等)的开发。
与架构、编译器团队协同,基于实际算子调优经验输出硬件设计建议,形成性能需求与架构反馈的正向循环。任职要求
1. 计算机或相关专业本科及以上学历,具备扎实的计算机基础。
2. 熟练掌握C/C++/Assembler等系统软件开发能力。
3. 熟悉并行计算技术,包括但不限于内存访问模式优化、资源利用率优化、计算通信重叠等。熟悉关键性能指标的含义及影响因素,掌握性能分析工具的使用。
4. 具备较为扎实的现代GPGPU体系结构知识,包括但不限于SIMT并行架构、存储层次结构以及TensorCore等,具备CUDA或RoCM等编程原语开发复杂算子的能力。
5. 熟练掌握PTX/SASS汇编等低级原语开发GEMM/Attention/Conv等计算密集型热点算子的能力,熟悉cutlass/CuTe/TileLang/cuTile等任意一种计算模板语言或者kernel生成框架,熟悉相关算法的常用计算模式。
6. 熟悉nvidia Ampere/Hopper/Blackwell或者AMD CDNA等某一种具体的GPGPU架构和指令集,具有丰富的微架构分析能力,能结合相关know how进行计算密集算子的极致调优能力。
【加分项】
1. 熟悉现代编译器原理,参与过 LLVM/AI编译器(Tilelang/Triton)开发项目,特别是参与过针对特定 GPGPU 硬件架构的中后端部分的指令选择/调度/优化/寄存器分配相关 Pass 的开发;
2. 参与过语言/多模态、文生图/视频/3D等生成式大模型研发、性能调优,具备性能模拟和仿真经验,提出关键性能指标指导硬件设计;
3. 对AI相关的高性能开源计算库/计算引擎(如DeepGEMM,DeepEP,FlashMLA等)有过代码贡献者优先。