职位描述
1. 技术研究:深入跟踪研究主流或新兴GPU厂商最新特性与前沿算法实现,能将研究成果应用于公司自研GPU架构设计与算子实现优化中。
2. 技术研发:参与公司自研GPU芯片的核心计算密集型算子的高性能实现、代码生成、深度优化和算法选优。
3. 技术支持:为公司AI领域的各类业务做算子层面的支持和适配,并推动在实际产品中的落地与应用。
4. 团队协作:与硬件设计、编译器、算法研究及产品开发团队紧密合作,共同定位并解决跨栈技术难题,抽象编程实例用以构建架构设计与编译行为验证,持续优化产品性能与研发效率。任职要求
1. 计算机或相关专业本科及以上学历,具备扎实的计算机基础。
2. 熟练掌握C/C++编程语言,具备良好的系统软件开发和架构设计能力。
3. 熟悉并行计算技术,包括但不限于内存访问模式优化、资源利用率优化、计算通信重叠等。熟悉关键性能指标的含义及影响因素,掌握性能分析工具的使用,如Nsight Compute。
4. 熟悉现代大算力GPU体系结构,包括但不限于并行调度模型、存储层次结构、计算单元架构等。
5. 熟练运用CUDA/Triton/RoCM等编程原语开发AI领域的各类算子,对Volta/Ampere/Hopper等至少一代的架构实现有深入的算子移植,开发和优化的经验。
6. 对GEMM/Attention/Convolution等AI重要的计算密集型算子的至少一种,具备深度高性能优化经验。
加分项
1. 熟悉NVIDIA最新Blackwell架构的关键特性及其针对性优化策略者优先。
2. 熟悉PTX或SASS汇编语言,具备一定逆向工程能力或微架构分析经验者优先。
3. 熟悉现代编译器原理,了解编译器行为,有LLVM/汇编器/汇编工具开发经验者优先。
4. 熟悉CUTLASS尤其Cute的编程抽象,具有该编程模型的计算密集型算子开发优化或后端迁移经验者优先。
5. 有算子选优框架的封装实现、流程优化与算法研究实践相关经验者优先。
6. 有PyTorch等主流深度学习框架适配或后端支持经验,有将深度优化算子在这些框架中部署集成并落地经验者优先。
7. 有语言/多模态,文生图/视频/3D等生成式大模型研发、性能调优或部署经验,了解vLLM/SGLang或FlashInfer/TensorRT-LLM等大模型高性能推理框架引擎的实现优化原理与具体流程方案者优先。