Ivyea Jobs 10309 roles · 176 companies · 1 小时前
曦望 · AI 芯片

先进GPU计算体系结构研究员

北京 / 深圳 / 上海 / 杭州 / 成都 社招 · 全职 芯片 / 硬件训练系统 / 集群 研究

职位描述

负责AI训练/推理场景中计算密集型算子的高性能实现与极致性能调优,覆盖GEMM、Attention、FlashAttention、Conv、LayerNorm、量化GEMM等核心算子。 基于PTX/SASS汇编等低级原语进行算子实现与优化,深入挖掘目标GPGPU架构(NVIDIA Ampere/Hopper/Blackwell或AMD CDNA等)的指令级潜力。 运用cutlass、CuTe、TileLang、cuTile等计算模板语言或Kernel生成框架,构建高效、可复用的算子实现与自动调优流程。 开展深入的微架构分析,基于内存访问模式优化、资源利用率提升、计算通信重叠等技术手段,实现算子的极致性能压榨。 参与AI编译器(TileLang/Triton)的开发与优化,特别是针对特定GPGPU硬件架构的中后端优化Pass(指令选择、调度、寄存器分配等)的开发。 与架构、编译器团队协同,基于实际算子调优经验输出硬件设计建议,形成性能需求与架构反馈的正向循环。

任职要求

1. 计算机或相关专业本科及以上学历,具备扎实的计算机基础。 2. 熟练掌握C/C++/Assembler等系统软件开发能力。 3. 熟悉并行计算技术,包括但不限于内存访问模式优化、资源利用率优化、计算通信重叠等。熟悉关键性能指标的含义及影响因素,掌握性能分析工具的使用。 4. 具备较为扎实的现代GPGPU体系结构知识,包括但不限于SIMT并行架构、存储层次结构以及TensorCore等,具备CUDA或RoCM等编程原语开发复杂算子的能力。 5. 熟练掌握PTX/SASS汇编等低级原语开发GEMM/Attention/Conv等计算密集型热点算子的能力,熟悉cutlass/CuTe/TileLang/cuTile等任意一种计算模板语言或者kernel生成框架,熟悉相关算法的常用计算模式。 6. 熟悉nvidia Ampere/Hopper/Blackwell或者AMD CDNA等某一种具体的GPGPU架构和指令集,具有丰富的微架构分析能力,能结合相关know how进行计算密集算子的极致调优能力。 【加分项】 1. 熟悉现代编译器原理,参与过 LLVM/AI编译器(Tilelang/Triton)开发项目,特别是参与过针对特定 GPGPU 硬件架构的中后端部分的指令选择/调度/优化/寄存器分配相关 Pass 的开发; 2. 参与过语言/多模态、文生图/视频/3D等生成式大模型研发、性能调优,具备性能模拟和仿真经验,提出关键性能指标指导硬件设计; 3. 对AI相关的高性能开源计算库/计算引擎(如DeepGEMM,DeepEP,FlashMLA等)有过代码贡献者优先。
曦望去官方页面投递 →