职位描述
1. 面向自研 NPU 和存算一体架构,负责 AI 编译器的设计、开发与优化,覆盖模型导入、计算图优化、中间表示转换、后端代码生成和运行时对接。
2. 对接 PyTorch、ONNX 等模型生态及上层计算框架,支持 CNN、Transformer 和大语言模型的图编译、运行与性能调优。
3. 负责面向目标硬件的编译映射与调度,包括 Tiling、并行映射、调度、片上内存规划、DMA 编排等;设计和优化内存规划算法,结合 Tensor 生命周期、片上 SRAM 容量、外部存储带宽等,优化内存复用和数据驻留,削减数据搬运开销。
4. 协同算子、Runtime 和硬件团队优化计算效率、内存占用、数据搬运、执行延迟及吞吐率。
5. 从可编程性、编译映射、硬件利用率等角度参与软硬件协同设计,为指令集、存储层次、同步机制以及 NPU 微架构提供软件侧需求和评估。
6. 建设编译器测试与回归体系,覆盖编译正确性、数值精度、模型兼容性、性能稳定性及异常场景。参与精度调试工具、性能分析工具和编译器自动化测试体系建设。任职要求
1. 计算机、电子工程、自动化、微电子或相关专业,硕士及以上学历,具有 3 年以上 AI 编译器、传统编译器、深度学习框架或异构计算相关研发经验。
2. 理解编译器基本原理,熟悉中间表示、控制流与数据流分析、模式匹配、指令选择、寄存器分配、代码生成等。熟悉至少一种编译器基础设施或 AI 编译系统,如 MLIR、LLVM、TVM、XLA、IREE、Glow 或自研编译器。
3. 熟悉深度学习计算图和常见算子,理解卷积、矩阵乘、归一化、Attention 等计算原理、数据布局和性能特征。
4. 理解 CPU、GPU、DSP、NPU 等异构计算架构,熟悉缓存、片上存储、DMA、SIMD/SIMT、流水线及并行计算的基本原理。
5. 具备性能分析能力,能够根据 Profiling 数据定位计算、访存、同步、数据搬运和调度瓶颈。
6. 具备良好的沟通能力,能够与芯片架构、算子、Runtime、框架和模型团队紧密协作。