职位描述
"岗位职责
- 负责公司自研 AI 加速芯片上的 算子库设计与实现,覆盖训练与推理核心算子(如 GEMM/Conv/Attention/LayerNorm/Softmax/Reduce/Scatter-Gather 等)。
- 基于芯片计算单元、片上存储(SRAM/Cache)、HBM 带宽、NoC 拓扑、DMA/异步拷贝能力,进行 算子性能建模与瓶颈分析(roofline、访存/计算比、流水并行),制定优化策略。
- 设计并落地 kernel 调度与 tiling 策略:多级分块、数据布局(layout/packing)、向量化/张量化、双缓冲/多缓冲、算子融合(fusion)等。
- 建设算子库工程化体系:算子接口规范、版本管理、性能回归、单测/对齐验证、精度与数值稳定性、跨平台兼容
- 参与端到端模型性能优化:对接 PyTorch/TensorFlow/ONNX Runtime 等前端(或公司自研框架),完成算子覆盖、性能调优和线上问题定位(profiling/trace)。"任职要求
"(优秀应届可放宽)。
- 计算机/电子/自动化/数学等相关专业;
- 熟悉深度学习常见算子与数值实现(GEMM/Conv/Attention/Norm/Reduce),理解训练/推理的差异(激活、梯度、混合精度、量化)。
- 扎实的 C/C++ 能力,良好的工程习惯;能熟练使用性能分析工具(profiling、trace、perf、火焰图或自研工具)。
- 熟悉至少一种加速器编程模型或并行体系(CUDA/OpenCL/ROCm/Metal/TVM/Triton/oneDNN/CUTLASS 等)并能迁移到自研 ISA/Runtime。
- 具备系统级性能意识:理解存储层次、带宽/延迟、cache/预取、NUMA、DMA、并行同步等,对算子优化有方法论。
加分项
- 有自研芯片/FPGA/NPU/GPU 上 kernel 开发经验;熟悉片上 SRAM、NoC、DMA、多队列/中断驱动等硬件特性。
- 熟悉编译器基础(LLVM/MLIR/TVM/Glow/XLA),做过算子自动调参(auto-tuning)、算子融合、IR pattern 优化。
- 有大模型推理优化经验:Attention/KV-cache、FlashAttention 类算法、量化(INT8/FP8/FP4)、MoE、通信算子(AllReduce/AllGather)。
- 熟悉算子库生态:cuDNN/cuBLAS/oneDNN/MKLDNN、MIOpen、Triton、CUTLASS、OpenAI Triton 或 TVM schedule。
- 有数值分析能力:误差传播、稳定性、低精度计算技巧(loss scaling、stochastic rounding)。
你将获得
- 深度参与从 硬件能力 → 编程模型 → 编译/运行时 → 算子库 → 端到端模型 的全栈优化闭环。
- 与架构/编译器/框架团队协作,直接影响芯片在大模型训练与推理场景的性能与易用性。"