职位描述
作为仿真系统的"性能转换层",负责算子级别的性能评估、瓶颈分析与建模,是连接上层场景需求与底层硬件能力的核心枢纽。
核心职责
1. 算子性能深度分析
- 针对核心AI算子(GEMM、Conv、Attention、LayerNorm、Softmax等),分析其在特定硬件上的性能特征(Compute Bound / Memory Bound / Communication Bound)。
- 深入理解算子的实现细节(如Tiling策略、内存访问模式、指令调度、并行切分方式)及优化方法。
2. 算子性能模型构建
- 建立可扩展的算子性能模型,能够基于硬件参数(算力、带宽、延迟)预估算子在不同配置下的执行效率与理论性能曲线。
- 开发算子评估工具与基准测试集,量化当前算子库在目标硬件上的实际性能水平与优化空间。
3. 跨层协同与模型迭代
- 接收来自场景建模专家的算子需求规格,输出算子性能预测数据。
- 与芯片架构专家协作,验证算子模型与硬件理论值的一致性,持续修正模型偏差。任职要求
1. 硕士及以上学历,计算机、软件工程、高性能计算等相关专业,985/双一流院校优先。
2. 3-5年算子开发或底层性能优化经验,来自芯片公司(如NVIDIA、华为、寒武纪等)或具备深厚底层优化经验的互联网公司。
3. 熟练掌握CUDA、Triton、OpenCL或类似底层编程模型,理解GPU/AI芯片的执行模型。
4. 熟悉Roofline Model等性能分析方法论,能够独立完成算子瓶颈分析。
5. 加分项
- 有主流推理框架(如TensorRT、ONNX Runtime、TVM)的算子优化或自定义插件开发经验。
- 熟悉CUTLASS、FlashAttention等高性能算子库的实现原理。
- 具备数学建模或统计建模背景,能将经验性结论转化为可计算的数学模型。