Ivyea Jobs 14689 roles · 245 companies · 1 小时前
芯元时代 · AI 芯片

算子性能架构师

北京 / 深圳 / 上海 社招 · 全职 推理 / 部署具身 / 机器人 工程开发

职位描述

- 岗位定位:算子与性能领域技术Leader,面向异构 DSA 平台提供算子性能上限验证、编程模型定义与高性能算子基线。主导"算子怎么映射到硬件、性能上限在哪、手写兜底怎么做"三条线。 - 核心职责 - 算子性能建模与架构验证:对 GEMM/Conv/Attention/扩散采样等核心算子,用 roofline / analytical 模型评估在目标 DSA 上的 tiling、数据复用、片上驻留与带宽需求,定量给出性能上限与瓶颈,反馈架构与硬件团队,支撑投片前架构权衡。 - 编程模型与算子—硬件映射:参与编程模型初稿定义(算子如何表达、如何分解、如何映射到张量引擎/DMA/同步等硬件原语);设计算子集优先级与覆盖路线,对齐目标负载(VLA/扩散策略/多模态)的算子需求,与编译器架构师深度协同。 - 高性能算子基线与手写兜底:面向 DSA CUBE / Vector / intrinsic 构建核心算子手写实现与性能基线,为确立"编译自动生成为主、手写兜底"策略提供量化依据;将高性能 tiling、数据复用 pattern 沉淀为 codegen 参考模板,评估手写工程量与兜底优先级。 - 技术前瞻与竞争力:追踪业界算子库与高性能计算进展(CUTLASS/cuDNN/FlashAttention、自研 NPU 算子库等),评估算子实现与调度新技术,输出调研供架构评审,持续提升算子性能竞争力。 - 任职要求 - 6 年以上高性能计算 / 算子优化经验;熟练掌握 C/C++/Python,编程基础扎实、工程习惯良好。 - 精通微架构级算子优化与性能建模:深入理解 SIMD/张量核/DSA 等并行体系,熟练运用 roofline、带宽/算力瓶颈分析、tiling 与片上内存编排;能独立主导算子性能方案设计与验证。 - 具有规模化商用算子库或 AI 芯片算子性能收敛经验:主导或深度参与过 cuDNN 类库、自研 NPU/GPU/DSA 算子库或芯片 Benchmark 算子在量产或大规模交付场景中的性能定义与收敛(非仅单点 demo)。 - 掌握常见深度学习算法与算子语义(CUDA/Vector/CNN/DNN/Attention/Transformer、扩散采样等),具备算子优化、内存访问优化、并行调度实战经验。 - 加分项 - 自研 NPU 算子库或 cuDNN/CUTLASS/oneDNN 等业界算子库研发经历,或有关键模块贡献。 - 熟悉并参与过业界常见推理框架的算子级优化,如图融合后的 kernel 调优、自定义算子接入、量化算子实现等。 - 熟悉具身智能负载(VLA/扩散策略/多模态)的算子特征与实时性约束;有 FlashAttention、扩散采样等热点算子优化经验。
芯元时代去官方页面投递 →