Ivyea Jobs 9091 roles · 154 companies · 刚刚
此芯科技 · AI 芯片

AI芯片软件首席架构师 / 资深系统专家

上海 社招 · 全职 技术类 芯片 / 硬件训练系统 / 集群 工程开发

职位描述

技术规划与演进: 深入洞察大模型、多模态、大语言模型(LLM)等前沿AI算法的发展趋势,制定自研芯片软件工具链(固件、编译器、运行时、算子库)的中长期技术路线图(Roadmap)。 核心架构设计: 负责AI推理软件栈的核心架构设计,定义软件各模块(如编译后端、硬件抽象层HAL、分布式推理Runtime)之间的关键接口与协议,确保系统的高扩展性、高复用性和低延迟。 技术攻坚与破局: 作为核心技术战斗力,带头攻坚计算图优化、百亿/千亿级参数模型在单卡/多卡分布式下的内存瓶颈、访存优化(如FlashAttention、PagedAttention)等最顶级的技术难题。 软硬件协同演进(HW/SW Co-design): 负责将软件痛点、编译局限性、算子硬件瓶颈等,转化为对下一代(Next-Gen)推理芯片架构(如存储带宽、计算单元、网络互联拓扑)的切实硬件需求。 技术指导与影响力: 作为技术导师(Mentor),指导团队攻克技术难关,主导技术评审(Design Review),确保整体代码与设计质量,树立团队技术标准。

任职要求

任职要求 (Requirements) 行业资历: 计算机、电子信息、软件工程等相关专业硕士/博士,8-10年以上AI芯片软件、高性能计算(HPC)或AI编译器开发经验。 技术深度(满足以下至少两个领域的极致深耕): 编译器领域: 深入理解 LLVM/MLIR/TVM 系统架构,能亲自设计大规模计算图优化、并行化、存储调度的后端算法。 高性能计算: 极其精通异构计算体系结构(GPU/NPU),有自研高性能算子库(类似CuBLAS、CuDNN、Triton)核心架构设计经验。 分布式/Runtime: 精通多卡/多机分布式推理框架设计,深入理解 Tensor Parallelism / Pipeline Parallelism,以及高效网络通信(NCCL、RDMA)。 大局观与架构能力: 具备将复杂的、不确定的算法趋势(如从CNN到Transformer,再到未来的Diffusion/Mamba等)抽象为底层通用软件架构的高级能力。 编码与工程习惯: 即使身处高位,依然保持顶级的 C++/Python 动手写核心原型(POC)代码的能力。
此芯科技去官方页面投递 →