职位描述
技术规划与演进: 深入洞察大模型、多模态、大语言模型(LLM)等前沿AI算法的发展趋势,制定自研芯片软件工具链(固件、编译器、运行时、算子库)的中长期技术路线图(Roadmap)。
核心架构设计: 负责AI推理软件栈的核心架构设计,定义软件各模块(如编译后端、硬件抽象层HAL、分布式推理Runtime)之间的关键接口与协议,确保系统的高扩展性、高复用性和低延迟。
技术攻坚与破局: 作为核心技术战斗力,带头攻坚计算图优化、百亿/千亿级参数模型在单卡/多卡分布式下的内存瓶颈、访存优化(如FlashAttention、PagedAttention)等最顶级的技术难题。
软硬件协同演进(HW/SW Co-design): 负责将软件痛点、编译局限性、算子硬件瓶颈等,转化为对下一代(Next-Gen)推理芯片架构(如存储带宽、计算单元、网络互联拓扑)的切实硬件需求。
技术指导与影响力: 作为技术导师(Mentor),指导团队攻克技术难关,主导技术评审(Design Review),确保整体代码与设计质量,树立团队技术标准。任职要求
任职要求 (Requirements)
行业资历: 计算机、电子信息、软件工程等相关专业硕士/博士,8-10年以上AI芯片软件、高性能计算(HPC)或AI编译器开发经验。
技术深度(满足以下至少两个领域的极致深耕):
编译器领域: 深入理解 LLVM/MLIR/TVM 系统架构,能亲自设计大规模计算图优化、并行化、存储调度的后端算法。
高性能计算: 极其精通异构计算体系结构(GPU/NPU),有自研高性能算子库(类似CuBLAS、CuDNN、Triton)核心架构设计经验。
分布式/Runtime: 精通多卡/多机分布式推理框架设计,深入理解 Tensor Parallelism / Pipeline Parallelism,以及高效网络通信(NCCL、RDMA)。
大局观与架构能力: 具备将复杂的、不确定的算法趋势(如从CNN到Transformer,再到未来的Diffusion/Mamba等)抽象为底层通用软件架构的高级能力。
编码与工程习惯: 即使身处高位,依然保持顶级的 C++/Python 动手写核心原型(POC)代码的能力。