职位描述
根据公司产品战略(通过深入理解GPU芯片及互联芯片架构团队提出的芯片使用场景以及性能目标),完成系统级新型AI硬件系统PRD。组织公司内外部硬件系统设计团队(包括ODM及创新硬件供应商)完成系统设计,根据芯片及系统硬件特点提出在计算,网络以及存储端对AI大模型的适配以及优化方向,影响并驱动软件团队优化性能至硬件极限,达到AI新型系统的SOL领先行业。对芯片架构以及芯片以及硬件系统产品经理提出的roadmap可以规划论证,影响行业领先供应商配合公司的技术生态发展。任职要求
1. 深度理解主流GPU的硬件架构,熟悉GPU的计算单元、显存层次、线程模型及性能优化点;
2. 精通多GPU互联技术及GPU协同与通信优化:深入理解高速互联协议的带宽、延迟特性及适用场景;
3. 熟悉新型AI硬件系统架构设计,硬件-软件协同,能根据业务需求(如大模型训练需高带宽显存、低延迟通信;推理需高吞吐低功耗)设计新型AI硬件系统的硬件配置(GPU型号/数量、CPU搭配、内存容量、存储类型),并提出优化软件栈(驱动/固件/容器运行时)匹配的方向;
4. 了解资源调度与隔离,扩展性与容错,
5. 了解相关AI存储技术,如分布式存储(如Lustre、BeeGFS、Ceph)或高性能本地存储(如NVMe-oF、NVMe SSD),解决GPU训练中数据加载瓶颈(如通过并行文件系统加速数据预取)