职位描述
集群方向
**岗位定位**
面向 AI 芯片在大规模训练与推理集群中的部署落地,负责 AI 集群产品方案、服务器与硬件生态适配、集群拓扑设计及 NPI 导入支持。该岗位兼具产品经理与解决方案架构师职责,需要理解 AI 集群建设方案、服务器架构、网络拓扑、存储与运维体系,并能结合 AI 芯片特性提出系统级产品方案。
**岗位职责**
1. 负责 AI 芯片在训练集群、推理集群、智算中心、私有化算力平台等场景中的产品规划与整体解决方案设计。
2. 研究和分析市面主流 AI 集群建设方案,包括 GPU 集群、AI 加速卡集群、InfiniBand/RoCE 网络、Scale-up/Scale-out 拓扑、存储与调度架构等。
3. 结合 AI 芯片性能、互联能力、功耗、散热、带宽、服务器形态等特征,提出服务器、整机柜、集群网络和相关硬件建设方案。
4. 对接服务器厂商、网络设备厂商、存储厂商、电源/散热/机柜等硬件生态伙伴,推动产品适配、联合设计、测试验证和量产导入。
5. 从技术和产品角度参与 NPI 导入流程,包括硬件选型、BOM 方案、样机验证、兼容性测试、可靠性测试、问题闭环和量产风险评估。
6. 输出 AI 集群产品方案、部署拓扑、硬件配置建议、客户交付方案、测试标准、选型指南和竞品分析材料。
7. 支持重点客户的集群建设项目,包括需求澄清、方案设计、技术交流、PoC 支持、部署验证和交付复盘。
8. 与芯片、硬件、软件、系统、运维、交付团队协作,推动 AI 集群方案从架构设计到客户落地。
**任职要求**
1. 本科及以上学历,计算机、电子工程、通信、自动化、微电子、人工智能等相关专业优先。
2. 具备 AI 集群、GPU 服务器、智算中心、数据中心网络、服务器硬件或 AI 芯片相关产品/解决方案经验。
3. 熟悉 AI 集群建设中的核心组件,包括服务器、AI 加速卡、CPU、内存、PCIe、NVLink/高速互联、网卡、交换机、存储、电源和散热系统。
4. 了解主流 AI 集群网络方案和拓扑设计,如 InfiniBand、RoCE、以太网、Spine-Leaf、参数面/数据面/管理面网络等。
5. 能够根据 AI 芯片特性和客户业务负载,提出集群规模、服务器形态、网络拓扑、存储配置、功耗散热和运维管理建议。
6. 具备服务器或硬件产品 NPI 导入经验,理解样机验证、兼容性测试、可靠性测试、问题定位和量产导入流程。
7. 具备较强的技术抽象能力、产品文档能力、客户沟通能力和跨公司协同能力。
8. 能适应客户现场支持、硬件厂商协同和阶段性出差。
**加分项**
1. 有 AI 芯片厂商、服务器厂商、网络设备厂商、云厂商或大型智算中心建设经验。
2. 熟悉 NVIDIA GPU 集群、HGX/DGX、OAM、PCIe 加速卡、整机柜服务器等产品形态。
3. 有大规模训练集群、推理集群、液冷数据中心或整机柜交付经验。
4. 熟悉 Kubernetes、Slurm、RDMA、NCCL/HCCL 类通信库、集群监控和运维体系者优先。任职要求
云业务应用方向
**岗位定位**
面向 AI 芯片在云业务场景中的规模化落地,负责 AI 云产品需求梳理、软件栈产品规划、客户方案设计与生态适配推进。该岗位兼具产品经理与解决方案架构师职责,需要理解云厂商 AI 算力服务形态,并能将客户业务需求转化为芯片、基础软件、模型优化和平台能力建设方向。
**岗位职责**
1. 负责 AI 芯片在云业务场景中的产品规划与方案设计,包括公有云、私有云、专有云、AI PaaS、模型服务平台等应用场景。
2. 对接云厂商、互联网客户及行业云客户,梳理 AI 训练、推理、模型部署、弹性调度、资源管理、镜像交付、运维监控等软件需求。
3. 输出面向云场景的 AI Infra 产品方案,包括软件栈能力、SDK/工具链、镜像、容器化部署、模型适配、性能优化、云平台集成等。
4. 跟踪主流 AI 云产品形态和使用方式,分析 GPU/AI 加速卡在云上训练、推理、模型服务中的部署模式和客户痛点。
5. 结合客户模型与业务负载,对 AI 模型优化、算子优化、编译器优化、推理引擎优化、框架适配等方向提出建设性产品需求。
6. 与研发、架构、软件、算法、交付团队协作,推动云业务需求从定义、评审、开发、验证到客户交付闭环。
7. 支持重点客户项目,包括技术交流、方案宣讲、PoC 设计、问题定位、性能对比、交付复盘等。
8. 沉淀云业务场景下的标准产品文档、解决方案白皮书、客户需求池和竞品分析材料。
**任职要求**
1. 本科及以上学历,计算机、电子工程、通信、自动化、人工智能等相关专业优先。
2. 具备 AI Infra、云计算、AI 芯片、GPU 服务器、AI 平台或大模型基础设施相关经验。
3. 有 AI 芯片厂商、云厂商、服务器厂商、AI 平台公司或大型互联网基础设施团队经验者优先。
4. 熟悉 AI 云场景的典型使用方式,包括模型训练、推理服务、容器化部署、Kubernetes、镜像管理、资源调度、监控运维等。
5. 了解 PyTorch、TensorFlow、ONNX、Transformers、vLLM、TensorRT、Triton Inference Server 等主流 AI 框架或推理服务组件者优先。
6. 具备一定模型优化和基础软件理解能力,能够围绕性能、易用性、稳定性、可观测性提出产品化建议。
7. 具备优秀的客户沟通、需求抽象、方案撰写和跨团队推动能力。
8. 能适应面向客户的技术交流、项目支持和阶段性出差。
**加分项**
1. 有云厂商 AI 算力产品、AI PaaS、MaaS、模型服务平台建设经验。
2. 有大模型训练或推理部署经验,熟悉 LLM、Diffusion、多模态模型等典型负载。
3. 有 AI 芯片软件栈、编译器、算子库、驱动、Runtime、推理引擎相关产品经验。
4. 有从 0 到 1 推动 AI Infra 产品落地并服务标杆客户的经验。