Ivyea Jobs 5948 roles · 69 companies · 刚刚
摩尔线程 · AI 芯片

资深GPU解决方案架构师

北京 社招 · 全职 芯片类 AI Infra / 训练系统

职位描述

1. 深度技术顾问与方案架构 (Deep Tech Consulting)  负责KA客户(大模型厂商、互联网巨头、科研机构)的GPU集群系统架构设计。  针对客户的LLM(大语言模型)训练与推理场景,提供从硬件选型、网络拓扑(IB/RoCE)到软件栈的全栈解决方案。  深入理解客户模型(如Llama 3, Mixtral, Qwen等),针对性地设计**分布式并行策略**(Data/Tensor/Pipeline Parallelism, Sequence Parallelism, MoE等),最大化集群MFU(Model FLOPS Utilization)。 2. 性能优化与底层攻坚 (Performance & Kernel Optimization)  解决客户在使用过程中的深层技术瓶颈,包括但不限于**驱动兼容性、编译器(Compiler)优化、算子(Operator)开发与融合**。  利用Profiling工具(如Nsight Systems, PyTorch Profiler)定位性能热点,指导或协助客户进行Custom Kernel优化(CUDA/Triton/Hip)。  处理大规模集群下的稳定性问题(Stragglers, ECC errors, NCCL timeout等),保障长周期训练的稳定性。 3. 商业价值与TCO核算 (TCO & Business Value)  不仅仅是技术支持,需具备商业思维。协助客户进行TCO(Total Cost of Ownership)核算,通过算力利用率提升、训练时间缩短、推理延迟降低等指标,量化方案带来的ROI(投资回报率)。  对比竞品方案,从CAPEX(资本性支出)和OPEX(运营支出)维度输出专业的竞争分析报告。 4. 产品反馈闭环 (Product Feedback Loop)  将一线客户在驱动、API、编译器、框架适配等方面的痛点转化为高质量的PRD或技术需求,反向推动研发团队改进底层软件栈(SDK/Driver/Firmware)。

任职要求

1. 教育背景:计算机科学、电子工程、数学或相关专业本科及以上学历。 2. 工作经验:5年以上HPC、AI基础设施或GPU相关领域工作经验,其中至少2年深度参与大模型(LLM)项目。 3. GPU体系结构**:  深刻理解GPU硬件架构(Memory Hierarchy, Streaming Multiprocessors, Interconnects like NVLink/PCIe)。  熟悉底层软件栈:Driver, CUDA Toolkit, NCCL, HCCL等。 4. AI编译与算子:  具备算子开发或优化经验(CUDA, Triton, TVM, MLIR等)。  理解AI编译器原理(XLA, TorchDynamo, TensorRT, vLLM等)者。 5. 分布式训练框架:  精通PyTorch及主流分布式训练库(Megatron-LM, DeepSpeed, FSDP)。 熟悉大规模集群通信原语(All-reduce, All-gather, Reduce-scatter)及其在不同网络环境下的调优。 6. 客户服务能力:  具备TAM(Technical Account Manager)的服务意识,能够管理高压下的客户预期,具备极强的Technical Communication能力。