职位描述
1. 深度技术顾问与方案架构 (Deep Tech Consulting)
负责KA客户(大模型厂商、互联网巨头、科研机构)的GPU集群系统架构设计。
针对客户的LLM(大语言模型)训练与推理场景,提供从硬件选型、网络拓扑(IB/RoCE)到软件栈的全栈解决方案。
深入理解客户模型(如Llama 3, Mixtral, Qwen等),针对性地设计**分布式并行策略**(Data/Tensor/Pipeline Parallelism, Sequence Parallelism, MoE等),最大化集群MFU(Model FLOPS Utilization)。
2. 性能优化与底层攻坚 (Performance & Kernel Optimization)
解决客户在使用过程中的深层技术瓶颈,包括但不限于**驱动兼容性、编译器(Compiler)优化、算子(Operator)开发与融合**。
利用Profiling工具(如Nsight Systems, PyTorch Profiler)定位性能热点,指导或协助客户进行Custom Kernel优化(CUDA/Triton/Hip)。
处理大规模集群下的稳定性问题(Stragglers, ECC errors, NCCL timeout等),保障长周期训练的稳定性。
3. 商业价值与TCO核算 (TCO & Business Value)
不仅仅是技术支持,需具备商业思维。协助客户进行TCO(Total Cost of Ownership)核算,通过算力利用率提升、训练时间缩短、推理延迟降低等指标,量化方案带来的ROI(投资回报率)。
对比竞品方案,从CAPEX(资本性支出)和OPEX(运营支出)维度输出专业的竞争分析报告。
4. 产品反馈闭环 (Product Feedback Loop)
将一线客户在驱动、API、编译器、框架适配等方面的痛点转化为高质量的PRD或技术需求,反向推动研发团队改进底层软件栈(SDK/Driver/Firmware)。任职要求
1. 教育背景:计算机科学、电子工程、数学或相关专业本科及以上学历。
2. 工作经验:5年以上HPC、AI基础设施或GPU相关领域工作经验,其中至少2年深度参与大模型(LLM)项目。
3. GPU体系结构**:
深刻理解GPU硬件架构(Memory Hierarchy, Streaming Multiprocessors, Interconnects like NVLink/PCIe)。
熟悉底层软件栈:Driver, CUDA Toolkit, NCCL, HCCL等。
4. AI编译与算子:
具备算子开发或优化经验(CUDA, Triton, TVM, MLIR等)。
理解AI编译器原理(XLA, TorchDynamo, TensorRT, vLLM等)者。
5. 分布式训练框架:
精通PyTorch及主流分布式训练库(Megatron-LM, DeepSpeed, FSDP)。
熟悉大规模集群通信原语(All-reduce, All-gather, Reduce-scatter)及其在不同网络环境下的调优。
6. 客户服务能力:
具备TAM(Technical Account Manager)的服务意识,能够管理高压下的客户预期,具备极强的Technical Communication能力。