职位描述
负责 AI 集群模拟器平台及 NOHW(No Hardware)运行环境的开发与维护,重点面向大规模 AI 训练与推理场景,构建 MUSA Runtime、GPU 通信、计算、网络等系统级模拟能力,实现真实 AI Workload 的采集、回放与性能分析,为 AI 芯片、集群系统及软件栈提供软硬件协同设计与性能评估平台。
岗位职责
负责 AI 集群模拟器平台(Cluster Simulator)的设计、开发与维护,支持大规模 AI 训练与推理系统的功能及性能建模。
负责 NOHW(No Hardware)运行环境开发,构建无需真实 GPU 即可运行 AI 应用的前端模拟框架,为上层 AI 软件提供透明运行环境。
负责 MUSA Runtime、MUSA Driver API、MCCL、RDMA 等运行时接口的 Hijack(Hook)与代理实现,支持 AI Workload 的捕获(Capture)、回放(Replay)及行为分析。
负责 PyTorch、Megatron-LM、DeepSpeed、vLLM、SGLang 等 AI 框架运行过程中的计算、通信、内存分配及调度行为建模,提取真实训练与推理 Workload。
负责 GPU Kernel、MUSA Stream、MUSA Graph、Memory、DMA、MCCL Collective 等模块的功能与性能建模,实现计算、通信和资源竞争的统一模拟。
负责 GPU、AI DSA、CPU、HBM、PCIe、MTLink、NoC、RDMA、InfiniBand 等关键硬件模块的系统级建模与性能分析。
负责分布式通信模型(AllReduce、ReduceScatter、AllGather、Broadcast、Pipeline Parallel、Tensor Parallel、MoE 等)的建模与优化,支持不同网络拓扑及集群规模的性能评估。
与芯片架构、系统软件、AI 框架、编译器及硬件验证团队紧密合作,完成系统瓶颈分析、架构探索及性能优化。
持续优化模拟器性能、提升大规模集群仿真效率,完善 Trace Capture、Replay、Profiler、可视化分析等工具链。
编写技术文档及开发规范,为模拟器平台的推广与维护提供技术支持。任职要求
任职要求
计算机科学、电子工程、软件工程或相关专业本科及以上学历。
精通 C/C++ 编程,具备优秀的软件设计能力及系统开发经验。
熟悉 MUSA Runtime、MUSA Driver API、MUSA Stream、MUSA Graph、MUSA Memory、MUSA IPC 等运行机制,具备 MUSA Runtime Hijack 或 Hook 开发经验。
熟悉 GPU 软件栈及 AI 框架(PyTorch、TensorFlow、Megatron-LM、DeepSpeed、vLLM、SGLang 等)的运行机制。
熟悉分布式通信框架(NCCL、RCCL、Gloo、MPI)及 RDMA、InfiniBand、RoCE、MTLink、PCIe 等互连技术。
具有系统级模拟器、性能模拟器或虚拟平台开发经验,能够完成计算、通信、网络等模块的建模工作。
熟悉 AI 训练与推理流程,理解 Workload Capture、Replay、Profiling、性能分析等相关技术。
具备良好的团队合作精神,能够与跨团队合作并推动项目进展。
能接受一定程度的加班,尤其在项目交付和关键任务阶段。
加分项
具有 CUDA Runtime、CUDA Driver、NCCL、cuBLAS、cuDNN 等 GPU 软件栈开发经验者优先。
具有 AI Runtime、GPU Runtime、推理引擎(TensorRT、vLLM、SGLang)开发经验者优先。
具有 RenderDoc、GFXReconstruct、Nsight、Kineto、Perfetto、CUPTI 等 Trace Capture 或 Replay 工具开发经验者优先。。
具有 AI 芯片、GPU、DSA、NoC、HBM、PCIe、NVLink 等架构设计或性能分析经验者优先。
加分项:
1. 具备 GPU 架构、性能优化相关经验者优先。
2. 具有硬件设计验证(如仿真、原型验证)经验者优先。