职位描述
岗位职责:
1. 设计并实现自研GPU集群的云原生平台能力,包括Kubernetes GPU Device Plugin、Operator、容器runtime等组件。
2. 构建超节点集群调度系统,实现跨节点GPU作业调度、资源分配、负载均衡及拓扑感知调度,提升吞吐率和降低延迟。
3. 在GPU调度层面与大模型推理框架协作,规划和调度KV Cache和PD分离策略、实现高效GPU利用率、降低延迟并提升吞吐率。
4. 分析GPU集群硬件拓扑、网络和存储结构,为调度策略提供硬件感知能力。
5. 大模型推理集群部署与问题定位。
6. 设计并开发GPU集群监控与控制平面系统。任职要求
1. 熟悉Linux,擅长Go/C++/Python编程语言。
2. 熟悉Kubernetes和容器技术,具备GPU云原生技术实践经验。
3. 熟悉作业调度框架(如 Volcano、Slurm),能设计和优化 GPU 作业调度、监控和资源分配策略。
4. 熟悉大模型推理流程,有vllm使用经验。
5. 熟悉基于Prometheus、ELK Stack、OpenTelemetry的可观测性体系建设,具备控制面板与运维平台开发能力。
加分项:
1. 熟悉GPU硬件拓扑(GPU/PCIe/NVLink/NUMA)、节点间网络(RDMA/InfiniBand/NVSwitch)及存储I/O优化,具备硬件感知调度能力。
2. 了解大集群推理框架(LLM-D、AiBrix)及跨节点调度特性,能在调度层优化KV Cache和PD分离,实现高GPU利用率和低延迟。
立即投递