职位描述
1、 基于 Kubernetes 建设多租户 GPU 算力调度平台,支持弹性伸缩与任务级管理
2、实现 GPU 拓扑感知调度(NVLink/PCIe),降低跨卡通信 P99 尾延迟
3、 探索 MIG、时间分片等 GPU 切分方案,提升卡级利用率
4、构建高并发大模型在线推理平台
5、 建设 GPU、网络、存储、推理全链路可观测性体系
6、 推进 Spot 实例与自动扩缩容,降低算力成本
7、 建立故障定位、应急响应与根因分析机制任职要求
1、熟练 Golang、Python
2、熟悉 Kubernetes、Docker,有调度框架二次开发经验优先
3、熟悉至少一种训练/推理框架:PyTorch、Megatron、DeepSpeed、vLLM、SGLang
4、理解 GPU 架构、CUDA、异构计算;了解 RDMA、NVLink、InfiniBand
加分项:K8s Scheduler Framework、Volcano/Kueue、PD 分离、KV Cache、AI Agent 基础设施等