职位描述
岗位职责:
- 负责自动驾驶 AI 训练/推理基础设施建设,优化 GPU 集群调度、分布式训练与推理性能,提升训练效率和系统稳定性。
基本要求
- 1 年以上后端 / 基础设施研发经验
- 一定的计算机基础(操作系统、网络、数据结构、分布式系统)任职要求
技术能力:
- 熟悉 Kubernetes / 容器 / GPU 推理训练技术栈
- 熟悉 Linux 系统、网络(TCP/IP、CNI 等)
- 熟练掌握 Go / Java / Python 至少一种语言
- 有分布式系统开发经验,理解高并发、高可用设计
加分项:
- GPU 调度 / Kubernetes 调度扩展与资源优化的建设经验
- AI 训练平台 / 推理平台建设经验
- 大规模集群(百节点以上)运维或开发经验
- 熟悉 NCCL / RDMA / GPU 网络优化
- 熟练具备 Vibe Coding 使用能力