职位描述我们致力于建设面向 AI 训练、推理和 Agent 等场景的 AI Infra 资源管理与调度平台,在保障大规模集群稳定性的同时,极致优化资源分配率与资源利用效率。 你将参与: - 调度与资源编排:参与 Kubernetes 调度编排,结合 CPU、GPU、NUMA、PCIe、NVLink / NVSwitch、RDMA 等硬件特性与拓扑感知,探索更加合理的资源编排策略。 - 资源效率优化:分析 GPU / CPU / Memory 等资源使用与碎片问题,通过丰富的调度策略、混部、超卖、负载感知等技术持续提升集群资源使用效率。 - 大规模集群稳定性:参与 APIServer、Scheduler、etcd、Kubelet 等 Kubernetes 核心组件的性能优化、稳定性建设、故障自愈。 - 多集群与联邦调度:建设多集群统一资源视图与联邦调度能力,在更大的资源池范围内进行资源调度、负载均衡与故障容灾。任职要求- 自驱性强,具备较强的学习能力与动手能力,敢于基于第一性原理 深入剖析本质,而非停留在问题表面。 - 计算机或相关专业本科 / 硕士在读,具备扎实的数据结构、算法、操作系统和计算机网络基础。 - 熟悉 Go / C++ / Rust / Python 中至少一门编程语言,具备良好的工程能力。 - 对分布式系统、操作系统、云原生技术有浓厚兴趣。 - 每周可实习 4 天及以上,持续 3 个月及以上优先。