职位描述
岗位职责
1. 负责公司大规模算力与服务调度系统的设计、开发与持续演进,支撑视频生成业务的稳定运行
2. 统一设计并实现算力调度、服务调度与请求调度的多层调度体系,在资源利用率、延迟与稳定性之间取得工程最优解
3. 面向在线推理与离线训练等不同场景,构建高并发、低延迟、可弹性扩缩容的调度与负载均衡机制
4. 解决 GPU 资源碎片化、任务抢占、优先级隔离、长短任务混部等复杂调度问题,持续提升整体算力利用效率
5. 与模型平台、推理服务、Workflow / Agent 系统深度协作,打通从请求 → 服务 → GPU 资源的完整调度链路
6. 建设调度系统的可观测性与稳定性体系,包括监控、告警、容量评估与异常自愈,保障大规模系统长期可靠运行任职要求
任职要求
1. 本科及以上学历,计算机或相关专业,具备5年以上分布式系统或平台研发经验,能够主导复杂系统架构设计
2. 精通至少一种后端语言(Go / C++ / Java 等),具备扎实的并发、网络与系统设计基础
3. 熟悉 Kubernetes 与容器技术栈,具备 operator 等开发能力。有大规模资源调度、任务调度或服务调度的实际工程经验(如 GPU / 容器 / 任务 / 流量调度等)
4. 熟悉 GPU 计算或 AI 推理/训练系统,对 GPU 利用率、显存管理、任务并发模型 等问题有深入理解
5. 具备从 0→1 或 1→N 构建平台级系统的能力,能在性能、稳定性、成本与复杂度之间做出成熟取舍
6. 具备良好的技术判断力与跨团队协作能力,能够在多业务、多约束条件下推动复杂问题落地