任职要求
全日制本科及以上学历,计算机、人工智能等相关专业,5年以上分布式系统或AI基础设施经验,其中至少1年专注于大模型推理调度。
深入理解vLLM、SGLang等至少一种推理框架的调度器实现。
深入理解Kubernetes调度框架扩展机制(自定义Scheduler/Operator),具备面向延迟敏感型工作负载的调度设计经验。
熟悉负载感知调度、优先级抢占、资源预留、拓扑感知等分布式调度算法,有千卡级GPU集群调度策略落地经验。
加分项
有基于历史Trace或在线反馈优化调度策略的实践经验(如离线仿真、强化学习调度)。
有MoE模型专家并行调度优化经验,理解EP与TP/PP的协同。
有GPU/NPU异构算力统一调度经验。