Ivyea Jobs 6482 roles · 88 companies · 刚刚
爱诗科技 · AI 应用

大模型训练平台调度专家

北京 社招 · 全职 AI Infra / 训练系统

职位描述

岗位职责 1. 负责公司大规模算力与服务调度系统的设计、开发与持续演进,支撑视频生成业务的稳定运行 2. 统一设计并实现算力调度、服务调度与请求调度的多层调度体系,在资源利用率、延迟与稳定性之间取得工程最优解 3. 面向在线推理与离线训练等不同场景,构建高并发、低延迟、可弹性扩缩容的调度与负载均衡机制 4. 解决 GPU 资源碎片化、任务抢占、优先级隔离、长短任务混部等复杂调度问题,持续提升整体算力利用效率 5. 与模型平台、推理服务、Workflow / Agent 系统深度协作,打通从请求 → 服务 → GPU 资源的完整调度链路 6. 建设调度系统的可观测性与稳定性体系,包括监控、告警、容量评估与异常自愈,保障大规模系统长期可靠运行

任职要求

任职要求 1. 本科及以上学历,计算机或相关专业,具备5年以上分布式系统或平台研发经验,能够主导复杂系统架构设计 2. 精通至少一种后端语言(Go / C++ / Java 等),具备扎实的并发、网络与系统设计基础 3. 熟悉 Kubernetes 与容器技术栈,具备 operator 等开发能力。有大规模资源调度、任务调度或服务调度的实际工程经验(如 GPU / 容器 / 任务 / 流量调度等) 4. 熟悉 GPU 计算或 AI 推理/训练系统,对 GPU 利用率、显存管理、任务并发模型 等问题有深入理解 5. 具备从 0→1 或 1→N 构建平台级系统的能力,能在性能、稳定性、成本与复杂度之间做出成熟取舍 6. 具备良好的技术判断力与跨团队协作能力,能够在多业务、多约束条件下推动复杂问题落地
爱诗科技去官方页面投递 →