职位描述
- 负责建设支撑人类数据和仿真数据生产的分布式计算平台。
- 建设跨地域计算资源调度、任务队列、配额、优先级和弹性扩缩能力。
- 将串行任务拆成可并行、可隔离、可重试、可观测的计算单元。
- 支持批处理(batch)、微批处理(micro-batch)、流处理(streaming)等执行模式,完善故障恢复和容量治理。
- 持续优化任务吞吐、排队时延、失败率、GPU 利用率和单位计算成本,并为系统和 Agent 提供清晰、可观测的任务接口。任职要求
- 3 年以上分布式计算、任务调度、数据平台或基础设施相关经验,本科及以上优先,能力优秀可放宽。
- 理解任务调度、队列、并发、资源池、隔离和故障恢复,有实际系统经验。
- 有云上计算、GPU / 计算卡或大规模异步任务平台经验。
- 能从复杂处理链路中识别并行边界、数据依赖和资源隔离边界。
- 具备生产系统的设计、实现、排障和运维能力;能熟练使用 Cursor、Codex、Claude Code 等工具完成开发、测试和问题定位,并验证生成结果。
加分项
- 做过 Ray、Spark、Flink、Kubernetes Jobs、Argo、Slurm 或 GPU 调度平台。
- 有跨地域调度、GPU 利用率优化或大规模异步计算经验。
- 有媒体处理、点云处理、仿真任务或机器学习计算平台经验。