职位描述
1、负责视频生成数据平台建设,设计数据处理算子及 DAG 编排执行能力;
2、建设大规模数据 Pipeline 的分布式执行能力,包括任务调度、资源管理、失败恢复和断点续跑;
3、面向视频、多模态及 GPU 计算场景,优化 CPU、GPU、存储和网络之间的数据流转,提升处理吞吐和资源利用率;
4、建设平台可观测和任务管理能力,支撑大规模数据任务稳定运行和快速问题定位;
5、与算法团队深度协作,支持数据处理能力快速接入和迭代,提升训练数据生产效率。任职要求
1、熟悉 Python/C++/Go 中至少一种语言,具备扎实的分布式系统和工程基础;
2、有 Workflow、DAG Scheduler、分布式任务系统或大规模数据平台的设计与开发经验;
3、理解任务调度、资源管理、容错恢复和数据流转等核心机制,有 Ray、Spark、Flink 等相关经验者优先;
4、具备较强的系统设计、性能分析和问题定位能力。
加分项
1. 有 AI 数据平台、多模态或大规模视频数据处理经验。
2. 熟悉 Kubernetes、CPU/GPU 异构计算和大规模任务调度。
3. 熟悉 PyTorch、GPU 推理、CUDA/Triton 或数据处理算子性能优化。