职位描述
岗位职责:
1、负责千卡级GPU集群上视频生成(VideoGen)/VLM多模态大模型的分布式训练架构设计与性能优化,提升训练吞吐与稳定性;
2、攻克大规模训练中的通信/显存/计算瓶颈,优化数据并行、模型并行、流水线并行等策略,支撑超长视频训练;
3、搭建千万小时级海量视频/多模态数据的高效存储、索引与加载流水线(streaming pipeline),设计高性能dataloader与多级缓存机制,消除IO瓶颈;
4、建立训练任务的全链路监控、profiling与自动故障恢复体系,保障长时间训练任务的连续性与资源利用率;
5、持续跟进业界前沿的分布式训练与数据调度技术,推动基础设施架构演进。任职要求
任职要求:
1、统招硕士及以上学历,计算机相关专业,5年以上AI训练基础设施/高性能计算相关经验;
2、有千卡级以上大规模分布式训练实战优化经验,深入理解分布式并行策略及底层通信/存储原理;
3、熟悉PyTorch分布式训练底层实现,有框架/通信库二次优化经验者加分;
4、有千万小时级视频或多模态数据的存储、索引、预处理及高性能加载实战经验,熟悉cached dataloader/streaming pipeline设计;
5、精通集群资源管理与任务调度,熟练使用性能profiling工具定位系统瓶颈;
6、工程能力强,Python/C++扎实,系统设计功底好;
7、有视频生成、世界模型、多模态预训练核心Infra背景者优先。
加分项:
有千卡级训练稳定性优化/故障自动恢复体系建设经验;
熟悉Ray、SLURM、Kubernetes等调度系统;
有FasterTransformer/vLLM/Triton等推理/训练加速库经验。
团队亮点:
核心方向,算力资源充足,技术挑战大;
与顶尖算法团队紧密配合,技术影响力广;
发展空间大