职位描述我们正在寻找一位在视觉与视频大模型训练系统优化领域有深厚经验的专家,负责构建与优化面向卷积、Transformer及混合架构的超大规模训练平台。你将主导提升万卡级GPU集群在训练图像、视频等视觉模型时的极致效率,攻克显存、计算与通信瓶颈,支撑Diffusion、Sora-like等前沿视觉模型的快速迭代与创新。 核心职责 1. 训练平台架构与优化 - 设计并优化面向超大规模GPU集群的分布式训练架构,重点针对视觉模型(如图像生成、视频生成) 的计算与数据模式进行深度定制。 - 系统性优化训练任务的全链路性能,显著降低视觉大模型(从数亿到千亿参数)的迭代周期与训练成本。 2. 视觉模型极致性能优化 - 深入优化视觉模型核心组件:针对卷积网络(CNN)、视觉Transformer(ViT)、Diffusion U-Net等架构,在算子级、图级进行内核融合、计算图优化与显存复用。 - 攻克视频模型训练挑战:优化3D卷积、时空注意力、长序列建模等带来的显存爆炸与通信效率问题,设计高效的时序并行与数据加载策略。 - 主导训练框架与底层计算库的深度调优,针对性优化NCCL通信模式,解决视觉模型特有的大尺度特征图、梯度同步带来的通信瓶颈。 3. 系统稳定性与效率 - 构建高容错、弹性可扩展的训练系统,保障长达数周或数月的视频模型训练任务的稳定性与自动恢复。 - 设计智能的资源调度策略,实现异构视觉计算任务(如训练、微调、评测)的高效混合部署与资源隔离,最大化集群利用率。 4. 平台化与协作 - 打造面向视觉算法研究的高效训练平台,提供针对视觉任务的定制化性能剖析工具(如帧级、层级的显存与计算分析),提升算法团队的调试与创新效率。 - 与视觉算法团队紧密协作,理解前沿模型(如文生视频、世界模型)对系统的需求,共同定义下一代训练系统的架构。 5. 技术前瞻与团队引领 - 跟踪并引入视觉计算与训练系统领域的交叉前沿技术(如新型视觉算子编译、硬件感知的模型架构搜索),主导平台技术演进。 - 指导并培养高性能计算与分布式系统工程师团队,建立卓越的工程技术文化。任职要求1. 必备条件 - 5年以上大规模视觉/视频模型分布式训练系统或高性能计算(HPC)领域的开发与架构经验,有千卡以上GPU集群优化实战经验。 - 精通视觉模型的训练优化:深刻理解CNN、Transformer、Diffusion等模型在分布式训练中的性能瓶颈,并具备实际的优化案例(如优化吞吐、降低显存)。 - 深入理解现代大模型训练并行技术,并能针对视觉模型特点(如图像分块、序列长度可变)设计和实现定制化的并行策略。 - 熟练掌握CUDA编程、NCCL通信优化、性能剖析工具,具备视觉模型特有计算模式(如激活值大、卷积操作多)的精准诊断与优化能力。 - 熟悉Kubernetes及主流机器学习平台,具备管理大规模视觉训练集群的完整经验。 - 出色的系统编程能力(Python/C++/Go)。 2. 优先考虑 - 有成功主导十亿/百亿参数级别的视觉大模型(尤其是视频生成模型) 完整训练周期优化的实战经验。 - 在视觉计算编译器(如TVM, Triton)、内核开发(如定制CUDA内核实现高效卷积/注意力)方面有深入经验。 - 具备从零搭建或主导重构视觉专属训练平台的经历。 - 在顶级会议(CVPR, ICCV, ECCV, MLSys, NeurIPS)发表过相关论文或有知名开源视觉项目贡献者优先。 我们提供 - 直面视觉AI时代最核心的大规模训练挑战,技术复杂度和影响力位于行业前沿。 - 与全球顶尖的视觉算法科学家和系统工程师共同工作,打造业界领先的视觉人工智能基础设施。 - 极具竞争力的薪酬、期权激励,以及专注于长期成长的技术环境。