职位描述1. 训练框架开发:参与VLA等大模型训练框架研发与优化,包括数据并行、模型并行、流水并行等分布式训练能力的建设,提升千卡规模的训练稳定性与资源利用率。 2. 推理系统优化:参与VLA等大模型的推理引擎开发与性能优化,包括算子优化、KV Cache管理、Prefill/Decode优化、Batch调度、低延迟Serving等核心能力建设,提升推理吞吐与响应速度。 3. 分布式系统优化:参与多机多卡训练与推理系统建设,优化NCCL通信、AllReduce效率及IB/RDMA网络性能,提升大规模集群运行效率。 4. 稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 5. 平台工程建设:参与训练/推理平台工程化建设,包括模型部署、监控、自动化测试、性能Benchmark及稳定性保障。任职要求1. 本科及以上学历,计算机、人工智能、自动化、机器人等相关专业优先 2. 熟悉Python或C++开发,具备良好的代码能力与工程习惯 3. 精通 PyTorch 分布式训练机制(DDP/FSDP),熟悉 DeepSpeed、Megatron-LM 、vLLM、SGLang等大规模训练/推理框架的原理与使用 4. 深入理解 3D 并行(Data Parallel / Tensor Parallel / Pipeline Parallel)的实现原理与适用场景,能够根据模型特点设计最优并行策略 5. 熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈 加分项: 1. 有 LLM/VLM/VLA 等大模型训练/推理的完整项目经验 2. 有 PyTorch/DeepSpeed/Megatron 等框架的核心贡献经验 3. 以第一作者在 ICML、ICLR、NeurIPS、MLSys、ASPLOS、OSDI、SC、PPoPP等顶级会议发表过相关研究成果 4. 在ACM ICPC、CCPC、OI等算法竞赛中取得优秀成绩者