职位描述负责多模态大模型在GPU上的推理效率优化,通过编译优化、高性能算子开发与模型并行策略,实现极致的部署性能。 1. 负责多模态大模型在GPU硬件上的推理效率优化,结合编译、算子开发等手段实现性能领先。 2. 针对PyTorch/CUDA计算任务,进行算子和系统级性能调优。 3. 开发高效的模型并行与通信优化策略,充分挖掘GPU硬件算力。任职要求1. 学历与实习:2027届及以后毕业,本科及以上学历,实习表现优秀者可转正。 2. 专业背景:计算机、数学、物理、电子工程、自动控制等相关专业。 3. 核心能力:熟练掌握C/C++或Python,具备优秀的工程实现能力。熟悉计算机体系结构。 4. 技能与经验:有CUDA开发经验,或熟悉TVM、TensorRT、Triton等推理框架者优先。具备NOIP、蓝桥杯、ACM等编程竞赛经验者优先。