职位描述
1.针对大模型(如LLM、多模态模型)在线服务场景,进行性能分析与优化、构建推理框架;
2.有兴趣探索服务端软硬件协同优化、集群化分布式推理等创新方案。任职要求
1.有大规模分布式系统或高并发在线服务开发经验,主导过推理优化项目;
2.熟悉multi-head Latent Attention (MLA), FlashAttention等优化技术;
3.熟悉各种分布式并行策略,如Pipeline Parallelism, Tensor Parallelism, Expert Parallelism,Context Parallelism;
4.具备强烈的业务导向思维,能快速将技术方案转化为业务指标提升;
5.优秀的问题拆解能力,擅长在复杂系统中定位根因并设计系统性解决方案。