职位描述
1. 参与大模型推理服务的集群部署与平台化建设,包括多机多卡并行、负载均衡和弹性伸缩;
2. 建设监控、故障定位和稳定性保障能力;
3. 持续优化推理吞吐、时延和资源利用率。任职要求
1. 本科及以上学历,计算机、软件工程、电子信息等相关专业;
2. 熟悉 Linux、计算机网络及 Python/C++ 中至少一种,了解 Docker/Kubernetes;
3. 了解 vLLM、TensorRT-LLM 等推理技术,有分布式系统、云原生或推理服务相关项目经历者优先;
4. 具备较强的问题定位、工程实践和协作能力。