职位描述
1. 参与大模型训练与推理基础设施研发,包括分布式训练、GPU 集群调度、模型并行和任务管理;
2. 优化训练与推理性能、资源利用率及系统稳定性;
3. 参与平台监控、故障定位和工程工具建设。"任职要求
1. 本科及以上学历,计算机、软件工程、电子信息等相关专业;
2. 熟悉 Python/C++ 中至少一种,具备操作系统、计算机网络和分布式系统基础;
3. 了解 PyTorch、CUDA、容器、集群调度或主流训练/推理框架,有相关课程项目、竞赛或实习经历者优先;
4. 具备良好的系统思维、问题定位能力和工程质量意识。