职位描述
1. 设计和优化大规模机器学习工作负载的基础设施系统,并提升可靠性和效率
2. 开发高性能推理系统,确保快速高效的 AI 模型服务
3. 管理推理服务的自动扩展、持续部署和功能推出
4. 为端点部署、镜像发布和推理引擎构建 CI/CD 基础设施
5. 对各种生产工作负载下的推理引擎的性能进行基准测试和监控
6. 与跨职能团队紧密合作,将前沿模型部署到生产环境中任职要求
1. 教育背景:计算机科学或相关技术领域的学士或硕士学位。
2. 对分布式系统、云计算、边缘计算和机器学习系统有深入的理解
3. 精通至少一种编程语言,例如 Python 或 C/C++
4. 拥有大规模高可用或低延迟系统开发经验
5. 具备良好的协作能力和与他人合作的能力
6. 能够主动学习新概念并将其应用于工作