欢迎加入摩尔线程!我们搭建面向 AI 训练与推理的大规模计算基础设施,涵盖 GPU 集群资源管理、分布式训练平台、高性能推理框架与服务、调度及可观测性等方向。期待计算机基础扎实、愿意深耕系统底层、热衷于攻克大规模工程难题的同学加入!
岗位职责
1、参与大规模 GPU 集群的规划、设计和开发,支持并参与 AI 训练平台和高性能 AI 推理系统的研发,优化大规模系统中 AI 训练、推理的性能和稳定性。
2、参与分布式系统、存储、网络、计算等基础能力建设,解决大规模场景下的性能与可靠性问题。
3、与算法、模型、业务及基础设施团队协作,将前沿模型能力稳定、高效地落地到生产环境。