职位描述
1、负责设计、构建和优化支撑人工智能训练、大规模数据分析等智算业务的核心存储平台。需要应对EB级数据规模和百GB/s级吞吐的挑战,确保存储系统具备高可靠、高性能与高可扩展性,为公司的前沿业务提供坚实的数据基石 。任职要求
1、学历与经验:计算机科学、软件工程等相关专业本科及以上学历,具备3年以上分布式系统或云系统开发/运维经验 。
2、 技术栈:
- 精通Go、C++ 或Python中至少一门语言,具备高性能、高并发系统开发或自动化脚本编写能力 。
- 深入理解分布式系统原理,熟悉至少一种主流分布式存储系统(如Lustre、MinIO、Ceph、GPFS)的架构与核心机制 。
- 熟悉Kubernetes存储生态,具有CSI插件的实际开发或运维经验 。
- 熟悉Linux操作系统,对I/O栈、文件系统有深入理解 。
3、综合能力:具备出色的分析问题和解决问题的能力,对技术有热情,有良好的团队协作精神和沟通能力 。
4、优先考虑条件
- 有支撑千亿参数大模型训练或AI训推平台存储系统的设计、开发或运维经验 。
- 具备存储性能分析(如GPFS 、Lustre )和深度调优经验,熟悉InfiniBand、RoCE等高速网络技术 。
- 熟悉AI训练数据流水线,或有向量数据库存储方案经验 。
- 具备业界知名的存储厂商或超算中心工作背景