职位描述职位概述 参与智元具身智能云平台的存储基础设施建设,负责分布式文件系统、容器存储接入、缓存与性能优化。围绕训练数据、模型产物及检查点的读写需求,建设稳定、易接入、可扩展的存储服务,支持研发团队高效使用和管理数据。 主要职责 1. 负责CephFS、JuiceFS或同类分布式文件系统的方案设计、集成与维护,完善容量扩展、配置管理和服务升级能力,保障共享存储稳定运行。 2. 建设基于CSI的容器存储接入能力,完善卷申请、挂载、回收及权限隔离机制,与计算和平台团队协作,提升资源申请与交付流程的可靠性。 3. 围绕训练数据读取和Checkpoint写入分析存储访问特征,优化并发吞吐、元数据和小文件性能,建立可复现的测试基准及瓶颈定位方法。 4. 设计并优化NVMe等缓存和数据预热方案,结合命中率、数据一致性及容量成本验证效果,减少远端读取开销,改善训练任务的数据访问体验。 5. 完善数据持久性、备份恢复、故障切换和生命周期管理能力,按场景落实访问控制与容量策略,通过恢复演练验证数据完整性和服务恢复效果。 6. 建设存储容量、延迟、吞吐和健康状态的监控与自动化工具,配合SRE团队完善告警及变更流程,推动问题闭环和容量规划持续改进。 承担主要目标/关键任务 1. 负责CephFS、JuiceFS或同类分布式文件系统的方案设计、集成与维护,完善容量扩展、配置管理和服务升级能力,保障共享存储稳定运行。 2. 建设基于CSI的容器存储接入能力,完善卷申请、挂载、回收及权限隔离机制,与计算和平台团队协作,提升资源申请与交付流程的可靠性。 3. 围绕训练数据读取和Checkpoint写入分析存储访问特征,优化并发吞吐、元数据和小文件性能,建立可复现的测试基准及瓶颈定位方法。 4. 设计并优化NVMe等缓存和数据预热方案,结合命中率、数据一致性及容量成本验证效果,减少远端读取开销,改善训练任务的数据访问体验。 5. 完善数据持久性、备份恢复、故障切换和生命周期管理能力,按场景落实访问控制与容量策略,通过恢复演练验证数据完整性和服务恢复效果。 6. 建设存储容量、延迟、吞吐和健康状态的监控与自动化工具,配合SRE团队完善告警及变更流程,推动问题闭环和容量规划持续改进。任职要求任职要求 1. 教育背景:本科及以上学历,计算机、软件工程、电子信息等相关专业优先。 2. 工作经验:3年以上分布式存储、文件系统或存储平台研发经验,能够独立承担部署、集成和性能优化工作;5年以上相关经验,具备存储架构设计或复杂故障处理经历者优先。 3. 理解分布式文件系统、数据一致性及可靠性原理,熟悉CephFS、JuiceFS或同类系统中的至少一种,具有实际部署、集成或维护经验。 4. 熟悉Linux文件系统、网络存储和IO分析方法,能够结合系统指标、访问负载及压测结果定位吞吐、时延、元数据或容量瓶颈。 5. 了解Kubernetes存储模型与CSI机制,具备共享卷、动态供给、挂载排障或权限隔离相关经验,能够处理容器与底层存储之间的集成问题。 6. 掌握Go、Python或C++等至少一种编程语言,具备自动化工具开发和问题验证能力,重视数据完整性、变更风险及跨团队沟通。 加分项 1. 具有AI训练、海量小文件或高并发共享存储实践,参与过数据预热、多级缓存或检查点读写优化,能够说明性能测量方法与优化收益。 2. 具有分布式文件系统、CSI驱动或存储开源项目贡献经验,或具备备份恢复、故障演练、容量治理及存储自动化平台建设经历。