职位描述"1、集群入网验收测试:针对第三方交付的AI集群,负责服务器、GPU卡、IB/RoCE高速网络、存储系统、集群调度、整机环境的全维度验收测试,杜绝不达标硬件、网络、设备入网租赁。 2、测试体系与用例设计:独立制定AI集群验收标准、测试方案、测试用例,覆盖硬件健康、单机算力、多机多卡通信、NCCL通信、集群吞吐、存储IO、网络时延、集群稳定性、压力耐久测试。 3、集群性能基线搭建:完成万卡级集群性能基线建模,输出单机、单卡、多机集群标准性能指标,作为后续日常运维、故障判定、性能劣化对比的唯一基准。 4、问题定位与验收把关:验收过程中定位硬件缺陷、网络异常、性能不达标、集群配置问题,输出测试报告、问题清单、整改要求,未达标集群禁止上线租用,全程闭环验收。 5、上线后常态化性能监测:集群正式租用运营后,持续监控集群算力稳定性、通信质量、性能波动、故障率,及时发现隐性性能劣化、掉卡、网络抖动、通信瓶颈问题。 6、输出专业测试报告:定期输出集群性能报告、验收报告、质量评估报告,支撑资产方对账、履约评估、故障追责、SLA考核。 7、测试流程标准化:持续迭代集群验收SOP、测试工具、自动化测试脚本,实现大批量扩容场景下的标准化、可复制验收能力"任职要求"1、本科及以上学历,计算机、网络、电子、通信相关专业,5年以上数据中心、AI智算集群、GPU集群测试/运维经验。 2、必须具备GPU集群整集群验收、性能测试经验,熟悉万卡级AI集群交付标准,懂硬件验收、网络验收、集群性能评测全流程。 3、精通GPU单机测试、DCGM硬件诊断、NCCL多机通信测试、IB/RoCE网络性能测试、带宽时延排查、存储IO压测、集群压力稳定性测试。 4、熟悉Linux环境、Slurm/K8s集群调度,熟悉大模型训练场景性能特征,能区分硬件故障、网络故障、配置问题、业务压力导致的性能异常。 5、具备独立撰写测试方案、验收标准、测试报告的能力,逻辑严谨、数据敏感,能对集群质量结果负责。 6、熟练使用各类集群测试工具,能编写Shell/Python自动化测试脚本者优先。 7、工作严谨、责任心强,具备极强的质量底线意识,能顶住交付压力严格把控集群准入质量。"