职位描述
1、负责AI服务器整机系统级测试架构设计,熟悉服务器硬件、BIOS、BMC、OS、软件栈及AI模型运行全链路,搭建整机系统测试体系,制定高阶测试架构方案、整体测试策略及项目级测试计划,主导复杂整机测试方案落地实施。
2、牵头AI服务器全栈系统复杂问题分层分类、初步定位与统筹拆解,针对硬件故障、固件异常、系统兼容、OS内核异常、软件资源冲突、AI模型运行异常等跨层级疑难问题,精准界定问题域、梳理故障链路,协调硬件、固件、系统、AI研发团队联合攻坚,推动问题根因定位与闭环解决。
3、深度参与服务器前期系统架构、硬件方案、固件与OS适配方案评审,从系统全局视角识别整机架构、供电散热、多部件兼容、固件系统联动、AI算力负载适配等架构级风险,输出风险评估报告与专项验证方案,前置规避架构设计缺陷。
4、主导AI服务器整机系统级功能、跨层兼容性、极限性能、长期稳定性、AI负载适配性的专项架构验证,统筹测试全流程质量管控,汇总分析全链路测试数据,输出架构级测试结论、性能瓶颈分析及系统优化建议。
5、沉淀服务器系统级测试方法论、架构测试规范与疑难问题分析模型,持续迭代全栈测试标准体系;调研行业前沿算力测试技术,优化AI服务器高阶测试架构,提升复杂系统问题识别与预判能力。
6、统筹重点项目测试技术攻关,解决整机跨层级、跨模块系统性测试难题,赋能团队测试能力提升,支撑服务器产品架构迭代与算力业务稳定落地。任职要求
1、研究生及以上学历,计算机、电子信息、通信工程、自动化等相关专业,8年以上服务器整机系统测试、系统架构相关工作经验。
2、具备服务器全栈系统级认知能力,精通服务器硬件架构、BIOS/UEFI、BMC固件原理、Linux操作系统内核、驱动及软件栈,熟悉AI模型训练/推理运行机制,掌握软硬件、固件、系统、AI负载的全链路交互逻辑。
3、具备极强的复杂系统问题拆解与定位能力,能够独立牵头跨层级疑难问题分析,精准区分硬件、固件、OS、软件、AI运行时等不同域故障,具备成熟的系统性问题排查经验。
4、精通AI服务器整机测试体系与架构设计,具备大型服务器平台、AI算力服务器的整机系统测试架构搭建经验,熟悉整机RAS、功耗散热、兼容性、长稳、高负载算力场景测试逻辑。
5、熟练使用Linux系统,精通Shell、Python等脚本开发,具备测试自动化框架搭建、测试工具自研能力,有固件、系统、硬件联合测试方案设计经验。
6、具备优秀的架构思维、项目统筹能力和技术研判能力,能够从系统全局视角把控测试质量和架构风险,逻辑清晰、责任心强,具备高效的跨团队协同攻坚能力。
- 优先条件(进阶加分项)
1、熟悉服务器PCIE、DDR、高速网络、HBM等核心高速接口原理,具备接口底层调试、跨层兼容问题定位经验。
2、深耕AI服务器整机领域,熟悉GPU/AI加速卡整机适配、算力集群系统架构,有大型AI服务器平台架构测试、专项攻关经验。
3、头部服务器厂商、大型IDC数据中心算力平台系统测试架构工作经验者优先。
4、具备BMC、BIOS配置调试及简易脚本开发能力,熟悉IPMI、Redfish、ACPI等固件协议,有软硬件协同优化经验。
5、具备服务器整机极限压力、长期老化、高并发算力负载稳定性测试架构设计及问题分析经验。
有带领或指导系统软件/集成测试团队的经验,能够培养平台集成与问题诊断能力。
5.综合素质
强烈的客户导向与 ownership 意识,认同清微作为整机销售方对整体软件体验负责的定位。
适应多供应商、多版本、快速迭代的 AI 服务器产品节奏,能在信息不完整情况下推进问题闭环。
良好的中英文技术读写与沟通能力。