职位描述
1.参与GPU工具链整体架构设计与技术方案选型,负责全工具矩阵的迭代升级
2.负责核心工具难点攻坚,解决多卡集群监控一致性、大规模长稳压测准确性、静默故障精准捕获、复杂网络异常定位等核心技术问题,提升GPU芯片可靠性与运维效率
3.参与自动化运维工具开发,统一硬件错误采集、解析、告警、复盘闭环,建立硬件故障知识库与自动化诊断规则
4.参与网络管理工具体系开发,构建覆盖拓扑探测、节点管理、链路校验、带宽时延基准测试、异常溯源、故障分级的全链路网络诊断能力,支撑大规模分布式训练集群稳定性保障
5.对接量产、运维、客户交付场景,输出标准化工具方案与自动化流程,支撑量产测试、线上故障自愈、客户问题快速定位
6.主导技术调研与预研,跟进业界GPU工具生态新技术,持续优化工具性能、扩展性与兼容性,搭建可复用的工具组件与底层抽象框架任职要求
1.本科及以上学历,3年及以上Linux C/C++底层系统、GPU工具链研发经验,有成熟的工具架构落地案例
2.深刻理解NVML、SMI、DCGM、QUAL、FIELDIAG等工具底层逻辑与实现机制
3.熟悉PCIe、RoCE、RDMA等高速互联协议,具备大规模GPU集群网络问题攻坚与工具优化经验
4.具备优秀的架构设计、需求拆解、技术攻坚能力,擅长复杂系统优化与问题闭环
5.具备国产自研GPU工具链、芯片回片验证、量产测试体系搭建经验者优先