Ivyea Jobs 11257 roles · 203 companies · 刚刚
曦望 · AI 芯片

GPU工具链开发工程师

北京 / 上海 / 成都 / 杭州 / 深圳 社招 · 全职 训练系统 / 集群 工程开发

职位描述

1.参与GPU工具链整体架构设计与技术方案选型,负责全工具矩阵的迭代升级 2.负责核心工具难点攻坚,解决多卡集群监控一致性、大规模长稳压测准确性、静默故障精准捕获、复杂网络异常定位等核心技术问题,提升GPU芯片可靠性与运维效率 3.参与自动化运维工具开发,统一硬件错误采集、解析、告警、复盘闭环,建立硬件故障知识库与自动化诊断规则 4.参与网络管理工具体系开发,构建覆盖拓扑探测、节点管理、链路校验、带宽时延基准测试、异常溯源、故障分级的全链路网络诊断能力,支撑大规模分布式训练集群稳定性保障 5.对接量产、运维、客户交付场景,输出标准化工具方案与自动化流程,支撑量产测试、线上故障自愈、客户问题快速定位 6.主导技术调研与预研,跟进业界GPU工具生态新技术,持续优化工具性能、扩展性与兼容性,搭建可复用的工具组件与底层抽象框架

任职要求

1.本科及以上学历,3年及以上Linux C/C++底层系统、GPU工具链研发经验,有成熟的工具架构落地案例 2.深刻理解NVML、SMI、DCGM、QUAL、FIELDIAG等工具底层逻辑与实现机制 3.熟悉PCIe、RoCE、RDMA等高速互联协议,具备大规模GPU集群网络问题攻坚与工具优化经验 4.具备优秀的架构设计、需求拆解、技术攻坚能力,擅长复杂系统优化与问题闭环 5.具备国产自研GPU工具链、芯片回片验证、量产测试体系搭建经验者优先
曦望去官方页面投递 →