职位描述
岗位职责
1.负责自研GPGPU芯片配套工具链研发与迭代,包含芯片状态监测、显存/内存分析、内核调试、性能剖析、瓶颈定位等底层调试与性能分析工具开发,支撑GPU芯片软硬件适配、算力业务落地与性能优化;
2.负责GPGPU芯片RAS(可靠性、可用性、可维护性)功能开发,涵盖芯片故障检测、错误上报、异常溯源、容错处理、日志审计、健康度监控等模块研发,搭建芯片级高可靠运维能力,支撑大规模算力集群稳定运行;
3.负责超节点算力集群管理软件研发,面向大规模GPU超算节点,开发节点资源监控、设备资产管理、集群状态调度、异常自愈、算力运维、多节点协同管理等核心功能,优化超节点集群运维效率与资源利用率;
4.深度适配Linux系统环境,参与GPU驱动、PCIE/NVLink互联链路的调试与适配,解决芯片、单机、集群层级的软硬件协同问题;
5.跟进AI工具链前沿技术,探索Skill智能插件、MCP协议工具链在GPGPU调试、运维、性能调优场景的落地,开发智能化GPU辅助工具,提升工具链自动化、智能化能力;
6.负责工具链需求调研、技术方案设计、代码开发、单元测试、文档沉淀,配合软硬件团队完成芯片迭代、客户交付与问题闭环;任职要求
1.本科及以上学历,计算机、电子信息、微电子、软件工程等相关专业,1-3年GPU/CPU底层工具、系统软件、集群运维软件开发经验;
2.熟练掌握 C/C++ 编程语言,具备扎实的底层软件开发、内存管理、多线程开发能力;
3.熟悉 CPU/GPU 体系结构、存储架构、运算逻辑,掌握异构算力硬件底层原理;
4.深入理解操作系统原理(Linux优先),熟悉进程、内存、中断、调度等核心机制,具备底层系统软件开发思维;
5.掌握CPU/GPU性能分析、调试原理,熟悉性能瓶颈定位、异常调试、日志分析的完整流程;
6.了解算力集群、超节点运维架构,具备大规模算力设备管理、高可用系统设计认知;
技能要求
基础必备技能
1.扎实的 C/C++ 编程功底,能够独立完成底层工具、系统模块的设计与开发;
2.熟练使用Linux开发环境,熟悉Shell、编译链接、调试工具(GDB、perf等);
3.具备优秀的技术调研、问题拆解、自主学习能力,能够快速适配新硬件、新场景需求;
优先加分技能(核心岗位适配项)
1.具备 Linux 内核/驱动开发、GPU 驱动适配、虚拟化开发经验者优先;
2.有 CPU/GPU 性能分析工具、调试工具、监控运维工具独立开发经验者优先;
3.熟悉 PCIE、NVLink 互联协议及软硬件调试,了解GPU高速互联链路运维机制者优先;
4.具备RAS可靠性功能开发经验,熟悉芯片故障检测、错误处理、日志溯源、高可用设计经验者优先;
5.有超节点/算力集群管理软件、分布式运维、集群监控系统开发经验,熟悉大规模GPU集群调度、资产管理、异常自愈机制者优先;
6.AI工具链智能化开发加分:熟悉 AI Skill 智能插件开发、MCP协议工具链适配,有智能化调试、自动化运维、AI辅助性能调优工具开发经验者优先;
7.熟悉国产GPGPU芯片、算力中心运维体系者优先。
立即投递