Ivyea Jobs 10071 roles · 155 companies · 刚刚
星宸科技 · AI 芯片

资深HPC&云原生基础架构工程师(芯片研发)

厦门 社招 · 全职 研发 芯片 / 硬件

职位描述

1. 负责芯片研发 HPC 平台的规划、建设、升级、运维和性能优化。 2. 负责 HPC集群管理及调度策略优化,包括队列、资源、Fairshare、抢占、回填调度、项目配额和高可用管理。 3. 分析芯片研发计算环境中的性能瓶颈,覆盖计算、内存、存储、网络、调度和 EDA License 等维度。 4. 根据芯片研发项目和 Tape-out 周期进行容量规划、资源预测和架构扩展。 5. 负责传统基础架构及研发服务向 Kubernetes 云原生架构迁移。 6. 负责生产级 Kubernetes 集群的部署、升级、运维、监控和故障处理。 7. 建立公司级资源监控平台,对公司各集群持续优化和效率提升。 8. 与芯片研发、EDA、存储、网络及供应商协作,推动基础架构问题闭环和架构持续演进。

任职要求

1. 具备8年以上的芯片研发、EDA 或半导体行业 HPC 平台建设和运维经验。 2. 精通至少一种主流的HPC调度器,能够独立完成集群部署、升级、调度优化、性能分析和故障处理。 3. 具备生产级 Kubernetes 运维及传统架构向云原生架构迁移经验。 4. 熟悉 Linux 系统、NFS/并行文件系统、高性能网络及性能调优。 5. 能够从计算、存储、网络、调度和 License 等维度综合分析 HPC 性能瓶颈。 6. 熟悉 Python、Shell、Ansible 等自动化技术。 7. 具备大型集群容量规划、架构设计和跨团队项目推动能力。 8. 熟悉主流 EDA 工具、FlexLM、GPFS、Lustre、Slurm 或 GPU 集群者优先。 三、加分项 1. 具备 Cadence、Synopsys、Siemens EDA 等工具运行环境支持经验。 2. 熟悉 FlexNet/FlexLM、RLM 等许可证管理系统。 3. 熟悉 IBM LSF License Scheduler。 4. 熟悉 Slurm、PBS Pro、OpenPBS、SGE 等其他 HPC 调度平台。 5. 具备 GPFS/Spectrum Scale、Lustre、BeeGFS、Ceph、JuiceFS 等文件系统经验。 6. 具备 GPU 集群、CUDA、NVIDIA GPU Operator 或 AI/HPC 融合平台经验。 7. 具备 Kubernetes Operator、Helm、Argo CD、GitOps 或 Jenkins CI/CD 经验。 8. 具备 Prometheus、Grafana、ELK、Datadog 等监控平台建设经验。 9. 具备大规模集群容量规划、成本分析或资源计费系统建设经验。 10. 具备英文技术文档阅读、原厂支持沟通及跨团队项目推动能力。
星宸科技去官方页面投递 →