职位描述
1. 负责 AI4S 相关核心模块在不同硬件平台上的移植和优化,包括但不限于 x86/ARM CPU、GPU、昇腾以及其他 NPU;
2. 用 C++ 或 Rust 实现高性能组件,重点优化延迟、吞吐和内存占用,保证在不同硬件上的稳定表现;
3. 分析系统和算法的性能瓶颈(例如 CPU/GPU 利用率、内存带宽、缓存命中率、锁竞争等),给出并落地优化方案;
4. 针对不同硬件架构特点,做有针对性的优化工作,比如向量化(SIMD)、多线程并发、流水线、异步/零拷贝等;
5. 搭建和维护性能测试与分析环境,整理性能数据,输出评估报告,为算法和业务团队提供技术建议;
6. 和算法、后端、产品等团队一起协作,从原型阶段参与,推动方案真正落地并持续迭代优化;
7. 参与线上性能相关问题的排查、监控和调优,完善相关工具和脚本。任职要求
1. 计算机相关专业研究生及以上学历,计算机体系结构、操作系统、并行计算基础扎实;
2. 熟练使用 C++ 或 Rust 做工程开发,有为提升性能而做架构和代码取舍的实际经验;
3. 至少熟悉一种并行/高性能编程模型或库,例如 CUDA、OpenCL、OpenMP、MPI,或常见 SIMD/向量化指令(如 AVX、NEON 等);
4. 有性能分析和调优经验,使用过 perf、VTune、Nsight、火焰图等工具,对缓存 miss、分支预测失败、内存带宽瓶颈、锁竞争等问题有实际排查经验;
5. 数据结构和算法基础好,有数值计算、图计算、高性能网络或深度学习算子/内核优化经验者优先;
6. 了解主流深度学习框架(如 PyTorch、TensorFlow、MindSpore 等)的基本执行流程,有算子二次开发或自定义 kernel 经验更佳;
7. 了解典型主流 NPU / GPU 架构,有相关移植、调优经验者优先;
8. 能使用 Python 编写脚本、搭环境、做简单原型验证即可,不要求把 Python 当主语言;
9. 对新硬件、新工具、新编程模型有兴趣,愿意自己钻研,能独立把复杂性能问题分析到位。