有高性能计算(HPC)或 AI 优化加速相关工作经验;
精通 CUDA 生态,熟悉编译流程,深入理解 GPU 架构、内存模型及并行计算原理,具备扎实的 CUDA 编程功底,能独立编写、调试并优化 CUDA Kernel;
熟练使用 Triton、CUTLASS 等工具,有基于这些工具进行算子开发、模型加速的实战经验;
理解 PyTorch/TensorFlow 等 AI 框架及常见 AI 模型(VLA, LLM等);
熟悉Nsys, NCU 等性能分析工具,能精准定位并解决 GPU 计算中的性能瓶颈;
熟悉国产芯片的运行流程及编译链路,具备相关算子开发实战经验。