职位描述
负责GPGPU/AI加速器芯片的微架构设计与架构探索,参与新一代GPU架构的规划与定义,输出架构设计规格文档(architecture spec)和微架构提案(microarch proposal)。
建立性能模型(performance model),开展大规模架构探索与瓶颈分析,评估不同微架构方案在AI训练/推理负载下的性能、功耗与面积权衡,为硬件设计决策提供量化依据。
深入研究并行计算体系架构,涵盖流水线、Cache层次、缓存一致性协议、并行计算模型、存储层次等核心领域,推动架构创新。
与RTL设计团队紧密配合,将架构方案落地为可实现的微架构设计,参与设计评审,确保架构意图在RTL中得到准确实现。
跟踪NVIDIA SM、AMD GCN/CDNA/RDNA等主流GPU架构演进,分析竞品微架构特性与技术趋势,指导自研架构的差异化设计。
与编译器、驱动、算子库团队协同,分析软硬件接口瓶颈,推动架构层面的优化以支撑高性能计算与AI负载。任职要求
计算机 / 电子 / 微电子等相关专业硕士及以上,或同等经验
5 年以上 GPU / GPGPU / 加速器架构或微架构设计经验
扎实的计算机体系结构基础:流水线、Cache、一致性、并行计算、存储层次
熟悉至少一类 GPU 架构体系(NVIDIA SM / AMD GCN-CDNA-RDNA / 自研 GPGPU)
具备性能建模、瓶颈分析与架构权衡能力;能独立输出 architecture spec / microarch proposal
熟悉systemc/systemverilog/c++,python 等编程语言
加分
深入理解 Warp 调度、寄存器文件 Bank Conflict、Operand Collector、Shared Memory / LDSM、Async Copy / TMA、Tensor Core 等微架构细节
有 ISA 设计、PTX/SASS 级分析、或 CUDA/HIP/OpenCL 编程与性能调优经验
熟悉 AI 训练/推理算子(GEMM、Attention、量化、稀疏)对硬件的需求
有从架构到 RTL 落地、Tape-out 或量产芯片经验
有相关专利、顶会论文或开源贡献