职位描述负责LLM中定制化算子需求的性能评估和实现,完成端侧LLM推理部署 负责可编程AI加速单元底层算子库的设计、开发和优化,并在AI编译器及端侧适配接入 跟踪LLM领域新技术,根据算法发展趋势和硬件特性持续丰富算子库、提升算子性能 负责高性能算子的开发与优化,包括CPU、DSP、RVV等异构硬件牛,优化算子的性能,确保在不同硬件平台上的 高效计算,包括但不限于FP32、FP16、FP8、INT16、INT8、INIT4等数据类型任职要求基本要求 有常见LLM推理部署框架使用和开发经验,包括并不限于llama.cpp/TensorRT-LLM/VLLM/VTGI等 熟悉一种以上可编程AI加速单元的算子开发,包括并不限于DSP/PRVV/GPU/NPU等 具备良好的工程实现能力,熟悉Python与C/C++编程开发 了解AI编译原理、模型量化原理 主动学习、良好的沟通能力和团队合作精神 加分项 熟悉主流LLM算法模型原理,有LLM应用落地开发经验 有Cadence DSP或RISC-V向量指令集开发经验,了解相关硬件特性和指令 从事过AI软件相关开发,包括AI编译器、AI算子库、AI推理/训练框架开发等 熟悉编译原理,包括并不限于程序分析、编译后端优化技术等 熟悉计算机算法与设计模式,有过ACM或其他编程竞赛经历