职位描述
1、负责具身智能VLA模型在端侧的推理系统的研发和模型加速算法研究。
2、设计并实现高性能自定义融合算子及算子性能调优,接入静态图模式等,榨干硬件理论性能。
3、深度参与模型的推理加速算法研究,如量化、蒸馏、稀疏、剪枝、模型小型化等。任职要求
1、熟悉GPU体系结构,熟练掌握CUDA/triton,熟练掌握C++和Python语言,熟悉主流深度学习框架(PyTorch/ONNX/TensorRT等),具备深度学习底层优化经验。
2、构建端到端的推理系统,针对不同硬件平台与型号进行推理部署适配与性能调优。
3、熟悉量化、剪枝、蒸馏、投机推理、步数蒸馏等前沿推理加速及模型小型化技术方案。
4、持续跟踪具身智能领域模型压缩的前沿技术,评估并引入适合公司业务的技术方案;
加分项:
(1)有TensorRT/torch compile实战经历、调研并实现过Kernel Fusion/Cuda Graph、编译优化、量化压缩、投机采样等优化技术者优先。