职位描述
负责将算法及软件部署到具身机器人端侧环境。
负责模型的量化与精度评测,设计模型在端侧的编译与部署方案,保证模型在有限资源下的高效推理。
针对不同芯片的特性及加速工具,针对性的优化算子,加速推理过程。
负责硬件加速优化,利用 NPU 加速程序运行,减少不必要的 CPU 占用。
分析和解决算法部署和 GPU 优化过程中的问题,排查算法的性能瓶颈,协助算法团队进行优化。
通过算子融合、模型量化、动态批处理、图优化等技术优化 NPU 推理性能,设计多线程/分布式调度策略,提升资源利用率。任职要求
熟悉 C++、CUDA 编程。
熟悉常用的量化算法,使用或开发过至少一种量化工具(如TensorRT Model Optimizer),有实际的 INT8/FP8/nvfp4 量化落地经验,能够解决量化过程中遇到的各种问题(如精度下降)。
熟悉模型编译部署工具链,如 TensorRT/TVM.,有二次定制开发经验优先。
熟悉至少一种推理框架(TensorRT Edge-LLM/TensorRT-LLM/vLLM 等)和常用的推理加速技术。
有算子优化经验,熟悉 cutlass 者优先。
了解主流算法架构,如 Transform,了解端到端、VLA 等技术者优先。