职位描述1. 参与到面向具身机器人本体亲和的轻量化、高性能推理框架模块化开发; 2. 基于GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 3. 开发模型解析、转换、性能剖析、可视化profiling工具; 4. 洞察算子融合、低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术并复现开发; 5. 调研VLA、世界模型、空间智能等最新算法架构趋势;任职要求1. 熟练掌握C/C++,具备汇编(ARM/x86)或CUDA/OpenCL优化经验; 2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp); 3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ 等)及相关工具链; 4. 熟悉常见算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax 等); 5. 具备端上 profiling 能力(perf、简单性能计数器、硬件事件、功耗测量);