Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

低精度量化/模型压缩算法工程师

上海 校招 · 正式 推理 / 部署优化

职位描述

1. 负责大模型、多模态模型、具身智能模型的低精度量化、模型压缩、蒸馏、剪枝、稀疏化算法研发与落地。 2. 研究并实现 INT4/NVFP4/INT8/FP8 等量化方案:GPTQ、AWQ、SmoothQuant、GPTQ-For-LLaMA、bitsandbytes 等。 3. 负责模型压缩算法在训练、推理、端边、云端不同场景的精度保持与性能收益。 4. 与推理引擎、算子团队协同,将量化 / 压缩算法对接 TensorRT-LLM、vLLM、ONNX Runtime、NPU/GPU等硬件与推理栈。 5. 构建自动化量化工具链、精度评估体系、压缩后模型稳定性验证流程。 6. 针对机器人端侧(Jetson//Thor/Orin/NPU)等资源受限场景,实现极小内存、极低功耗下的模型部署。 7. 输出算法方案、实验报告、性能 / 精度对比,支撑业务规模化降本增效。

任职要求

1. 硕士及以上,计算机/人工智能/电子/数学相关,2年以上模型量化或压缩经验。 2. 精通深度学习模型结构:Transformer、Attention、FFN、Norm、激活函数。 3. 熟悉主流量化算法:PTQ、QAT、GPTQ、AWQ、SmoothQuant、LLM.int8 ()、FP8 量化。 4. 熟悉模型压缩技术:剪枝、知识蒸馏、动态稀疏、低秩分解(LoRA/QLoRA)。 5. 熟练使用 PyTorch,具备模型训练、微调、精度调试能力。 6. 了解 GPU/NPU 底层特性,熟悉量化算子、Kernel 对齐、推理引擎流程优先。 7. 有LLM/VLM/具身智能模型量化落地经验者优先。 8. 具备良好的算法推导、实验设计、问题定位能力。