职位描述
1、 负责研究多模态大模型、生成模型、VLA 模型的推理加速技术;
2、 负责大模型在垂直领域的微调工作;
3、 负责大模型在 NPU 芯片上的量化、编译和适配工作。任职要求
1、熟悉 qwen、deepseek、llama 等主流开源 LLM 的模型架构;
2、熟悉 qwen-vl、minicpm-o 等音视频多模态大模型的模型架构,熟悉模态融合的基本技术和原理;
3、有大模型的量化训练技术经验者优先,熟悉 W4A16 W8A8 W4A16KV4 等不同的量化格式;熟练掌握大模型量化精度调优关键技术,例如 GPTQ、AWQ、smoothquant 等;
4、 有大模型后训练技术经验者优先,熟练掌握 Lora、Prompt Tuning 等常见 SFT 训练技术,熟练掌握 PPO、DPO 等常见 RL 训练技术;
5、有大模型加速技术经验值优先,熟练掌握 Speculative Decoding、大模型蒸馏、KVCache 裁剪、Diffusion Caching 等关键技术;
6、在相关领域发表过高质量论文或者在知名竞赛中取得优异成绩者优先。