职位描述
1.负责大模型量化、剪枝、蒸馏等压缩方案的工程实现与性能优化;
2.参与模型压缩训练,优化训练和推理成本;
3.负责压缩模型的框架适配、性能测试与部署落地。任职要求
1.熟悉模型量化、剪枝、知识蒸馏等技术原理及工程实践;
2.熟悉 Megatron、TorchTitan、FSDP等至少一种大模型训练框架;
3.熟悉 CUDA/GPU性能分析与优化,具备良好的Python/C++开发能力;
4.了解 vLLM、SGLang、TensorRT-LLM等主流大模型推理框架。
加分项
1.有大模型压缩、低比特量化、分布式训练或推理加速生产落地经验。