Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

模型部署优化实习生

上海 实习 具身智能 / 机器人

职位描述

1. 参与 PC、端侧 AI 应用原型开发与验证,覆盖数据采集、标注、预处理、模型选型适配、分布式训练加速、训练策略调优、推理链路性能调优全流程; 2. 负责 PC 平台、Jetson 系列开发板(Nano、Orin、Thor 等)的模型训练、工程部署、训练与推理性能优化; 3. 开展大模型 / 视觉模型分布式训练实践,基于 DDP、FSDP、DeepSpeed、ZeRO 优化策略完成多卡训练提速、显存优化;运用混合精度、梯度检查点、梯度累积等技术降低显存开销,支持 LoRA/QLoRA 轻量化微调; 4. 开展训练链路瓶颈分析,利用 PyTorch Profiler、Nsight 等工具定位计算、通信、数据 IO 瓶颈,优化数据加载管线,提升训练吞吐与稳定性; 5. 落地模型压缩方案:量化、剪枝、知识蒸馏;依托 ONNX、TensorRT、TRT-LLM 完成模型转换、编译与端侧推理加速; 6. 参与 VLA 视觉语言动作模型、大语言模型部署落地,使用 CUDA、vLLM、llama.cpp 开展推理瓶颈定位与性能调优; 7. 持续优化训练收敛效果、推理延迟、显存占用,开展对比实验与方案验证; 8. 撰写技术文档:部署手册、性能测试报告、训练 / 推理优化方案、技术总结; 9. 定位解决训练、推理阶段各类软硬件问题,配合团队推进项目落地,完成其他 AI 模型开发相关任务。

任职要求

1. 在读本科及以上学历,计算机科学与技术、人工智能、电子信息、自动化等相关专业; 2. 扎实 Python 基础,具备 C/C++ 开发能力,熟练使用 Ubuntu Linux 开发环境; 3. 掌握深度学习基础理论,熟练使用 PyTorch 框架; 4. 了解分布式训练相关技术,包括 DDP、FSDP、DeepSpeed、ZeRO 优化、混合精度训练、梯度检查点、LoRA/QLoRA 微调等;能够使用 Profiler、Nsight 等工具剖析训练性能瓶颈,了解 NCCL 通信优化、多机多卡训练者优先; 5. 了解模型压缩技术:量化、剪枝、知识蒸馏;熟悉 ONNX、TensorRT 模型转换与推理优化工具; 6. 拥有 Jetson 端侧模型部署、性能调优实战经验优先; 7. 了解 VLA 视觉语言动作模型,掌握基础 CUDA 编程,接触过 vLLM、TRT-LLM、llama.cpp 大模型推理框架优先; 8. 具备较强问题排查、自主学习能力,良好的沟通与团队协作意识,工作主动负责; 9. 每周至少实习 4 天,可连续实习 3 个月及以上优先。 10. 以上提到的技术会一部分即可。