职位描述
岗位职责
1、负责视觉语言行动模型(VLA)和视觉语言模型(VLM)的研发,结合视觉、语言和动作模态,实现从多模态输入到机器人的动作输出。
2、设计和优化模型架构,完成模型的数据处理、训练以及真机部署工作,确保模型的高效性和准确性。
3、跟踪前沿 VLA\VLM 技术,提炼有价值的内容到现有技术方案。
任职资格
1. 计算机科学、电子工程、自动化、机器人学或相关领域的硕士及以上,27届优先;
2. 熟悉Transformer架构及多模态建模基本原理,对主流VLM/VLA模型(如CLIP、LLaVA、RT-2、OpenVLA等)有实际使用或复现经验;
3. 掌握Diffusion Model或Action Chunking等生成式/决策式模型的基本原理与代码实现(如DDPM、Classifier-Free Guidance等),有相关项目经验者优先;
4. 熟练使用PyTorch,熟悉分布式训练(DeepSpeed/Megatron)或模型部署(TensorRT/ONNX)者优先;
5. 具备模仿学习(IL)或强化学习(RL)实际项目经验,熟悉BC、ACT、CQL、SAC等算法,能独立完成策略训练、调参与问题诊断;
6. 代码风格良好,熟悉Linux开发环境,有良好的实验记录与文档习惯。