职位描述
1、参与部分基座模型构建:参与构建具身智能领域专用的多模态大模型(VLM)基座,持续优化数据处理策略、预训练、高效微调;(LoRA/QLoRA等)、RLHF(基于人类反馈的强化学习)等全链路算法。
2、前沿技术探索:紧密跟踪并复现多模态、具身智能领域的最新算法(如RT-2、PaLM-E、Mobile ALOHA等方向的核心思想),推动基座模型在视觉-语言-动作(VLA)方向的能力演进。
3、场景落地应用:将多模态大模型能力迁移至真实机器人系统,解决物体识别、场景理解、指令跟随、抓取与操作决策等关键任务,推动算法从仿真到真机部署的闭环落地。
岗位要求:
1、计算机视觉、多模态大模型等相关领域的硕士及以上学历;
2、熟悉多模态领域算法,熟悉Llava、QwenVL等基础VLM模型:
3、熟悉NLP领域算法,熟悉Bert、GPT、Llama等基础LLM模型
4、熟悉CV领域算法,熟悉ViT、DINO、SAM、GAN.Diffusion等基础CV模型;
5、有实际机器人项目经验者优先。