职位描述
岗位职责:
1、负责多模态理解与生成方向的核心算法设计、研发与优化,包括视觉–语言模型、动作生成模型、语义理解模型等;
2、主导从文本、视觉、动作、语音等多模态数据的建模与融合策略设计,提升机器人在决策、任务执行和交互中的智能水平;
3、构建并优化大规模多模态模型(如 VLM、Diffusion、多模态大模型 MLLM),提升生成质量、推理速度与真实场景鲁棒性;
4、参与具身智能相关算法研发,如任务规划、行为生成、动作预测、模仿学习等,为机器人提供端到端多模态能力;
5、搭建算法训练与评测流程,负责数据管线构建、标注规范制定、模型调优与效果分析;
6、与软件、感知、运动控制、产品团队合作,推动模型在机器人系统上的部署、加速与持续优化;
7、跟踪前沿技术,包括 Transformer、Diffusion、RLHF、LLM-Agent、多模态基础模型等方向,推动算法迭代与创新落地。任职要求
任职要求:
1、计算机、人工智能、自动化、电子工程等相关专业硕士及以上学历;
2、深入理解深度学习、多模态学习、Transformer、Diffusion Model 等技术体系;
3、熟练使用 PyTorch/JAX 等框架,具备大规模模型训练、分布式训练经验;
4、在多模态理解(VQA、图像/视频描述、视觉定位)或多模态生成(图像生成、动作生成、文本生成)方面有成熟经验;
5、有大模型训练优化、推理部署、模型压缩、量化加速等经验者优先;
6、熟悉 Embodied AI、模仿学习、强化学习、机器人认知建模者优先;
7、在顶会(CVPR/ICCV/NeurIPS/ICLR/ACL)发表论文或主导重要项目者优先;
8、具备良好工程落地能力、跨团队沟通习惯与自驱力。