职位描述
岗位职责:
1、负责 VLAS(视觉–语言–动作系统)核心算法的研发与优化,包括视觉理解、语言指令解析、任务规划、动作生成等模块的整体系统设计;
2、负责机器人在复杂环境下的多模态任务执行能力建设,实现“看得懂、听得懂、做得对”的具身智能行为链路;
3、基于大型语言模型(LLM)、多模态模型(VLM/VLLM)与动作策略模型(Policy/Skill Learning),构建端到端或分阶段的 VLAS 系统架构;
4、建设并优化机器人从感知、语义理解到行为规划的中间表征体系,如视觉语义编码、指令语义分解、任务图(Task Graph)、行为树(Behavior Tree)等;
5、推动机器人在抓取、装配、导航、操作等任务中的策略生成与迁移,优化模拟到现实(Sim2Real)性能;
6、推动多模态数据的采集、清洗、对齐与标注,构建适用于机器人任务的训练集与评估体系;
7、负责算法实验、性能优化与模型部署,提升实时性、稳定性、泛化能力;
8、输出技术文档、研究报告与专利,参与跨团队协作,推动产品落地。任职要求
任职要求:
1、硕士及以上学历,计算机视觉、自然语言处理、机器人、机器学习、控制或相关方向;
2、在以下至少一个方向具备深入经验:
多模态大模型(VLM/VL-LLM)、视觉语言理解
机器人任务规划 / 行为生成(Task Planning, High-level Policy)
动作生成、技能学习、模仿学习、RL或Diffusion Policy
3、熟练掌握 Python、PyTorch,有大型模型训练、部署或系统优化经验;
4、具备数据链路建设经验,如视觉数据、操作序列、轨迹数据、多模态对齐等;
5、对具身智能、VLA/VLAS、LLM-Agent、操作机器人具备深刻理解;
6、具备优秀的系统思维、跨团队沟通能力及技术推动能力;
7、有机器人真实场景落地经验(双臂、移动机器人、人形机器人等)者优先;
8、在顶会(CVPR/ICCV/NeurIPS/ICLR/RSS/CoRL)有论文或开源成果者加分。