职位描述
负责具身智能大模型(Embodied Foundation Models)的核心研发工作。我们致力于打破单一形态机器人的限制,通过 VLM/VLA 预训练技术,构建能够跨硬件平台(Cross-embodiment)泛化的通用机器人大脑,实现从感知到动作的端到端理解与执行。
岗位职责
1、设计高性能的 VLM/VLA 模型架构,探索不同模态(图像、点云、文本、动作序列)在 Transformer 架构下的融合方案,提升模型的表达能力与推理效率。
2、负责 VLM 和 VLA 的预训练算法研发,通过在大规模多模态数据集上进行自监督或监督预训练,赋予模型强大的物理世界常识与逻辑推理能力。
3、针对具身场景优化模型的指令遵循能力与复杂任务分解能力,并通过RL等手段提升模型在长程任务(Long-horizon tasks)中的成功率。
4、基于海量的human-centric数据,探索具身领域的Scaling Law任职要求
1、计算机、机器人、人工智能等相关专业硕士/博士学位。
2、对大模型(LLM/VLM)有深入的理解,具备大模型(LLM/VLM)预训练/后训练经验。
3、熟悉主流 VLA 模型,如 Pi 、RT-2、OpenVLA、RoboCat 或 Octo 等。
4、熟练使用PyTorch,熟悉主流训练框架,对大规模分布式训练有经验者优先。
5、在CVPR,NeurIPS,RSS, ICRA, IROS等顶会发表过论文的优先。