职位描述
聚焦下一代具身智能模型与技术范式,重点推进 Omnimodal World Models(全模态世界模型) 方向。我们希望构建能够统一理解和生成语言、视觉、视频、动作、触觉、本体感知等多模态信息的机器人基础模型,使机器人具备更强的物理世界理解、交互预测、任务规划和泛化执行能力。
【核心职责】
1、负责全模态世界模型的架构设计、训练方法与算法迭代,探索语言、视觉、视频、动作、触觉等模态的统一建模。
2、推进世界模型在物理场景理解、未来状态预测、动作生成、交互结果模拟、机器人策略学习等方向的技术攻关。
3、面向从双臂系统、轮式人形到全尺寸人形机器人等多种机器人形态,并进一步探索灵巧手等高自由度系统,构建统一的动作表示与数据体系。
4、参与机器人多模态数据的采集、清洗、训练、评测与闭环迭代,推动模型在真实机器人任务中的验证与落地。
5、持续跟踪多模态大模型、视频生成、具身智能、world model、robot learning 等前沿方向,形成技术预研、论文和核心技术壁垒。任职要求
【任职要求】
1、计算机、人工智能、机器人、自动化等相关专业硕士及以上学历,博士优先。
2、具备扎实的深度学习和大模型基础,熟练掌握 Python / PyTorch,具备较强的论文复现、模型训练和工程实现能力。
3、熟悉多模态大模型、视频生成、世界模型、VLA、模仿学习、强化学习、机器人学习中的一个或多个方向。
4、理解真实机器人系统中的感知、动作、时序决策和跨场景泛化问题,有机器人相关经验优先。
5、具备优秀的英文文献阅读能力、技术判断力和自驱力,愿意参与高不确定性、高挑战度的前沿技术探索。
【加分项】
1、有 CVPR / ICCV / ECCV / ICRA / IROS / RSS / CoRL / ICML / NeurIPS / ICLR 等顶会论文经验。
2、参与过多模态大模型、视频生成模型、VLA、world model、robot foundation model的研发。
3、有真实机器人、仿真平台、灵巧手、人形机器人、触觉传感器或机器人数据采集经验。
4、有大规模模型训练、多机多卡训练、数据工程、推理部署或开源项目经验。
我们希望你不仅关注当下模型效果,也愿意一起思考:下一代机器人基础模型应该如何理解物理世界、预测交互后果,并在不同机器人形态之间实现可泛化的智能。