职位描述我们在做什么 我们专注于具身大模型的后训练方法体系建设与前沿技术探索,致力于通过数据策略、模型架构适配、高效微调与推理优化等技术手段,持续提升基础模型在不同本体/任务的执行效果与泛化能力。我们的目标是构建一套标准化、跨本体可复用的后训练方法体系,为物流、制造、家庭服务等商业化场景提供高质量的模型落地能力。 我们拥有超大规模的真机操作数据、完善的多场景评测体系、多本体硬件资源与专业数采团队,以及从数据采集到模型训练再到真机验证的端到端闭环能力。 职位描述 1.研究和构建具身大模型的后训练方法体系,探索数据策略与混合训练方法,持续提升模型在多场景、多任务下的执行效果与泛化能力; 2.研究不同模型架构在后训练中的适配性与应用潜力,明确各架构对不同类型操作任务的适用边界; 3.探索高效微调与快速迁移技术,降低对海量新数据的依赖,缩短模型向新环境、新任务迁移的后训练周期; 4.研究操作记忆机制,提升模型对操作过程中历史观测、动作轨迹与环境状态变化的记忆能力,解决操作过程中的模型困惑与重复执行问题; 5.研究推理侧优化技术,包括丝滑推理、推理加速与实时反馈、推理时计算等方向,提升模型动作输出的流畅度与实时性; 6.负责后训练实验设计与大规模模型训练,持续迭代模型能力并通过真机实验验证效果,将研究成果推进到商业化项目落地; 7.跟踪具身智能、模仿学习、强化学习与多模态大模型等前沿方向,推动算法创新与方法体系演进。任职要求职位要求 1.计算机科学、人工智能、机器人学等相关专业背景,硕士及以上学历; 2.对大语言模型/多模态大模型有深入理解,熟悉主流VLA模型架构的原理与训练流程; 3.熟练使用PyTorch,具备扎实的工程能力和独立解决问题的能力; 4.具备模型后训练相关经验,对训练/数据策略有深入理解; 5.具备强执行力,能快速深入新领域并把事情做出来; 6.有技术热情,关注前沿进展,具备良好的学术视野。 加分项 •有具身大模型(VLA / World Action Model)的后训练或微调经验,熟悉OpenVLA、π系列、WALL-OSS、Dream-Zero等模型,了解Diffusion Policy、Flow Matching等动作生成范式; •有机器人真机部署与调试经验,有完整的训练→真机验证闭环经历; •有大规模分布式训练管线的搭建或优化经验; •有多任务学习、迁移学习、元学习等方向的研究或项目经验; •熟悉模仿学习(IL)、强化学习(RL)、RLHF/DPO/CFG等后训练与对齐技术; •有推理优化相关经验(异步推理、RTC、Test Time Compute等); •顶级会议(ICRA、CoRL、RSS、CVPR、NeurIPS等)论文发表或相关竞赛获奖。