具身智能算法研究科学家/工程师(Loco-Manipulation / VLA / RL)
职位描述
工作职责
- 设计并实现 loco-manipulation 的 统一策略架构:层级策略/技能库/世界模型/规划+学习融合等
- 构建训练范式:行为克隆、离线 RL、在线 RL、DAgger/人类教练、RLAIF/RLHF 类信号的组合
- 打造评测与诊断体系:成功率只是起点,要能定位失败模式、数据缺口与可改进方向
- 与系统团队共建数据闭环:定义“需要采什么数据才能让模型更强”,并驱动数据采集与质检标准
- 输出高质量研究与工程成果:论文/开源/内部技术路线图/可复用训练代码与实验基线任职要求
任职要求
- 顶会/顶刊(CoRL/ICRA/IROS/RSS/NeurIPS/ICML/ICLR 等)具身/机器人/学习方向 一作或核心作者;
或
- 具备被广泛使用的高质量开源成果(主要作者/maintainer),有外部复现或社区影响力证据;
或
- 在公认的一线团队(如Physical Intelligence)/顶尖高校实验室/产品中交付过关键模块并产生明确业务或指标影响。
加分项(不要求全具备)
- 在 loco-manipulation、双臂操作、腿足+手臂协同、导航+操作、长程任务等方向有代表作
- 有 VLA / diffusion policy / transformer policy / world model / MCTS+policy 等经验
- 熟悉 MuJoCo / Isaac Sim / Isaac Lab / RLBench / ManiSkill / Habitat 等仿真与基准
- 做过大规模数据训练与训练稳定性问题:分布漂移、行动空间建模、reward hacking、sim2real 等
- 有顶会论文/开源项目/高影响力工程落地经历
我们能提供
- 真实可规模化的数据与场景:能把想法迅速验证在高并行采集与真实任务上
- 端到端闭环:数据→训练→评测→回归→再采集,不做“只发 paper 不落地”的研究孤岛
- 有挑战性的主问题与足够的算力/工程支持(与系统/硬件/数据团队紧密协作)
- 结果导向且鼓励原创:你提出的架构可以成为公司核心技术路线