职位描述
VLA 端到端模型研发
负责人形双足机器人 VLA 视觉 - 语言 - 动作模型完整研发,打通 RGB-D 视觉感知、自然语言理解、全身 / 灵巧手动作生成全链路;基于 RT-2、OpenVLA、RDT 等开源基座做定制化微调、架构改进,实现自然语言指令直接输出双足全身动作序列。
模仿学习 + 强化学习动作策略优化
落地行为克隆 BC、Diffusion Policy、流匹配 Flow Matching 动作生成方案;结合 PPO/SAC 强化学习,解决双足行走不稳、操作抖动、多步骤长任务失败问题,提升室内抓取、搬运、人机交互任务成功率。
多模态数据集与数据闭环搭建
搭建人形机器人专属 VLA 数据 Pipeline:遥操作真人演示采集、Isaac Sim 仿真数据生成、多模态数据清洗 / 扩增 / 对齐;构建视觉图像、文本指令、关节动作、力触觉多模态标注数据集,形成「采集 - 训练 - 真机测试 - 数据迭代」闭环。
双足机器人真机工程落地
对接运动控制、感知、整机硬件团队,将 VLA 模型输出动作映射至双足机器人运动学 / 动力学约束;基于 ROS2 开发推理部署链路,优化 GPU / 嵌入式端推理速度、显存占用,满足机器人实时控制延迟要求。
仿真 + 真机联合验证
基于仿真环境快速迭代算法,完成 real2sim2real 迁移;设计标准化评测指标,量化 VLA 模型泛化能力、指令理解准确率、动作稳定性、任务完成效率;定位真机落地误差、感知噪声、动作漂移问题并优化。
前沿技术调研与技术沉淀
跟踪具身智能、世界模型、多模态大模型最新论文;输出技术方案、专利、内部分享;参与团队 VLA 技术路线规划,探索多模态融合(力觉、触觉、IMU)提升机器人认知能力。任职要求
硬性要求
硕士及以上,计算机、人工智能、机器人工程、自动化、控制科学、CV 相关专业;有具身 / VLA 顶会论文(ICRA/CoRL/ECCV/NeurIPS)优先,博士加分。
2 年及以上多模态大模型、机器人模仿学习落地经验,有人形 / 双足机器人 VLA、机械臂具身算法完整项目经验。
熟练 Python/PyTorch,精通 Transformer、ViT、CLIP 等视觉语言基础架构;熟练分布式训练(DeepSpeed/FSDP)、LoRA/QLoRA 微调技术。
掌握 ROS/ROS2,熟悉机器人运动学、关节动作序列数据处理;了解 Isaac Sim、Webots 机器人仿真工具。
加分项
双足人形机器人真机调试、整机联调经验,熟悉双足平衡控制、全身运动规划。
有灵巧手抓取、多步骤长时序任务(做家务、工具操作)VLA 落地案例。
熟悉 C++/CUDA 算子优化,可自研轻量化动作生成网络。
拥有机器人、多模态大模型相关发明专利。