职位描述
项目背景:构建下一代通用具身智能系统。面向灵巧手和机械臂,打造具备高度泛化性的"通用大小脑"架构,以及用户生态友好的低门槛开发平台。团队正在快速扩充中,以助力数万台交付为目标。
VLA 通用操作大模型架构设计与训练:负责 VLA 主干架构的设计与迭代,实现从多模态观测到动作的端到端映射,追求跨任务、跨本体、跨场景的强泛化能力。
WAM(World-Action Model)开发与应用:构建面向操作场景的世界—动作
联合模型,用于数据增广、想象式 Rollout、规划与反事实推理。
多模态表征与动作 Tokenization:设计视觉—语言—动作联合表征方案,研究 Action Tokenization、连续 vs 离散动作空间、流匹配/扩散式动作生成等关键设计选择。
大规模分布式训练与数据配比:负责 ≥7B 参数模型的分布式预训练/后训练,涵盖数据配比、课程学习、MoE、灾难性遗忘抑制、对齐微调(LoRA/DPO/RLHF)等,确保训练效率与模型质量。
真机部署与推理优化:完成端到端模型从训练到真机部署的全链路打通,包括推理加速(TensorRT、vLLM)、KV-Cache 复用、模型并行、Action Chunking 在线拼接、闭环延迟优化等。任职要求
大模型基础:深刻理解 Transformer 及其变体,熟悉 LLM/VLM 的预训练、SFT、LoRA 等主流范式。
VLA 与 WAM 架构理解:系统掌握主流 VLA 架构谱系与 WAM 世界模型
范式的设计思路与技术细节,理解各架构在动作生成、世界建模、跨本体泛
化上的优势与局限。
分布式训练:有 >1B 模型的分布式训练经验,对混合精度、激活重计算、张量/ 流水/专家并行有深入理解。
数据与仿真:熟悉主流物理仿真引擎;具备大规模多模态数据的清洗、配比与质量评估经验。
编程与工程:精通 Python 与 PyTorch,具备 C++ 工程能力;熟悉 CUDA/Triton 算子优化或 TensorRT 推理加速。
有大模型、多模态学习、机器人学习、世界模型等相关领域实习经验。