职位描述
岗位职责:
1.设计并实施具身大模型的监督微调(SFT)流程,基于工业场景的半结构化任务数据,提升模型在特定机器人任务中的指令遵循、操作精度和任务完成度;开发多任务迁移学习与增量学习框架,实现跨场景、跨机器人形态的能力迁移;探索PEFT(参数高效微调)方案设计与落地验证。
2.实施RLHF及其衍生技术,将模型行为与工业任务的成功标准对齐;设计符合机器人任务特点的奖励函数,平衡任务完成度、安全性、效率与能耗等多维指标;开发并训练奖励模型,实现对机器人行为质量的准确自动评估。将离线强化学习与在线策略迭代相结合,构建可扩展的后训练闭环系统。
3.开发安全层与约束机制,防止模型在工业场景中产生危险或不可控行为;设计对抗性测试与压力测试方案,评估模型在边缘场景和长尾分布下的鲁棒性;实现不确定性估计与置信度校准,提升模型决策的可解释性与可信度,构建持续监控和在线学习系统,及时发现并修复模型在实际部署中的缺陷。
4.设计工业级后训练数据集构建流程,包括高质量专家遥操作数据采集、远程低成本数据标注管理、数据清洗与多模态对齐,以及训练数据的质量评估和有效性筛选;面向工业场景构建专业能力评测基准(如对齐、安全、指令跟随能力)与体系化的模型评估机制;建立层次化评测框架,确保模型上线前有经过实测校准的综合能力档案。
5.优化模型推理效率,通过知识蒸馏、量化、剪枝等技术降低模型在工业边缘端的部署成本;与预训练工程师紧密协作,将后训练中发现的模型缺陷和任务需求反馈至预训练阶段,形成从预训练到后训练到部署的完整研发闭环。任职要求
1.计算机科学、人工智能、自动化、机器人学等相关专业硕士及以上学历,博士优先。
2.3年及以上大模型微调、对齐或机器人策略学习相关研发经验,有具身模型后训练(如OpenVLA、RT系列、Pi系列等)实际项目经历者优先。
3.精通Python编程,熟练掌握PyTorch等主流框架,具备复杂训练流程的手写与调试能力;深入掌握大模型训练范式,熟练使用LlaMA-Factory等主流高效微调框架,深度理解监督微调(SFT)、强化学习对齐(RLHF/DPO/GRPO)等技术原理。熟悉Hugging Face Transformers及相关工具链。
4.掌握PPO、DQN、SAC等强化学习算法及其在机器人策略学习中的应用,有实际项目落地经验;具备大规模模型参数高效微调实战经验,熟悉LoRA、QLoRA、Adapter等技术的原理、选型与工程部署。
5.了解模仿学习(IL/BC)、Diffusion Policy等机器人策略学习方法,有机器人仿真(Isaac Sim、MuJoCo、SAPIEN等)使用经验者优先。加分项:- 在RSS、CoRL、NeurIPS、ICRA、CVPR等顶会发表过模型对齐、后训练或机器人学习相关论文。
加分项:
- 有OpenVLA、RT系列、Pi系列等开源具身模型的SFT/RLHF实战经验,或在公开的具身/对齐排行榜上有贡献。
- 具备机器人真机部署与后训练闭环经验,有模型量化、ONNX/TensorRT等推理优化工程经验。
- 有工业场景(如制造、物流、港口、建筑等)的机器人或自动化项目实践经验。
- 熟悉机器人操作系统ROS/ROS2,了解多传感器融合技术。
- 具备前沿后训练范式工程化的实际经验。
- 有公开的开源贡献(代码、模型、评测基准、技术报告等)。
立即投递