Ivyea Jobs 5948 roles · 69 companies · 1 小时前
智元机器人 · 具身智能

多模态大模型训练工程师(后训练 / 机器人交互方向)

上海 社招 · 全职 后训练 / 对齐

职位描述

1. 负责开源大模型在机器人场景下的后训练与能力适配。 2. 负责 SFT、DPO、LoRA / QLoRA、蒸馏等训练实验,完成模型版本迭代与效果分析。 3. 负责结构化输出训练,使模型稳定输出可被运行时消费的字段,例如 `speech_act`、`intent`、`emotion_style`、`route`、`tool_call`、`expression`、`gesture` 等。 4. 参与机器人交互数据构建,包括多轮对话、回应对象、主动交互、澄清确认、情绪表达、端云路由等数据。 5. 参与 preference data、teacher label、hard case 回流数据的构建与质量控制。 6. 与端侧部署工程师协作,支持端侧规格约束下的模型训练、蒸馏、结构化输出稳定性和量化敏感性验证。 7. 与评测工程师协作,根据 gold set、hard case、shadow eval 和版本回归结果持续优化模型。 8. 支持 Demo 的模型能力建设与版本冻结。

任职要求

1. 本科及以上学历,计算机、人工智能、软件工程、自动化、机器人、电子信息等相关专业优先。 2. 3 年以上 LLM / MLLM / NLP / 多模态模型训练或相关算法经验。 3. 熟悉 PyTorch、HuggingFace Transformers、DeepSpeed、Accelerate、vLLM 等至少部分训练 / 推理框架。 4. 熟悉 SFT、LoRA / QLoRA、DPO、RLHF、蒸馏、指令微调等至少两类后训练方法。 5. 具备较强的数据意识,能围绕任务目标设计训练数据、偏好数据、teacher label 和评测 case。 6. 能独立完成训练实验设计、checkpoint 管理、指标对比、case 分析和复现实验。 7. 对机器人交互、多模态输入、结构化输出和端侧模型落地有兴趣。 加分项 1. 做过 Qwen、LLaMA、InternVL、MiniCPM、LLaVA、Qwen-Audio、Qwen-Omni 等开源模型微调。 2. 做过多模态模型训练,尤其是 audio / video / image / text 相关任务。 3. 做过结构化输出、tool calling、function calling、JSON schema 约束训练。 4. 做过 DPO / RLHF / reward model / preference data 构造。 5. 做过 Agent、router、planner、多轮对话、语音助手、智能座舱、数字人或机器人项目。 6. 做过 active speaker、addressed-to-robot、turn-taking、engagement、speaker attribution 等任务。 7. 做过模型蒸馏、端侧小模型训练、量化感知训练或压缩相关工作。