职位描述
1. 多模态数据采集与构建:参与大规模多模态数据(图-文-音数据对、具身交互数据)的采集、清洗、标注与质量评估流程建设,构建面向人形机器人语音交互场景的高质量训练数据集。
2. 模型后训练(Post-Training):参与多模态大模型的 SFT(监督微调)、RLHF/DPO(偏好对齐)、LoRA/QLoRA 等后训练全流程,针对情感对话、任务规划、工具调用等场景进行模型能力提升。
3. Benchmark 构建与评测体系:设计并构建面向人机交互的多模态评测基准,涵盖指令遵循、情感识别、多轮对话、视觉理解等维度;搭建自动化评测流水线(含 LLM-as-Judge、人工评测双通道)。
4. 前沿技术调研与复现:跟踪多模态大模型(GPT-live、Gemini、Qwen-omni 等)最新进展,完成关键论文的复现与内部技术报告撰写。
5. 模型部署与迭代:配合工程团队完成模型量化、蒸馏、推理加速,完成模型的上线部署。任职要求
1. 硕士及以上学历,计算机科学、人工智能、电子信息、自动化等相关专业。
2. 熟悉 Transformer 架构,理解 Self-Attention、MoE、RoPE、KV Cache 等核心技术原理,熟悉各类多模态模型、理解视觉编码器、音频编解码,及其与语言模型的对齐方法。能独立阅读并复现前沿论文。
3. 熟练使用 PyTorch / HuggingFace Transformers,有 LLM 微调实操经验(SFT/RLHF/DPO/LoRA 至少一项)。
4. 代码能力扎实,熟悉 DeepSpeed / Megatron-LM 等分布式训练框架者优先,有多模态数据构建或评测基准搭建经验者优先。
5. 在 ACL/EMNLP/CVPR/NeurIPS/ICLR 等顶会有论文发表者优先。