职位描述- 数据质量评价:参与多模态数据质量规则与指标体系的建设,协助完成数据质量分析与价值评估。 - 多模态处理:参与视频、传感器、轨迹等原始数据的清洗、解析与预处理,协助多传感器时间同步与抽帧、解码等工作。 - 自动标注:参与基于 VLM 的预标注流水线开发,协助在线打标与难例挖掘。 - 数据质检与挖掘:参与自动化质检与异常检测,协助数据去重、相似度分析与高价值样本筛选。 - 交互语料工程:参与文本、语音、对话语料的清洗、去重与质量过滤,协助意图、槽位、实体或情感标注,或知识图谱抽取与大模型后训练语料生产。 - 语音交互数据:参与语音交互场景下的 ASR 转写与校对,协助方言、口语化语音数据的处理,以及语音情感标注与多轮对话情绪流转分析。任职要求- 机器学习、数据科学、计算机、机器人等相关专业在读硕士及以上,能保证每周至少 3 天、连续 3 个月以上到岗实习。 - 精通 Python;算法方向需熟悉 PyTorch。 - 了解下列方向之一即可:数据质量与评测、多模态与计算机视觉、自动标注与数据挖掘、NLP 与语料工程、语音与对话数据。 - 踏实主动,具备较强的学习意愿与跨方向学习能力。 加分项 - 有计算机视觉、NLP、数据挖掘或语料工程相关的课程项目、竞赛、论文或实习经历。 - 了解 VLM、VLA、大模型的数据需求(预训练、SFT、RLHF),或熟悉 ROS、FFmpeg、OpenCV、点云处理等。 - 处理过 Ego4D、Open X-Embodiment 等大规模数据集,或有知识图谱、检索增强(RAG)相关经历。 - 有智驾或具身智能数据闭环相关经历。