职位描述岗位定位: 面向具身数据工程的数据算法开发,覆盖数据质量评价与价值评估、多模态处理、自动标注、数据质检、数据挖掘等方向。可根据个人专长匹配其中一个或者多个方向。 岗位职责: 1.制定并维护多模态数据的质量规则与标准,涵盖完整性、时序对齐、通道齐全、格式合规、标注质量、多样性等方面。建设数据质量评价指标体系与质量门禁,作为下游质检与入库的统一依据。同时,建立数据 - 模型全链路归因与消融实验,进行数据价值建模与 Scaling 曲线分析,通过数据配比优化反哺采集与数据选择策略。 2.负责多模态原始数据(如视频、传感器、轨迹等,以 rosbag、MCAP 等格式存储)的清洗、解析与预处理工作。建设多传感器时间同步、空间对齐与标定,以及抽帧、点云与视频解码等预处理引擎。统一数据对象与元数据管理(Session、Topic、Channel、Manifest),落实 DatasetVersion、DataTaskRun 口径与 Data Contract。 3.基于 VLM、FM 构建具身智能数据预标注体系,搭建覆盖 2D 图像语义、3D 点云与多模态文本描述的自动化标注流水线。研发在线打标(Online Labeling)与基于置信度的自动初筛,通过难例挖掘突破长尾场景。同时,开发自动化质检与异常检测(包括异常轨迹、坏帧、标定漂移、标注错误等),建设低质数据回流的质量反馈闭环,并依据数据质量评价体系标准执行。 4.负责海量多模态数据的数据选择、去重(场景与轨迹相似度、语义级)与多样性分析,实现长尾 Corner Case 的自动识别、聚类与召回。设计主动学习策略筛选高价值样本,通过数据配比优化反哺数据采集工作。 5.进行文本、语音、对话语料的清洗、去重(MinHash、SimHash、LSH)、质量过滤与配比。完成自然语言理解数据(方言、口语化)的 ASR 转写与意图、槽位、实体标注;开展情感计算数据的文本与语音情感标注、构建情感标签体系与对话情绪流转;进行知识图谱的实体与关系抽取、三元组构建、知识对齐与融合、KG - to - text 及检索增强;负责大模型后训练语料(指令、SFT、偏好与 RLHF 数据)的生产与质量评估。任职要求1.硕士及以上优先,机器学习、数据科学、计算机或机器人等相关专业;3 年以上算法或数据工程经验;精通 Python(算法方向需熟悉 PyTorch)。 2.至少精通下列方向之一即可: 1)质量评价:熟悉数据质量评估、数据选择与配比、Scaling Law 及模型评测方法,具备消融实验设计与量化归因分析能力。 2)多模态处理:熟悉 ROS、ROS2、rosbag、MCAP、FFmpeg、OpenCV、点云处理(PCL),具备 C++、Python 能力及多传感器标定与时间同步经验。 3)自动标注、质检、挖掘:熟悉 2D、3D 计算机视觉与 VLM、异常检测与数据质量,或数据挖掘、主动学习与聚类。 3)交互语料:熟悉语料工程(清洗、去重、质量过滤、配比)、NLP 标注(意图、槽位、NER、情感)、语音与 ASR 数据,或知识图谱抽取,理解大语言模型的数据需求(预训练、SFT、RLHF)。 · 具备独立搭建数据算法或处理闭环的能力与跨方向学习意愿。 加分项 1.有端到端、VLA、大模型的数据-模型闭环经验,熟悉数据混合策略(真机遥操作、无本体人类视频、仿真合成数据的最优配比)与消融分析。 2.有智驾数据闭环全链路(多模态解析、Auto Labeling、DQC、Corner Case 挖掘)的端到端经验。 3.熟悉在线学习与实时流处理、LeRobot、HDF5 等机器人数据格式;处理过 Ego4D、Open X-Embodiment 等大规模具身数据集;有数据质量或数据治理标准制定经验。 4.有大语言模型预训练或后训练语料工程经验;有方言、多语种、低资源语言数据,或知识图谱建设与检索增强(RAG)数据链路经验。