职位描述岗位定位 面向具身数据工程,从 0 到 1 建设数据平台与配套软件系统,覆盖数据资产管理后端、数据生产管道、标注平台、数据前端、数据采集软件等方向。可根据个人专长匹配其中一个或多个方向。 岗位职责: 1.完成数据资产、数据批次、Clip、Dataset 等核心实体的后端建模、接口与服务开发,支持多模态数据资产的注册、查询、筛选、预览及全生命周期管理,涵盖归档状态与使用记录管理。 2.设计元数据及相关模型,构建元数据从采集到变更记录的全流程能力,包括采集、解析、补全、校验、版本管理与变更记录。 3.管控 Dataset 版本,实现冻结、发布、回滚、归档与恢复操作,建设数据血缘、输入输出关系追踪及影响范围分析体系,确保数据链路可追溯、可复现、可审计。 4.负责后端模块与数据库设计,进行性能优化、稳定性治理与可观测性建设,建立单元测试、接口测试、数据一致性校验与故障恢复机制。 5.设计并开发多模态原始数据的自动化 ETL 流水线,基于 Argo Workflows 编排数据处理全链路任务,优化大规模数据 IO 与流水线的性能及 SLA。 6.建设与迭代多模态标注工具链和平台,涵盖标注界面、后端服务与数据存储,设计标注任务调度与质量管理流程,管控外包供应商,实现自动预标与人工精修模式,搭建标注质量评估与回流机制。 7.搭建统一数据门户,支持多维度数据检索、筛选、拉取与导出,开发标注、任务管理与质量审核等界面,实现数据资产可视化。 8.对接数据管道,开发流水线触发与运营操作界面,沉淀组件库与前端工程规范。 9.开发面向多传感器的高性能数据采集软件,实现采集状态实时监控、多传感器时间同步、数据上传及源头数据校验。任职要求1.本科及以上,计算机、大数据、人工智能、自动化等相关专业;扎实的工程化能力与代码规范意识,熟悉 Linux 及 Shell。 2.至少精通下列方向之一即可(无需覆盖全部): 1)后端、平台:精通 Java、Go、Python、C++ 中至少一种,熟悉 RESTful API、RPC、消息队列、缓存、数据库事务与分布式系统设计;熟悉 MySQL、PostgreSQL、MongoDB、ClickHouse、Doris、Elasticsearch、Redis 等至少两类存储或检索组件并能合理选型。 2)大数据管道:精通 Python、Java、Scala 中至少一种,熟悉 Spark、Flink 与工作流编排工具(Argo Workflows、Airflow、Prefect 等),具备海量非结构化数据处理与调度经验。 3)标注平台:3 年以上平台、工具链或数据生产系统开发经验,全栈或后端能力扎实,熟悉任务调度、流程编排、权限与多租户管理。 4)前端:3 年以上前端开发经验,精通 TypeScript、JavaScript 及 React、Vue 之一,熟悉前端工程化与数据可视化(ECharts、G2、D3 等)。 5)数据采集软件:精通 C++、Python,熟悉高性能数据采集、多传感器时间同步。 6)具备独立设计并落地软件模块的能力,能兼顾交付效率、系统可扩展性与可维护性。 加分项 1.有数据资产管理、元数据管理、数据目录、数据治理、湖仓或 DataOps 平台的建设经验;熟悉对象存储、Iceberg、DolphinScheduler、Ray。 2.有 rosbag、MCAP 解析、Foxglove 可视化、LeRobot、HDF5、FFmpeg、OpenCV、流式 pipeline 经验。 3.有多模态(图像、点云、视频)标注业务经验,了解 VLM 预标注、Online Labeling、难例挖掘。 4.有多模态数据可视化(Three.js、deck.gl、WebGL、Foxglove)或标注工具链前端(CVAT、Label Studio 二次开发或自研)经验。 5.有智驾、具身数据闭环经验,或处理过 Ego4D、Open X-Embodiment 等大规模数据集。