职位描述关于这个岗位 Meshy 正在打造下一代 3D 生成式 AI 模型。支撑起这一切的,是我们在背后不断演进的数据基础设施 —— 从海量原始素材的摄入,到大规模分布式处理,再到模型训练所需的高质量数据集的构建。数据基础设施是我们最核心的技术护城河之一,也是研究团队能否持续快速迭代的决定性因素。 我们正在上海招募一位 Senior Data Infrastructure Engineer,加入 Data Infra 团队,与全球的工程师一起设计、构建和运维支撑大规模 AI 模型训练的分布式数据系统。你将处理的数据既包括常规的结构化数据,也包括图像、3D 模型、视频等非结构化资产 —— 后者通常需要为预训练和 fine-tune 做专门的处理和转换。 这是一个 versatile 的岗位:你会拥有从数据摄入到转换、再到训练就绪的端到端数据管道的 ownership;你会与 ML 研究团队紧密合作,为前沿模型训练准备各类数据集;你会在一个 startup 环境里 —— fast-paced、adaptive、什么都要能上手 —— 找到最适合自己的位置。 主要职责 分布式系统与存储 - 在云对象存储、data lake、metadata catalog 之上,设计并演进大规模数据处理管道。 - 使用分布式计算框架(Spark / Dask / Ray / Flink 等)优化大规模数据处理任务。 - 落地 partitioning、sharding、caching 策略以及完善的可观测性(monitoring / logging / alerting),让整套管道保持可靠、可解释。 核心数据管道 - 设计、实现并维护分布式的结构化 / 非结构化数据(图像、3D / 2D assets、二进制文件等)摄入管道。 - 构建可扩展的 ETL / ELT 工作流,用于转换、验证、丰富训练数据集。 预训练数据处理 - 为训练管道支持非结构化资产(图像、3D / 2D 模型、视频等)的预处理:格式转换、归一化、数据增强、metadata 提取等。 - 落地数据质量校验,确保数据集满足 ML 训练需求。 - 与研究团队紧密配合,快速适配不断变化的预训练与评测需求。 基础设施与 DevOps - 使用 IaC(Terraform、Kubernetes 等)管理可扩展、可复现的环境。 - 把 CI/CD 的最佳实践引入数据工作流。 数据治理与协作 - 维护数据集的 lineage、reproducibility 和 governance。 - 与 ML researchers、graphics/vision engineers、平台团队跨团队协作。 - 在基础设施层挑战与数据层问题之间自由切换。 - 贡献于一种快速迭代、务实取舍、collaborative ownership 的团队文化。任职要求必备条件 技术背景 - 5 年以上 数据工程 / 分布式系统 / 平台工程相关经验。 - 精通 Python(会 Scala / Java / C++ 是加分)。 - 熟练使用 SQL,能进行分析、转换以及和 warehouse / lakehouse 的集成。 - 熟悉分布式计算框架(Spark / Dask / Ray / Flink)。 - 熟悉云平台(AWS / GCP / Azure)与对象存储、数据格式(S3 / Parquet / Delta Lake 等)。 - 熟悉工作流编排工具(Airflow / Prefect / Dagster / Databricks Workflows 等)。 领域能力(优先) - 有处理大规模非结构化数据(图像、视频、3D / 2D assets 等)的经验。 - 熟悉 AI / ML 训练数据管道的常见问题,包括 dataset versioning、augmentation、sharding 等。 - 有过 3D / 2D 图形处理相关的经验将非常有帮助。 Mindset - 适应 startup 环境:versatile、self-directed、pragmatic、adaptive。 - 面对不明确的问题,愿意主动思考、独立推动落地。 - 重视系统的鲁棒性、可维护性和可观测性。 - 具备基本英文沟通能力 —— 团队日常 sync 以英文为主,能够胜任英文书面沟通与英文会议是必要的(口语可以在合作中继续提高,但需要有基本的对话能力)。 加分项 - 模型训练经验 —— 熟悉 pretraining / fine-tuning / distillation / RL 中任意一个流程的实际操作。 - Kubernetes 用于分布式工作负载与编排。 - 数据仓库 / lakehouse 平台经验(Snowflake / BigQuery / Databricks / Redshift 等)。 - GPU 加速计算与 HPC 集群相关经验。 - 3D / 2D 资产处理经验(几何变换、渲染管线、纹理处理等)。 - 熟悉渲染引擎(Blender / Unity / Unreal)用于合成数据生成。 - 开源项目贡献(ML infra、distributed systems、data platform 方向)。 - 熟悉数据安全与合规相关实践。