职位描述
职位描述:
Data-Infra 数据闭环 分布式数据平台 多模态数据 对象存储 湖仓一体 数据流水线 自动驾驶 大模型 Python/C++
在零一汽车,你将主导构建支撑自动驾驶系统研发的核心工具基建。面对 PB 级数据处理、超大规模仿真、跨地域研发协作和复杂系统调试的挑战,你的技术方案将直接影响整个智驾系统的研发效率,并成为自动驾驶规模化落地的重要基础能力
工作职责:
- 负责自动驾驶与大模型场景下的数据底层基础架构全链路设计与研发,搭建支撑 VLM/VLA、自动驾驶世界模型与端到端智驾模型训练的高性能、高可扩展数据生产平台。
- 负责 TB/PB 级多模态数据存储、计算、调度与流水线开发,建设湖仓一体、对象存储、分布式计算等数据基础设施,并接入、优化公有云存储、网络、监控等组件。
- 开发存储相关工具链与平台能力,支持数据上传下载、迁移、清理、权限管理、容量统计和问题排查,提升数据使用效率与平台稳定性。
- 构建数据闭环体系,打通图像、视频、激光雷达点云、多传感器时序数据全生命周期链路,建立高效稳定的数据流转、数据治理与数据质量能力,持续提升模型迭代效率。
- 维护技术文档、使用规范和自动化流程,支持项目持续交付与内部工具链建设。任职要求
职位要求:
- 计算机、人工智能、软件工程、电子信息等相关专业本科及以上学历。
- 具备扎实的大规模分布式系统架构设计或底层数据平台开发经验,有复杂数据系统从 0 到 1 架构搭建与迭代优化经验。
- 熟练掌握 Python/Go/C++/Java 中至少一门开发语言,具备良好的工程化设计、代码架构与性能调优能力。
- 熟悉至少一家公有云厂商的存储、网络、监控组件,了解对象存储、NAS、HDFS、Ceph、S3 等常见存储系统及使用场景。
- 熟悉 Linux 环境,具备问题排查与自动化脚本开发能力;了解大模型训练全流程(预训练、SFT、RLHF)对数据体系、数据质量与供给链路的核心诉求。
- 具有良好的工作态度、团队合作精神、主观能动性和跨团队沟通能力,有责任心与文档习惯。
符合以下条件者优先:
- 具备自动驾驶领域数据基建经验,熟悉激光雷达点云、车载多传感器融合数据处理、智驾场景数据挖掘或自动驾驶世界模型/端到端大模型数据体系建设;
- 有长视频数据处理、3D 数据基建、大规模预训练数据集构建经验;
- 具备分布式存储或大数据存储项目经验,或有云资源治理、成本优化、监控告警、内部工具链开发经验;
- 有容器化(Docker、Kubernetes)与云原生实践经验;
- 熟悉 LLM、图像、多模态或 VLA/VLM 等模型的训练与推理数据需求,具备高性能训练/推理平台实战经验;