Ivyea Jobs 8388 roles · 122 companies · 刚刚
Sharpa Robotics · 具身智能

AI Infra工程师

上海 社招 · 全职 AI Infra / 训练系统

职位描述

1.负责根据公司现有数据格式和存储格式,设计并优化最适合训练任务的数据加载方案,包括但不限于 HDF5、JPEG、Parquet、WebDataset、Numpy、S3 / JuiceFS / Ceph 等格式与存储系统。 2.负责优化 PyTorch DataLoader、数据预取、缓存、shuffle、batching、num_workers、pin_memory、异步加载、CPU-GPU 数据流水线等训练数据加载链路,降低 I/O stall,提高 GPU 利用率。 3.负责定位训练过程中的性能瓶颈,包括 GPU 利用率低、通信瓶颈、存储 I/O 瓶颈、CPU 解码瓶颈、Checkpoint 慢、数据加载慢、多机多卡效率低等问题,并给出可落地的优化方案。 4.负责基于公司业务形态,沉淀标准化训练框架和训练模板,支持 VLA / VLM / LLM / Policy / Diffusion Policy 等模型训练任务,提升算法团队训练效率。 5.负责设计和优化分布式训练方案,包括 DDP、FSDP、DeepSpeed、Megatron、Ray Train、Torch Distributed 等框架在公司业务中的落地。 6.负责建设训练任务 Profiling 和诊断能力,打通 GPU、CPU、网络、存储、DataLoader、Checkpoint、任务调度等关键指标,形成可复用的性能分析方法和 Playbook。 7.负责支持后续多云环境下的自建机器学习平台建设,包括训练任务管理、资源调度、镜像环境、数据挂载、日志监控、任务恢复、Checkpoint 管理、实验管理等能力。 8.负责推动训练基础设施平台化,降低算法同学使用门槛,提升训练任务的可复现性、可维护性和稳定性。

任职要求

1.本科及以上学历,计算机、软件工程、人工智能、自动化等相关专业。 2.熟悉 PyTorch 训练体系,理解 Dataset、DataLoader、Distributed Training、Checkpoint、AMP / BF16、Profiling 等核心机制。 3.熟悉至少一种分布式训练框架或方案,如 DDP、FSDP、DeepSpeed、Megatron-LM、Ray Train、Torch Distributed 等。 4.熟悉大规模训练中的数据加载优化方法,理解数据格式、存储系统、数据预取、缓存、shuffle、CPU 解码、GPU 等待等问题。 5.熟悉 Linux 系统,具备较强的问题定位能力,能够使用 PyTorch Profiler、NVIDIA Nsight Systems / Compute、nvidia-smi、iostat、perf、strace、tcpdump 等工具分析性能瓶颈。 6.熟悉 GPU 训练性能优化,理解 GPU Utilization、MFU、显存占用、通信开销、I/O stall、batch size、梯度累积等指标。 7.熟悉至少一种存储系统或协议,如 JuiceFS、Ceph、NFS、S3、OSS、POSIX 文件系统等,理解大规模训练场景下存储 I/O 对训练效率的影响。 8.熟悉 Kubernetes、Docker、容器化训练环境,有训练平台、机器学习平台、GPU 集群或多云平台建设经验者优先。 9.熟练掌握 Python,具备良好的工程实现能力;熟悉 Go / C++ / CUDA / Triton 者优先。
Sharpa Robotics去官方页面投递 →