职位描述1、负责数据算子 Infra 的架构设计与建设,支撑文本、图像、音频、视频数据的清洗、理解、标注、筛选与转换。 2、负责小模型及 VLM/LLM 的部署与推理优化,涵盖 ONNX、TensorRT、低精度量化、批量推理、显存管理和并发调度。 3、建设高性能推理服务,优化模型管理、动态批处理、请求路由、背压,以及 gRPC、HTTP、brpc 通信链路。 4、优化基于 FFmpeg、NVCodec 的 GPU 视频解码、抽帧、预处理与模型推理流水线。 5、建设算子注册、DAG 编排、任务调度、失败重试、可观测性及性能回归等平台能力。任职要求1、本科及以上学历;熟练掌握 Python,熟悉 C++、Go 或 Rust 中至少一种语言。 2、熟悉 PyTorch、ONNX、ONNX Runtime、TensorRT、CUDA/Triton 等模型部署与优化技术。 3、熟悉以下至少一个方向: -vLLM、SGLang、TensorRT-LLM、TensorRT-Edge-LLM; -Triton Inference Server、NVIDIA Dynamo; -FFmpeg、NVCodec 及 GPU 视频处理; -Ray、Spark、Flink 等分布式数据处理框架。 4、熟悉 gRPC、HTTP、brpc 等通信方式,具备高并发服务设计和性能优化经验。 5、具备扎实的 Profiling、Benchmark 和性能瓶颈分析能力,熟悉 Nsight Systems、Nsight Compute 等工具,能够定位模型、算子、显存、通信及 I/O 瓶颈。 加分项 1、有 GPU 解码、抽帧、预处理与推理一体化流水线开发经验,熟悉 NVIDIA DALI 或类似框架。 2、熟悉 Kubernetes、GPU 资源调度、弹性伸缩及大规模异构任务治理。 3、有 TensorRT Plugin、自定义 CUDA/Triton 算子或推理引擎开发经验。 4、熟悉投机采样及 FP8、INT8、INT4 等低精度量化技术。 5、有模型蒸馏、剪枝、小模型替换、多机推理或大规模任务稳定性治理经验。