Ivyea Jobs 8806 roles · 130 companies · 刚刚
Vivix AI · AI 应用

模型推理优化工程师/架构师

成都 / 北京 / 深圳 社招 推理 / 部署优化

职位描述

我们正在寻找一位专注于GPU推理性能极致的工程师,你将深入多模态大模型的推理计算核心,通过编译优化、算子开发与系统调优,在有限的硬件资源下实现吞吐与延迟的突破,为前沿AI产品提供高性能、低成本的推理服务保障。 核心职责 1. 推理性能极致优化:负责多模态大模型在GPU上的端到端推理优化,综合运用模型编译、计算图融合、内核自动生成及手写高性能CUDA算子等技术,持续提升服务吞吐并降低延迟。 2. 算子与系统级调优:深入PyTorch/CUDA计算栈,分析与优化模型中的计算热点与瓶颈,在算子级和运行时系统级进行针对性优化,充分释放硬件算力。 3. 分布式推理策略开发:设计并实现高效的模型并行、流水线并行及混合并行策略,优化多卡/多机间的通信效率,实现超大规模模型的高效分布式推理。 4. 工具链与最佳实践:建设并完善推理性能剖析与优化工具链,沉淀性能优化方法论,为业务团队提供标准化的优化工具与技术支持。

任职要求

1. 必备条件 - 计算机、数学、电子工程、自动化等相关专业硕士及以上学历,2年以上GPU深度学习推理或高性能计算优化相关工作经验。 - 具备优秀的C++/Python编程能力,拥有扎实的CUDA编程经验,能够进行算子开发与性能调优。 - 熟悉现代计算机体系结构与GPU硬件架构,对内存层级、计算单元、指令流水线有深刻理解。 - 熟悉CNN、Transformer、DiT等主流模型的结构与计算特性,能快速定位其推理过程中的性能瓶颈。 - 具备强烈的技术热情、出色的动手能力和团队协作精神。 2. 优先考虑 - 有使用和深度定制 TVM、TensorRT、Triton、Cutlass 等主流推理框架或高性能计算库的经验。 - 有多模态大模型(视觉、语言、视频) 的实际推理优化项目经验。 - 熟悉多种模型并行技术,并有在分布式环境下进行通信优化(如NCCL调优)的经验。 - 在相关领域的顶级会议或开源社区中有技术贡献者优先。 我们提供 - 深入AI推理核心的技术挑战,直接参与提升亿级用户产品体验的关键环节。 - 与顶尖的架构师和算法工程师紧密协作,持续学习与成长的技术环境。 - 有竞争力的薪酬与福利体系。
Vivix AI去官方页面投递 →