Ivyea Jobs 10196 roles · 158 companies · 刚刚
芯动科技 · AI 芯片

AI infra工程师

武汉 社招 · 全职 GPU岗位 AI Infra / 训练系统

职位描述

1.前沿框架调研 前沿技术探索,跟踪大模型领域最新模型和框架(sglang /vLLm)研究 2.大模型算法设计与优化 - 负责 Transformer 及其变体(如MoE)的算法研发与性能调优。 - 研究并实现高效注意力机制(如FlashAttention)以降低显存占用和计算延迟。 - 针对Inno GPU 架构特性优化模型计算流程,提升吞吐量与能效比。 2.模型压缩与量化技术开发 - 开发4-bit/8-bit 量化算子(如 GPTQ、AWQ),平衡精度与推理速度。 3.GPU 加速与并行计算 - 基于OpenCL/Hip编程,实现模型算子级优化(如矩阵乘法)。 4.开发分布式框架,支持多 GPU 或多节点 - 针对带宽瓶颈设计数据传输优化策略,减少通信延迟。 - 性能评估与工程落地 - 与其他团队协作,完成分布式部署 5.撰写技术文档,输出专利或论文。

任职要求

具备良好的沟通能力,能与硬件、软件团队高效协作。 1.学历与背景 硕士及以上学历,计算机科学、电子工程、数学等相关专业。有大模型(LLM)研发经验 ,熟悉典型模型架构(如GPT、BERT、LLaMA) 2.技术能力 - 熟悉深度学习框架(PyTorch/TensorFlow,sglang /vLLm/ Transformer),掌握其底层原理与算子优化方法。 - 熟悉CUDA 编程 ,具备 GPU 并行计算、内存管理及性能调优经验。 - 熟悉模型量化技术有实际项目落地案例。 - 掌握分布式技术(如DP/TP/PP/EP)。 3.编程与工程能力 - 熟练使用 C/C++、Python ,具备高性能代码开发能力。熟悉版本控制工具(Git) - 有开源社区贡献经验者优先。 - 熟悉 NVIDIA GPU 架构(如 Ampere、Hopper),了解 TensorRT、cuDNN、NCCL 等库者优先。 - 熟悉模型服务化框架(如 Triton、TFServing、ONNX Runtime) - 有大规模模型部署经验者优先。 - 熟悉 芯片架构设计(如 GPU、ASIC)者优先。
芯动科技去官方页面投递 →