Ivyea Jobs 6505 roles · 88 companies · 刚刚
瀚博半导体 · AI 芯片

模型推理服务工程师

上海 社招 · 全职 软件开发类 推理 / 部署优化

职位描述

1.参与/负责研发面向大规模深度学习模型的推理服务架构; 2.负责单机多模型 / 单机多服务 / 多实例部署 场景的服务化方案; 3.基于自研推理后端适配社区典型的服务化框架如Ray Serve、Triton Inference Server等; 4.抽象并实现 Serving Adapter 层,屏蔽底层推理引擎差异; 5.优化推理服务的 稳定性、延迟、吞吐与 GPU 利用率; 6.参与推理服务的 监控、限流、熔断、灰度发布与回滚机制

任职要求

1.熟悉Kubernetes基础原理及Docker容器化技术; 2.熟悉Triton Inference Server、Ray、KServe等模型服务化框架; 3.熟悉vLLM、SGLang、TensorRT-LLM等大模型推理框架,熟悉 GPU 和其他加速硬件的使用,有相关的性能调优经验,如FastTransformer、TensorRT、triton等; 4.有vLLM、SGLang、TGI、LightLLM等开源项目优化经验、能够跟踪前沿技术落地优先,具备百卡级分布式推理调优能力者优先; 5. 扎实的 Python 编程能力,至少掌握一门系统语言(Go / C++ / Rust); 6.相关岗位三年工作经验以上。
瀚博半导体去官方页面投递 →