职位描述
深耕AI推理引擎与GPU云平台核心开发,优化推理服务性能与硬件利用率,助力高性能AI推理服务落地迭代。
岗位职责
- 参与AI推理引擎的功能开发、性能调试与测试工作,支撑GPU云平台各类AI推理服务的落地部署与稳定运行。
- 深入学习推理框架底层调用逻辑与运行机制,针对性优化GPU硬件利用率,持续降低模型推理端到端延迟,提升服务整体性能
- 负责高性能推理Runtime的基础开发、功能调试与问题排查,保障推理引擎高效、稳定适配各类业务模型。
- 与研发、算法团队协同配合,跟进业务需求迭代,持续优化推理引擎架构与云平台推理服务能力,推动项目落地。
- 跟踪AI Infra、推理引擎前沿技术,积累工具链与底层优化经验,输出可落地的技术优化方案。
- 面向线上推理服务的稳定性和资源效率,联动算法、云平台和硬件团队推进引擎能力的持续迭代。任职要求
任职要求
- 2027届硕士及以上学历在读学生,计算机、人工智能、软件工程等相关专业优先。
- 了解深度学习模型推理基本流程与原理,主动学习意愿强,愿意深耕TensorRT、TVM、ONNX等主流推理工具链与生态。
- 熟练掌握C++编程语言,具备扎实的代码编写、调试与问题排查能力,有相关工程开发项目经验优先。
- 具备基础的计算机系统、底层开发思维,逻辑清晰,拥有良好的学习能力和技术钻研精神。
- 沟通协作能力良好,执行力强,能够积极配合团队推进开发任务,高效完成项目落地。
- 我们期待你对推理引擎、Runtime 和 GPU 云平台有长期兴趣,能在性能、稳定性和硬件利用率之间持续定位问题、复盘方案并推动上线。
加分项
- 有AI推理引擎、Runtime开发、GPU高性能计算、云平台开发相关实习或项目落地经验。
- 熟悉TensorRT、TVM、ONNX、推理量化、算子优化等相关技术,有相关实践积累。
- 熟悉Linux开发环境、计算机网络、操作系统底层原理,有后端/底层工程开发经验。
- 具备较强的自驱力和复杂问题拆解能力,能够独立完成模块开发、调试与优化工作。
加入曦望,你将获得什么
- 难得的创造机会:参与 AI 推理 GPU 和算力基础设施从 0 到 1 到 N 的真实建设。
- 真问题、真战场、大空间:解决成本、稳定性、规模化落地中的关键问题,在核心岗位承担真实责任。
- 顶级人才共事:和行业优秀的工程、架构、产品与业务团队一起做复杂系统。
- 简单坦诚的文化:被信任、讲事实、少内耗,专业高效地把事做成。
- 长期回报与保障:有竞争力的薪酬激励、token 补贴、补充商保、员工及家人体检、晚餐与夜间出行支持等。