职位描述
聚焦大模型推理场景,研究落地推理优化算法,攻克模型推理速度、显存占用核心瓶颈,提升大模型部署落地性能与整体吞吐效率。
岗位职责
- 参与大模型推理方向的性能优化方案调研、需求拆解与算法设计,负责基础优化算法的代码实现、实验调试与效果测试。
- 针对性分析大模型推理全流程性能瓶颈,聚焦显存占用过高、推理吞吐低、延迟高等核心问题,落地轻量化、高效率的优化方案。
- 与后端工程、部署落地团队深度协作,完成各类推理优化算法的工程化适配、上线验证与迭代优化,保障算法落地有效性。
- 持续跟踪大模型推理优化领域前沿技术、行业方案,结合业务落地场景,沉淀可复用、可落地的算法优化体系与方案。
- 围绕真实推理负载持续验证优化效果,把算法改进落到吞吐、延迟、显存占用和部署成本等可衡量指标上。任职要求
任职要求
- 2027届硕士及以上学历毕业生,计算机、人工智能、数学、统计等相关专业优先。
- 具备扎实的深度学习、大模型基础理论知识,熟练掌握PyTorch、TensorFlow等至少一种主流深度学习框架,具备独立的算法编码与实验实现能力。
- 熟悉量化、稀疏化、模型压缩、算子优化等至少一种大模型推理优化技术,对大模型部署、推理性能优化方向有浓厚兴趣与探索意愿。
- 拥有课程项目、科研项目、算法竞赛、技术实习等相关经历,能够清晰梳理并阐述个人项目贡献与技术落地思路。
- 数学思维扎实,具备良好的实验设计、数据分析和问题复盘能力,逻辑清晰,学习能力优异。
- 具备良好的团队协作与沟通能力,能够适配研发协作节奏,在复杂技术场景中主动推进问题解决与项目落地。
- 我们期待你对推理性能、显存占用和部署成本有持续敏感度,习惯用实验和数据验证判断,并能把算法优化推进到真实业务指标改善。
加分项
- 拥有大模型、深度学习优化、模型部署、推理加速相关实习经历或落地项目经验。
- 持有算法竞赛获奖、相关技术论文、专利、开源项目贡献等高质量技术成果。
- 长期关注大模型推理优化、模型压缩、高性能计算等技术方向,有自己的技术认知和落地思考。
- 具备较强的自驱力和问题拆解能力,能够独立攻克算法优化、工程适配中的复杂技术问题。
加入曦望,你将获得什么
- 难得的创造机会:参与 AI 推理 GPU 和算力基础设施从 0 到 1 到 N 的真实建设。
- 真问题、真战场、大空间:解决成本、稳定性、规模化落地中的关键问题,在核心岗位承担真实责任。
- 顶级人才共事:和行业优秀的工程、架构、产品与业务团队一起做复杂系统。
- 简单坦诚的文化:被信任、讲事实、少内耗,专业高效地把事做成。
- 长期回报与保障:有竞争力的薪酬激励、token 补贴、补充商保、员工及家人体检、晚餐与夜间出行支持等。