职位描述
1.全局限流系统开发:
o替换 LiteLLM 默认限流机制,基于Redis Lua Script开发分布式限流组件。
o实现令牌桶算法,支持 RPM (Requests) 和 TPM (Tokens) 双维度限制,防止长文本 OOM 击穿后端。
2.动态容错与降级:
o封装异常处理中间件,实现模型级动态降级策略(如 70B 模型超时自动切换至 8B 模型)。
o在 HTTP Header 中注入x-degraded标记,保障用户可用性优于体验。
3.主动健康检查:
o开发独立的 sideCar 后台协程,实现语义级心跳机制(prompt: ping),自动识别并剔除“TCP通但推理卡死”的僵尸节点。
4.数据对接:对接后端推理引擎的/metrics端点,实时获取 GPU 负载数据。任职要求
1.基础素质:计算机相关专业本科及以上学历,5年以上后端开发经验,具备扎实的计算机底层基础(数据结构、算法、网络协议)。
2.语言能力:精通 Python/Go(鉴于 LiteLLM 为 Python 生态,Python 优先),熟悉异步编程模型。
3.框架经验:深入理解 ASGI/WSGI 协议,有微服务网关、API Gateway 或负载均衡器开发经验者优先。
4.LLM 生态认知:熟悉大模型推理生态(如 vLLM, TGI, LoRA),理解推理引擎的 Metrics 含义(如gpu_cache_usage)。
5.架构能力:具备分布式系统设计经验,能够处理多区域、多活架构下的数据一致性与延迟问题。