职位描述•ASR服务开发:设计并实现高吞吐量的语音识别后端服务,支持实时流式转写、时间戳对齐等功能,优化首字延迟与尾字延迟 •TTS服务开发:构建低延迟语音合成服务,实现流式音色克隆、情感控制、多语言混合合成,优化音频流分片与传输策略 •Omni端到端服务:开发端到端语音交互系统,支持语音到语音的直接推理,实现全双工对话能力 •流式处理架构:设计WebSocket/HTTP2流式传输协议,实现Chunk级数据流转,优化端到端延迟至200ms以内 •高并发系统:构建支持高并发的服务集群,实现负载均衡、弹性扩缩容、故障自动恢复 •模型部署优化:负责大模型的推理加速(TensorRT/vLLM/TensorRT-LLM),实现GPU资源调度与多卡推理优化 •业务中台建设:搭建语音AI业务中台,抽象通用能力,支撑多业务线快速接入任职要求基础要求 •本科及以上学历,计算机、通信、电子工程等相关专业,5年以上后端开发经验 •精通Python/Go/C++至少一门语言,具备扎实的多线程/多进程编程能力 •深入理解流式处理架构,熟悉WebSocket、HTTP/2、GRPC等实时通信协议 •熟悉语音AI领域,了解ASR、TTS、Omni模型原理 •掌握大模型推理优化技术,有vLLM、TensorRT-LLM、Triton Inference Server等部署经验 •熟悉Kubernetes、Docker等容器化部署,具备云原生架构设计能力 核心技术栈(必备) •深度学习框架:PyTorch、ONNX Runtime、TensorRT •流式处理:WebSocket、Server-Sent Events、HTTP/2 Server Push、GRPC Streaming •音频处理:FFmpeg、WebRTC、Opus编码、音频分片与缓冲策略 •服务架构:FastAPI/Go-gin、gRPC、Redis、Kafka/RabbitMQ、Nginx •运维监控:Prometheus、Grafana、ELK、链路追踪(Jaeger/Zipkin) 加分项 •有大规模语音AI服务落地经验 •熟悉端侧推理优化,有移动端/边缘设备语音模型部署经验 •开源语音项目贡献者(如Whisper、Kaldi、ESPnet等) •有全双工语音对话系统开发经验 •熟悉大模型微调与量化技术(LoRA、QLoRA、AWQ、GGUF等)