职位描述
负责语音识别(ASR)与语音合成(TTS)算法研发及产品化,提升复杂环境、多领域和多语言场景下的识别准确率与合成自然度,推动算法在车载、家居、机器人等终端落地。
1)负责端到端语音识别、流式识别、关键词识别及语言模型等算法研发与优化;
2)负责语音合成、音色建模、韵律建模、情感合成及声音复刻等技术研发;
3)开展声学模型、语言模型、声码器及生成式语音模型的训练、评测和迭代;
4)优化噪声、口音、远场、多说话人等复杂场景下的算法效果;
5)推进模型压缩、量化、加速和端云协同部署;
6)建设数据闭环和评测体系,持续提升线上产品体验;
7)跟踪大模型及生成式语音技术进展,推动新技术应用。任职要求
1)计算机、电子、通信、自动化、数学等相关专业,硕士及以上学历优先;
2)熟悉语音识别或语音合成基本原理,具备相关项目或产品经验;
3)熟悉 Transformer、Conformer、CTC、RNN-T、Attention、Diffusion 等一种或多种模型;
4)熟练使用 Python、C/C++及 PyTorch、TensorFlow 等深度学习框架;
5)具备良好的算法分析、实验设计和工程实现能力;
6)能够独立完成数据处理、模型训练、效果评测和问题定位。
加分项:
1)有大规模 ASR/TTS 系统或端侧语音产品落地经验;
2)熟悉多语种、方言、情感语音或声音复刻技术;
3)在 Interspeech、ICASSP、NeurIPS、ACL 等会议发表过相关成果。