职位描述
1.持续优化 ASR 和 TTS 系统,改进声学模型、语言模型与合成算法,提升识别准确率和语音自然度,解决实际应用场景问题。
2.跟踪 ASR 和 TTS 前沿技术,引入先进算法升级现有系统。
3.负责自研云 +端智能语音系统架构研发,完成云端服务构建与端侧算法优化。
4.开发声纹识别、情绪识别等进阶功能,实现语音实时翻译等创新应用。
5.与硬件团队协作,完成语音系统在不同片平台的适配、集成,参与硬件选型与设计优化。任职要求
1.计算机科学、电子工程等相关专业本科及以上学历。
2.熟练掌握 C++、Python 编程语言,具备良好代码编写与调试能力。
3.深入理解语音识别与合成原理,熟悉基于深度学习的 Conformer、Whisper在 ASR 中的应用,以及 FastSpeech 2、Hifi- Gan 等 T部署经验。
4.掌握 TensorFlow、PyTorch 等至少一种深度学习框架,能进行模型搭建、训练与部署。
5.3年以上智能语音研发经验,有 ASR 或 TTS 系统开发优化经历,熟悉云 +端架构开发。
6.具备与硬件团队协作经验,能完成软硬件集成调试:最好对全模态(尤其是文本+图像)相关的大模型有认知或感兴趣。
7.拥有较强问题解决与创新能力,良好团队协作、沟通能力,对技术充满热情且乐于学习。