职位描述1、结合语音识别、语音合成、前端信号处理等模型工具参与语音数据质量迭代pipeline的研发,持续累积语音高质量训练数据; 2、实验最新语音理解、生成方案,并对其中的模块进行解耦和分析; 3、结合大模型范式,参与研发语音Encodec、Decoder、多模态对齐等模块,构建LLM based TTS和端到端Speech2Speech系统; 4、参与语音大模型的评测及优化任职要求1、计算机、人工智能、信号处理、通信、数学等相关专业,硕士及以上学历; 2、精通 Python\C\C++等编程语言,熟练使用 Pytorch进行深度学习模型开发,熟悉Kaldi等语音相关工具优先; 3、熟悉ASR\TTS等语音基础理论和算法,了解或使用过VITS\VALLE\FishSpeech\CosyVoice,有LLM理论和训练基础的优先; 4、有语音识别、语音合成等相关实际项目经验者优先; 5、具备良好的沟通能力,对技术充满热情,每周实习不少于 4 天,持续 3 个月以上