职位描述
1. 音频前处理算法研发:参与语音增强(降噪、去混响、回声消除 AEC)、波束形成、语音活动检测(VAD)等音频前处理算法的设计、训练与工程化,面向人形机器人远场拾音场景。
2. ASR 语音识别:参与流式 ASR 模型的训练与优化,支持中英文混合识别、情感语音识别、嘈杂环境下的鲁棒识别;探索端到端语音大模型(如 Whisper / Paraformer / SALMONN)在人机交互场景的应用。
3. TTS 语音合成:参与流式 TTS 模型的训练与部署,支持情感可控、音色克隆、低延迟合成(<200ms);探索 CosyVoice / ChatTTS / VALL-E 等方案在数字人语音输出中的应用。
4. 端侧部署与优化:配合工程团队完成模型量化、剪枝、定点化,在 ARM / 边缘设备上实现实时推理。任职要求
1. 硕士及以上学历,计算机、电子信息、通信工程、声学等相关专业。
2. 语音信号处理基础扎实:理解 FFT / STFT / Mel 频谱 / 声学特征提取,了解 AEC / ANS / AGC / 波束形成等前处理算法原理。
3. 熟悉至少一个 ASR 或 TTS 主流框架:Whisper / Paraformer / Conformer(ASR);VITS / CosyVoice / ChatTTS / FastSpeech(TTS)。
4. 代码能力扎实,有 Python/C/C++ 基础,熟练使用 vibe coding,了解 ONNX Runtime / TensorRT 等推理框架者优先。
5. 熟悉常用语音评测指标(WER / CER / MOS / DNSMOS / UTMOS),有数据集构建经验者优先。