Ivyea Jobs 6655 roles · 90 companies · 刚刚
智元机器人 · 具身智能

大模型音频算法工程师

上海 校招 · 正式 多模态 / 视觉 / 语音

职位描述

参与大模型音频算法(ASR/AudioLLM/TTS等)的研究与落地,负责模型的SFT有监督微调训练、优化及部署; 针对语音合成、语音识别、语音理解等场景,设计高效的微调策略,提升模型在垂直领域的性能与鲁棒性; 负责音频数据预处理、质量分析及训练数据集构建,持续优化数据管线; 跟进AudioLLM、FlowMatching、Diffusion TTS等前沿技术,推动技术在业务场景的工程化落地; 撰写技术文档,沉淀模型训练方法论与最佳实践。

任职要求

硕士及以上学历,计算机科学、人工智能、信号处理等相关专业; 扎实的深度学习基础,熟悉Transformer、LLM架构及训练流程,有语音相关项目经验者优先; 熟练使用PyTorch、DeepSpeed、Transformers等深度学习框架及工具,具备大模型SFT/RLHF实操经验; 熟悉至少一个音频任务:ASR(语音识别)、TTS(语音合成)、Voice Conversion、Audio Codec等; 具备优秀的编程能力(Python/C++),良好的逻辑思维与沟通能力,能够快速复现前沿论文。 加分项 在Interspeech、ICASSP、NeurIPS、ACL等顶会发表过语音/音频相关论文; 熟悉主流开源AudioLLM项目(如Qwen-Audio、Gemini Audio、CosyVoice、FishSpeech等); 具备多机多卡大模型训练经验,熟悉Megatron-LM、FSDP等分布式训练框架; 有Kaldi、WeNet、ESPnet等传统语音工具链使用经验。
智元机器人去官方页面投递 →