职位描述1、探索文本-语音-视觉多模态联合建模技术范式,实现原生多模态表征方法,推动全模态理解与生成能力在机器人场景落地; 2、研发流式全双工实时交互模型,推动端到端语音对话系统的搭建与持续优化,提升交互的自然度与实时性; 3、参与大规模音频/语音数据的建设、清洗、标注、合成与评测体系搭建,构建高质量数据闭环; 4、推进语音前端工程化落地,包括流式识别、上下文增强、热词/专有词优化、ASR纠错等能力建设,提升识别准确率; 5、攻克复杂场景下的识别难题,包括低音质声学环境、远场交互、多语种/方言/中英混场景下的意图识别与语音识别优化; 6、基于语义与声学特征,深度挖掘语音中的意图、情感及环境信息,设计并实现语音对话系统中的意图分类、槽位填充、对话状态追踪等核心模块。任职要求1、计算机科学、人工智能、语音信号处理、电子信息等相关专业硕士及以上学历; 2、2年以上语音算法研发经验,具备扎实的机器学习、深度学习和语音信号处理基础; 3、有大规模式ASR系统落地经验者优先,了解ASR全链路者优先; 4、有口语语言理解、对话系统、意图识别相关研发经验,熟悉对话状态追踪与槽位填充等模块; 5、熟悉Omni大模型范式,有多模态模型研发经验,有语音大模型训练或应用调优经验者优先; 6、熟练掌握PyTorch、Transformers,熟悉Megatron、DeepSpeed、FSDP、vLLM等训练或推理框架中的一种或多种; 7、扎实的Python/C++编程功底,具备优秀的工程实现与调试能力; 8、有全双工/半双工语音交互、同声传译、端到端语音对话系统落地经验者优先; 9、熟悉Qwen-Omni、Whisper、FunASR、WeNet、ESPnet等开源模型或框架者优先; 10、有大规模分布式模型训练经验,或在端侧部署上有实践经验者优先; 11、有车载、IoT、智能助手等场景语音技术经验者优先。