Ivyea Jobs 14641 roles · 245 companies · 1 小时前
智元机器人 · 具身智能

多模交互系统方案实习生

职位描述

岗位职责 1. 参与机器人多模交互能力的系统方案和功能设计,梳理模块边界、交互流程、接口定义及验证标准。 2. 推进语音交互、视觉交互和多模态大模型相关功能的开发、集成与测试验证。 3. 参与语音 3A 能力,即 AEC 回声消除、ANS 噪声抑制和 AGC 自动增益控制,以及唤醒、语音识别、语义理解和语音播报链路的调试优化。 4. 参与人脸识别、目光跟随、用户状态感知和视觉事件触发等功能开发,推动语音、视觉与机器人状态的融合。 5. 参与本地及云端多模态大模型的接入、效果评测、响应时延优化和异常降级设计。 6. 参与复杂交互流程的编排和设计,覆盖多轮交互、事件触发、任务确认、打断恢复及异常分支,并通过原型开发与测试验证方案可行性。 7. 验证多模语音交互在真实复杂场景中的实际效果,围绕噪声、回声、多人交互、远场语音、遮挡、弱网和任务并发等问题开展专项调优。 8. 作为对应场景的系统方案负责人,完成问题归因、优化目标拆解和策略设计,协调算法、软件、硬件及测试团队推进专项优化闭环。 9. 建立覆盖准确率、响应时延、噪声适应性、交互成功率和异常恢复能力的测试方案,分析问题并推动闭环。 10. 沉淀系统方案、接口文档、配置说明、测试用例和验证记录。 任职要求 1. 硕士研究生及以上学历在读,计算机、人工智能、机器人、自动化、电子信息、声学等相关专业。 2. 具备语音交互相关的项目、课题、竞赛或实习经验。 3. 至少熟悉以下能力中的多个方向:语音 3A、语音唤醒、ASR、TTS、人脸识别、目光跟随或多模态交互大模型。 4. 理解语音和视觉交互的基本链路,能够围绕功能效果、时延、噪声、误唤醒和异常场景开展分析与验证。 5. 熟练使用 Python,具备良好的代码开发和调试能力;具备 C++ 开发能力者优先。 6. 熟悉 Linux 和 Git,具备良好的实验设计、文档输出和跨团队沟通能力。 加分项 - 有真实设备或机器人上的语音、视觉、多模态交互功能开发经验。 - 熟悉 VLM、LLM、端侧模型部署或本地与云端模型协同方案。 - 熟悉 ROS2、OpenCV、音频信号处理、深度学习框架或自动化测试。 - 有开源项目、论文、专利或高质量机器人竞赛经历。
智元机器人去官方页面投递 →