Ivyea Jobs 6461 roles · 88 companies · 刚刚
智元机器人 · 具身智能

多模智能交互算法专家

上海 / 北京 社招 · 全职 产品 / 设计

职位描述

1. 原生多模态端到端交互系统研发:主导/参与 Any-to-Any / Omni-to-Omni 原生多模态交互大模型的架构设计与核心策略研发。打破级联拼接死锁,在统一网络中实现流式音频、高频 3D 视觉空间特征与语言文本的高维流式对齐,打造视听结合的多模态交互体验。 2. 全双工流式交互体验提升:深度优化流式全双工交互机制,构建高敏捷的流式判停、无感插话、自然打断与拒识算法。攻克全双工并发与自回归解码的顺序死锁,实现百毫秒级语义接管,支持在不阻塞当前全双工业务流的前提下,异步高频调用底层技能。 3. 交互驱动型任务闭环:以全双工交互为核心入口,结合流式多模态感知与Agentic OS ,打通机器人在复杂物理现场中长程任务的自主规划、执行与动态自进化闭环,提升任务完成成功率;构建模糊和突发事件的主动追问澄清,多模态长程任务中的必要人机信息同步,交互模型与底层本体原子技能的高效协同等。 4. 交互沙盒演进系统:负责全双工交互的仿真练兵场(沙盒体系)构建。配合端侧“影子模式”,设计高频多模态异常数据(如长尾卡壳、打断失败片段)的“错误切片大回流”链路,并将其注入仿真沙盒进行千倍速的高烈度对抗;主导建立一套包含全双工流式评测、技能协同评测在内的多模态一致性仿真评测体系,全面加速模型交互智商的自进化。

任职要求

1. 背景与资历:计算机、人工智能、自动化、声学或相关专业硕士及以上学历;具备 3 年以上(或博士毕业后 2 年以上)在一线科技大厂、头部 AI 研究机构或前沿具身智能企业多模态/语音大模型研发的实际工程落地经验。具备极扎实的深度学习理论基础,深刻理解原生多模态大模型(Speech2Speech / Omni-to-Omni)的序列建模原理、流式架构。 2. 具备极强的编程与工程架构能力,精通 Python,掌握 PyTorch 及主流大模型分布式训练与推理调优工具(如 Megatron-LM、DeepSpeed、vLLM 等),能通过模型、架构、链路调优解决业务痛点。熟练使用AI辅助工作提效,深度使用claude/codex,并有自己见解。 3. 对具身智能有极大的技术热忱,具备卓越的跨团队协作与软硬一体化协同思维 4. 作为核心成员完整参与过国内外主流原生多模态/全双工大模型底层训推、对齐及全双工状态重构者优先。 5. 在 ICML、NeurIPS、ICLR、ICASSP、Interspeech 等国际顶级 AI 或语音学术会议/期刊上以第一作者发表过重磅多模态/全双工交互相关论文,或在知名语音/多模态 AI 竞赛中获得过 Top 名次者优先。
智元机器人去官方页面投递 →