Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

机器人多模态交互感知工程师

上海 社招 · 全职 多模态 / 视觉 / 语音

职位描述

1. 高性能感知数据流与时空对齐:负责机器人端侧多模态数据时间同步(Timestamp Synchronization)、坐标关联(Coordinate Transform)、多源数据置信度与不确定性管理(Confidence / Uncertainty Fusion)和低延迟数据流管线(Data Pipeline)设计,满足实时交互场景下的低延迟与高稳定性要求。 2. 多模态视听融合与状态理解:负责端侧视听双模态融合(Audio-Visual Fusion)与交互状态理解,攻克多人、嘈杂场景下的活跃发言人检测(ASD)、发言人身份归属(Speaker Attribution)、声源定位(DOA)与 向机器人说话检测(Addressed-to-Robot Detection)、用户关注度评估(Engagement Estimation),解决机器人“该听谁说、在对谁说、是否需要响应”的 HRI(人机交互)核心痛点。 3. 时空追踪与交互对象生命周期管理:利用 FaceID、ReID、目标检测及追踪技术,构建跨帧、跨场景的实体连续追踪。不只是纯粹的视觉跟踪,而是负责面向交互对象进行生命周期管理与关系状态维护(如用户突发遮挡、短暂离开后的身份保持)。 4. 空间语义与上下文协议(Context Schema)定义:负责多模态感知层输出 Schema 的设计(包含人物关系、空间相对关系、关注状态、交互事件、置信度和有效时间/Freshness 等信息),将物理信号转化为标准的 Scene State(场景状态)与结构化 JSON,与交互运行时(Runtime)和模型团队共同定义上下游接口。 5. 感知系统稳定性与评测工具链:建立端侧感知融合系统的日志追踪(Trace)、状态监控与数据流回放机制,支持感知坏例(Bad Case)的快速定量复现分析与自动化版本回归。

任职要求

1. 学历背景:本科及以上学历,计算机、模式识别、自动化、机器人、电子信息等相关专业优先。 2. 工作经验:3–8 年计算机视觉、多模态融合、智能交互、机器人感知或智能座舱感知系统开发经验。 3. 工程能力:具备扎实的 C++、Python 和 Linux 工程能力,熟悉多线程、异步数据流处理。 4. 核心技术储备(以下三类能力中,至少具备两类深度经验即可): A. 多模态融合能力:熟悉 VAD、ASR/TTS 接入、声源定位(DOA)、活跃发言人检测(ASD)、音视频融合算法(Audio-Visual Fusion)或声纹特征提取/说话人分离(Speaker Embedding / Speaker Diarization)。 B. 感知工程能力:熟悉多目标追踪(MOT)、跨帧 ReID/FaceID 关联,熟悉 TensorRT / ONNX Runtime 等端侧推理加速框架,或熟悉 ROS2、GStreamer/FFmpeg 等多媒体数据流调优。 C. 上下文构建能力:有定义标准 Schema 协议的经验,熟悉 Scene State 构建,能将高频低级信号包装为高层语义,理解多模态模型(VLM)输入设计、Prompt Context 或结构化 JSON 输出。 加分项 1. 有 Active Speaker、Addressed-to-Robot、Human Engagement、Gaze Interaction、Multi-person Interaction(多人复杂交互决策) 等 HRI 相关经验者优先。 2. 有机器人主动交互、多人交互系统、智能座舱 DMS / OMS 系统、智能视频会议系统(如会议大屏发言人跟踪)核心链路研发经验者优先。