Ivyea Jobs 6461 roles · 88 companies · 刚刚
智元机器人 · 具身智能

多模态交互模型工程师

上海 社招 · 外包 多模态 / 视觉 / 语音

职位描述

1. 训练流水线建设: 搭建与维护多模态模型训练 Pipeline(涵盖数据预处理、实验追踪、Checkpoint 管理与回归评测),支持音视频、状态序列等多模态输入。 2. Teacher-Student 蒸馏: 使用大模型/专家模块生成 Richer Labels,设计蒸馏目标、Loss 函数与 Hard-negative 机制,将高价值能力稳定转移至端侧,摆脱对云端的在线依赖。 3. 模型压缩与部署优化: 负责 PTQ/QAT、量化感知训练、剪枝与 KV/Cache 优化;导出 ONNX/TensorRT 等格式;在真实设备上死磕 Latency、显存、功耗与推理抖动。 4. 质量与回归治理: 建立可复现机制,系统性归因模型失效(数据、标签、结构或部署问题);联合团队建设 Hard slices 与回放评测。 5. 运行时协同: 与系统侧拆分快慢路径,trade-off 端侧性能与业务收益,推动模型从“实验室能跑”跨越到“设备稳跑”。 6. 同时需要兼顾交互语义建模与任务定义(如回应对象判断、交互时机、主动策略等)

任职要求

必备项: 1. 计算机、人工智能相关专业本科及以上学历。 2. 3 年以上经验,在训练工程、蒸馏压缩、部署优化中具备至少两项的深厚实战积累。 3. 精通 PyTorch 训练体系,代码工程能力极强,能独立且稳定地维护训练仓库。 4. 具备量化优化、ONNX/TensorRT/CUDA 推理优化经验。 5. 具备出色的 Problem-solving 能力,能将“模型指标不升反降”精准拆解并定位根因。 加分项: 1. 拥有 Jetson / ARM / 嵌入式 AI 推理极致优化经验。 2. 有流式模型(Streaming)、Chunked inference、端云一致性治理经验。 3. 熟悉 FSDP / DDP / DeepSpeed 及混合精度训练。 4. 做过端侧语音、视觉、边缘 VLM 或轻量多模态模型。
智元机器人去官方页面投递 →