职位描述
1、音频预处理与解码:负责原始音频的元数据探测、抽轨、重采样、声道处理、音视频分离对齐。优化音频解码与加载,保证大规模任务的吞吐与稳定性;
2、源分离与语音切分:设计并落地人声 / 音乐 / 环境音分离、VAD / 说话人分离、Active Speaker Detection(ASD,判断画面中谁正在说话)、切点截断检测(避免腰斩台词)。建立切分与对齐评估,持续压误切、漏切、截断语音;
3、音频理解与结构化标注:接入 VLM 做音视频 caption、语义打标;接入语种识别、音质评估、音画同步等音频算子。保证标注 schema、token 用量、失败重试可统计、可回放。任职要求
1、音频信号处理 / 语音 / 机器学习等相关专业;具有语音、音视频处理或大规模数据生产经验;
2、精通 Python;熟悉 PyTorch 推理落地(加载、batch、混合精度、OOM 降级);
3、熟悉音频基本处理:FFmpeg / ffprobe、抽轨、重采样、声道布局、音画时间对齐;有过长音频或直播流踩坑经验更佳;
4、做过至少一类音频模型生产化:源分离 / VAD / 说话人分离 / Active Speaker Detection / 语种识别 / 音质评估 / 音画同步 / VLM 打标中的若干项;
5、熟悉 Active Speaker Detection(音画联合判断当前说话人),有相关模型落地或数据生产经验;
6、加分项:说话人分离 / VAD / ASD / 切点安全的论文或生产经验,有人工标注对齐、failure mode 分析;VLM 音视频打标:prompt 设计、结构化输出、限流与 token 统计;音画同步、参考音频数据构建、多说话人或重叠语音处理。