职位描述
背景:
我们在训练文生视频基座模型。视频画面中的文字既是需要剔除的噪声(字幕、水印、台标、弹幕),也可能是需要描述的内容(招牌、路牌、屏幕显示等场景内自然文字)。本岗位负责把这两类文字区分开,并支撑数据清洗与打标。
职责:
- 搭建并维护画面文字抽取链路:文字检测、识别、区域定位、语种判别
- 建立文字类型分类体系,区分硬字幕、软字幕、水印、台标、弹幕、场景内自然文字,并标注其位置、时间区间与视觉显著度
- 设计数据清洗规则:判定素材应剔除、裁剪还是保留,并评估规则在大规模素材上的召回与误伤
- 为视觉上显著的场景文字制定进入 caption 的描述规范,并产出标注
- 维护 badcase 集,持续评估 OCR 与文字分类在真实素材上的准确率,定位系统性错误任职要求
要求:
- 熟练 Python,能独立编写脚本处理大批量图像与视频帧
- 用过 PaddleOCR / EasyOCR 或同类 OCR 工具,理解检测与识别两个阶段
- 会用 ffmpeg 做抽帧、裁剪等基本视频处理
- 能看懂并使用 IoU、字符准确率、编辑距离等评估指标
- 细致,能把模糊的分类边界定义清楚并稳定执行(例如半透明台标与场景内广告牌如何区分)
加分:
- 做过文本检测或识别相关项目(DBNet、CRNN、TrOCR 等)
- 熟悉视频字幕结构与格式(时间轴、SRT / ASS),做过字幕提取或擦除
- 了解图像修复(inpainting),能实现水印去除
- 处理过多语种或艺术字、变形字等困难场景