Ivyea Jobs 5948 roles · 69 companies · 刚刚
生数科技 · AI 应用

视频生成算法实习生 (数据/OCR)

职位描述

背景: 我们在训练文生视频基座模型。视频画面中的文字既是需要剔除的噪声(字幕、水印、台标、弹幕),也可能是需要描述的内容(招牌、路牌、屏幕显示等场景内自然文字)。本岗位负责把这两类文字区分开,并支撑数据清洗与打标。 职责: - 搭建并维护画面文字抽取链路:文字检测、识别、区域定位、语种判别 - 建立文字类型分类体系,区分硬字幕、软字幕、水印、台标、弹幕、场景内自然文字,并标注其位置、时间区间与视觉显著度 - 设计数据清洗规则:判定素材应剔除、裁剪还是保留,并评估规则在大规模素材上的召回与误伤 - 为视觉上显著的场景文字制定进入 caption 的描述规范,并产出标注 - 维护 badcase 集,持续评估 OCR 与文字分类在真实素材上的准确率,定位系统性错误

任职要求

要求: - 熟练 Python,能独立编写脚本处理大批量图像与视频帧 - 用过 PaddleOCR / EasyOCR 或同类 OCR 工具,理解检测与识别两个阶段 - 会用 ffmpeg 做抽帧、裁剪等基本视频处理 - 能看懂并使用 IoU、字符准确率、编辑距离等评估指标 - 细致,能把模糊的分类边界定义清楚并稳定执行(例如半透明台标与场景内广告牌如何区分) 加分: - 做过文本检测或识别相关项目(DBNet、CRNN、TrOCR 等) - 熟悉视频字幕结构与格式(时间轴、SRT / ASS),做过字幕提取或擦除 - 了解图像修复(inpainting),能实现水印去除 - 处理过多语种或艺术字、变形字等困难场景