职位描述
1. 负责化学专利解析数据的深度清洗与质量校验,通过Bad Case分析与规则优化分子识别准确率;
2. 构建“金标”分子数据集,针对专利中的复杂化学结构(如马库什结构、手性异构体、盐型等)进行精确标注与校验,为模型训练提供高置信度基准;
3. 设计并验证化学后处理规则,将化学专家知识转化为可执行的算法逻辑,修正OCR错误、骨架识别偏移及立体化学翻转问题;
4. 参与化学数据质量体系建设,制定分子结构标准化、去盐及价态平衡校验的SOP流程;
5. 与算法团队紧密协作,对模型解析的中间产物进行归因分析,从数据侧驱动Parser模型的迭代升级。任职要求
1. 熟练使用 ChemDraw / MarvinSketch / RDKit / OpenBabel 等化学绘图与信息学工具;
2. 精通 Python,具备使用脚本进行化学数据批量处理、格式转换或自动化校验的能力;
3. 深刻理解有机化学命名法(IUPAC),精通 SMILES / InChI / InChIKey / Mol Block / SDF 等分子结构表示形式及其转换逻辑;
4. 有化学信息学、计算化学、药物化学或有机化学相关专业硕博背景,对立体化学(R/S构型、E/Z异构)有极高的敏感度;
5. 有“像素级”的数据纠错能力,能够快速识别并修正复杂的化学结构绘制错误(如价态异常、芳香性缺失等);
6. 需线下实习,每周到岗5天,可以实习三个月及以上。
加分项:
1. 理解马库什(Markush)通式结构的解析逻辑与枚举规则;
2. 有论文和专利数据挖掘或构建高精度化学反应/分子数据库的项目经验;
3. 熟悉 OCSR(光学化学结构识别) 技术原理,或使用过 MolVec / DECIMER / ChemGrapher 等工具。