职位描述
参与科学文献解析视觉模型算法的开发与研究,从非结构化的科学文献图像中,抽取结构化的信息,并用于下游更广泛的应用。内容包括且不限于文献版面识别、图表理解,表格解析,反应式解析,通用OCR等,对流程中某些部分算法进行深入探究,并将研究成果转化为学术论文。
职位职责:
1. 视觉模型训练各阶段方法设计与研究,解决科学文献解析任务中的问题和需求;
2. 参与规模训练数据集的构建,确保数据质量和多样性;
3. 进行模型性能分析,识别和解决训练过程中的瓶颈,优化推理效率。任职要求
1.拥有扎实的编程能力,精通至少一种编程语言,熟悉主流深度学习框架(如 PyTorch / TensorFlow 等);
2.对计算机视觉领域具有一定的理论基础与实践经验,熟悉常见视觉任务及技术路线,包括但不限于目标检测、实例分割、OCR等;
3.熟悉经典的模型结构(如 YOLO、RCNN、ViT等相关视觉模型),具备模型训练、调参与评估的能力;
4.优秀的文献阅读能力与良好的沟通协作能力;
5.每周出勤不低于3天,可以base北京/上海,亦可远程实习。
加分项:
1. 在CV领域发表过顶刊论文;
2. 熟悉多模态相关的算法和技术,具备多模态大模型训练经验,如Qwen-VL等;
3.参与过CV或多模态大模型相关重要开源项目、数据科学比赛等。