职位描述
岗位职责
1.参与科学文献相关的数据处理与知识抽取工作,包括文本解析、多模态信息抽取与结构化整理;
2.参与科学多模态大模型(VLM)的数据工程与算法研究,包括多模态数据对构建、指令数据设计、预训练/SFT/RL实验迭代;
3.在指导下参与科学文献数据的整理、分析与质量评估,支持OCR、图表解析、化学结构识别、多模态RAG等模块的落地;
4.参与科学文献Benchmark构建与评测体系设计,支持真实业务与项目需求;
5.视项目进展,参与AI4S相关的数据或算法探索性工作,支持模型与算法方向的进一步研究。任职要求
任职要求
1.在读本科高年级/硕士/博士研究生,计算机、人工智能、机器学习、NLP、CV或相关专业;
2.对大语言模型、多模态大模型、信息抽取或文本理解方向有浓厚兴趣;
3.具备扎实的编程能力,熟悉Python和PyTorch,了解基本的多模态或NLP算法;
4.学习能力强,做事踏实,能够按要求完成任务并持续优化;
5.具备主动思考和探索意识,愿意尝试新方法并与团队沟通;
6.每周工作至少4天,实习至少4-6个月,全职实习者优先。
加分项
1.有LLM、VLM、RAG、Agent或相关项目经验;
2.有科学文献、长文本或专业领域文本处理经验;
3.有知识抽取、信息抽取或文档智能相关经验;
4.有计算机视觉或多模态相关经验(OCR/图表理解/DocVQA等);
5.有研究型项目、论文或技术报告相关经验;
6.有ACM/Kaggle/天池等竞赛获奖经历;
7.是知名开源项目(GitHub/HuggingFace)的contributor。
实习收获与发展
1.参与真实的科学文献理解与知识抽取场景,而非教学型或Demo项目;
2.在实践中逐步理解复杂科学问题与AI4S项目需求;
3.表现优秀的硕士/博士实习生可获得转正机会;
4.有机会参与论文、技术报告或对外研究成果的产出。