Ivyea Jobs 11106 roles · 197 companies · 1 小时前
数坤科技 · AI 应用

【实习】大模型算法实习生

职位描述

岗位职责: 1、参与医疗大模型数据引擎与测评体系的建设,负责医疗相关数据的爬取、清洗和结构化处理等; 2、参与医疗大模型数据系统构建,包括知识库数据整理与构建、索引优化、数据检索等; 3、负责医疗 NLP 相关数据处理,包括文本预处理、命名实体识别(NER)、关键词抽取、摘要生成等; 4、搭建与优化医疗大模型的数据管道,包括数据存储、数据流管理等; 5、参与评测数据集的构建,优化数据标注流程,协助完成 LLM 评测任务的自动化。

任职要求

岗位要求: 1、计算机、人工智能、数据科学、生物医学工程、医学信息学等相关专业,硕士及以上学历,在校生优先; 2、熟悉 大模型(LLM)及 NLP 相关技术,对 RAG、LLM Agent、知识库问答系统 等有一定了解; 3、熟练使用 Python 及数据处理工具(Pandas、NumPy、NLTK、spaCy),有数据清洗、文本处理经验; 4、了解 向量数据库(如 Milvus)、语义检索、文本嵌入(Embeddings) 相关概念; 5、具备一定的工程能力,能够搭建数据处理或评测管道,掌握 SQL、DuckDB、Polars 等工具者优先; 6、具备良好的学习能力,对医学 AI 领域有浓厚兴趣,责任心强,能够独立完成数据处理任务,并与团队高效协作。 加分项: 1、具备 Web 爬虫经验,熟悉 Scrapy、Selenium、BeautifulSoup 或相关爬取技术; 2、有基于 LLM 的 RAG 系统、文档问答、医疗 NLP 相关项目 经验; 3、熟悉 LangChain、LLamaIndex 或其他 LLM 应用开发框架; 4、了解 医疗文本数据(如临床笔记、医学论文、药品说明书)处理方法; 5、具备大规模数据爬取、信息抽取、数据索引优化的经验; 6、了解 LLM 评测体系,有基准测试、数据对齐等相关经验。 实习收获: 1、参与医疗大模型数据体系建设,深入理解 RAG、LLM Agent 等大模型系统的核心数据处理流程; 2、参与爬虫、数据清洗、知识库构建,提升 NLP 及数据管道搭建能力; 3、深入医疗 AI 领域,积累大模型工程实践经验。
数坤科技去官方页面投递 →