职位描述
【团队与岗位愿景】
在这里,你将参与构建生物医药大模型与知识推理系统,用最前沿的 AI 技术解决新药研发与生命科学领域的真实痛点。
【核心职责】
1、领域大模型研发与优化:负责生物医药大模型的垂直优化,包含语料构建、指令微调、RAG/GraphRAG 结合及工具调用,提升模型在复杂科学场景下的推理准确度与可信度(降低幻觉)。
2、多模态科学文档理解:研发面向论文、专利等多模态文档(文本、表格、图表、分子式等)的解析算法,实现复杂科学信息的高精度结构化提取。
3、生化实体抽取与知识挖掘:设计优化的 NER、RE 和实体链接模型,构建跨模态信息抽取 pipeline,实现多粒度实体(靶点、疾病、化合物等)及构效关系(SAR)、ADMET 信息的精准抽取与关联。
4、算法工程落地:构建高性能的 AI 推理与数据处理服务,推动算法能力在海量专利、文献及真实药物研发业务中的高效落地。任职要求
【任职资格】
1. 背景与经验
- 计算机、人工智能、计算生物学、化学信息学等相关专业博士学历(具备丰富工业界落地经验的优秀硕士亦可)。
- 具备 AI4Science、生物医药知识图谱、医疗/科学大模型、AIDD 等相关方向的研发经验。
2. 核心技术栈(满足部分即可)
- 大模型/深度学习:精通 Transformer 架构,有 LLM / VLM 的训练、微调(LoRA等)及部署经验;精通 PyTorch 及大规模分布式训练。
- NLP/多模态:熟悉信息抽取(NER/RE)、长文本建模、RAG 架构或多模态文档解析(OCR/图文对齐)。
- 化学/生物信息学:熟悉大分子/小分子表示方法(SMILES、三维构象等),熟练使用 RDKit 等工具处理分子数据者优先。
3. 行业理解力
- 具备良好的生物医药/化学基础知识(如靶点机制、PK/PD等),能与业务领域的科学家高效跨频沟通。
- 熟悉常用的生化公开数据库(如 ChEMBL、PubChem、UniProt、PDB 等)。
【加分项】
- 在顶会/顶刊发表过高质量论文,或有知名开源项目贡献者优先。
- 有实际的工业级生物医药大模型、智能药物发现平台、复杂专利/文献挖掘系统落地经验。
- 熟悉 BioBERT/ChemBERTa/AlphaFold 等生态圈,或有图神经网络(GNN)、分子生成相关经验。