职位描述
1. 具有代码技术、vibe coding和Agent技术。
2. 搭建与优化数据Pipeline,完成多源文本、行业文献、知识库数据的清洗、结构化与质量治理,保障训练数据集高质量。
3. 参与RAG知识库、知识图谱的搭建迭代,开展文本梳理、术语对齐、实体关联等工作,夯实大模型知识底座。
4. 联动业务与产品团队,落地大模型能力至智能检索、知识问答、企业服务等场景,持续优化语义匹配与用户检索效果。
5. 跟进LLM、Agent、MoE等前沿技术,落地创新方案,推进业务场景技术迭代。任职要求
1. 计算机、人工智能、数学、图书情报、信息管理、知识工程等相关专业在读,硕博优先,优秀本科可投。
2. 熟悉PyTorch等任意深度学习框架,具备基础代码开发与数据处理能力。
3. 了解Transformer、大模型训练流程,有NLP、信息检索、知识图谱、文本挖掘相关经验优先。
4. 对数据质量敏感,具备文本结构化、信息分类、知识梳理能力,有数据集、知识库搭建经验加分。
5. 有模型训练、知识图谱构建、文献数据处理、开源项目或竞赛经历者优先。
6. 可立即到岗,每周出勤4天,可长期实习4-6个月,做事严谨、逻辑清晰。