职位描述
1. 主导企业级知识底座建设: 负责 ToB 业务场景下核心知识库与 RAG(检索增强生成)系统的数据体系搭建,建立高效、高准确度的企业私有文档知识加工流水线;
2. 优化 Agent 落地效果: 针对 Tool Learning(工具调用)、Task Planning(任务规划)、Reflection(自我反思)等复杂智能体场景,设计并构建全链路的指令交互与多轮对话数据支撑,提升模型在 B 端业务中的实际交付表现;
3. 沉淀行业专家知识: 负责将结构化(数据库、API)与非结构化(文档、知识库)的企业核心资产转化为大模型可理解的高质量对齐数据,推进长文本检索、多源检索及拒答机制的落地;
4. 全链路数据精细化治理: 设计并实现自动化数据清洗、Chunk 切片优化、指令微调(SFT)样本及偏好(DPO/GRPO)数据的治理方案,通过实验指标驱动知识底座的迭代升级;
5. 支持 ToB 项目交付: 深入理解 B 端客户的实际业务痛点(如准确率要求高、容错率低等),与产品和交付团队紧密配合,确保模型与底座能力高效、高质地落地到客户生产环境中;
6. 技术前沿跟踪: 跟踪大模型知识工程、Agent 架构及自动化数据生产领域的最新进展,并结合 B 端实际场景进行落地和技术沉淀。任职要求
1. 人工智能、计算机、信息管理、软件工程等相关专业本科及以上学历,具备扎实的工程或技术研发素养;
2. 熟悉自然语言处理和大模型训练机制(如 SFT、DPO/GRPO 范式),深刻理解数据质量与分布对大模型在 B 端落地效果的关键影响;
3. 深入理解 RAG 与 Agent 核心原理,熟悉多轮对话、思维链(CoT)、工具调用及长文本检索的痛点,能针对性地制定评测集构建和数据对齐方案;
4. 具备扎实的工程与工具栈能力, 熟练使用 Python,深入理解 LangChain、LlamaIndex 等大模型应用开发生态,能够高效构建可扩展的数据加工与管理 Pipeline;
5. 具备良好的数据工程经验, 掌握常规的数据清洗、模板控制或自动化数据构建方法(如 Self-Instruct),能利用实验指标驱动数据策略优化;
6. 具备 ToB 业务理解力,具备良好的沟通与协同能力,能快速理解复杂的 B 端业务场景,并将业务逻辑转化为大模型数据与系统设计要求。
加分项
1. 有实际的 ToB 大模型项目落地或私有化部署经验,理解企业知识库与 Agent 在生产环境中的实际痛点;
2. 熟练掌握高级 Prompt Engineering 范式(如少样本、自我修正、多 Agent 协同模拟),能通过复杂 Prompt 引导模型生成高质量行业样本;
3. 有构建 Agent 工具调用轨迹数据、多 Agent 对抗/协作对话或复杂任务拆解数据的实战经验;
4. 有 RAG 链路优化经验,例如主导过高质量 Chunk-QA 对构建、负样本/干扰项设计或冲突信息对齐等工作;
5. 熟悉数据安全、脱敏、偏见识别、价值观对齐等 B 端合规处理流程。