Ivyea Jobs 5947 roles · 66 companies · 刚刚
DeepSeek · 大模型

服务端开发工程师

杭州 / 北京 社招 全栈开发/算法 工程开发

职位描述

【团队使命】 服务端开发工程师会与大模型研究员深入协作,深入到大模型的研究之中,共同构建用于推进模型智能边界的工程基建。在这里,我们离大模型研究前沿足够近,做出来的东西马上有来自研究一线的反馈。平台的可靠与好用,直接决定了大模型研究的效率和提升智能上限的速度。 这是一次长期主义的、大规模的投入,我们欢迎应届毕业生及两年以内经验的新鲜力量加入,同时也特别期待拥有2至10年工作经验的资深工程师——资深工程师将是本次招聘的重点关注对象(对特别优秀的候选人,年限要求可适当放宽)。本次招聘规模约150人,工作地点以北京为主,部分岗位或可选择杭州。 我们在寻找那个在一线钻研技术、热爱代码的你。 招聘方向【实习/全职】:大模型研究平台方向、Agent 框架组件方向、研发效率基建方向、DeepSeek API 方向、线上服务方向、数据工程方向 投递时不限方向,我们会根据你的背景与意愿确定具体方向,也可能在面试过程中随着互相的了解调整定位。 【你是谁】 一、你是团队里真正干活、解决问题的人 1.团队公认的高难度或高复杂性的问题,是你亲手解决的,或者技术方案是你拟定的。团队对你的认可,是因为工程技术过硬,交付技术成果能力强,而不是别的。 2.你不只熟悉自己团队内的垂直技术领域,对上下游团队的技术栈和工程架构都有理解。上下游团队一起定位都难以找到根因的问题,最后总是落到你手里,被你解决。 3.你能对方案的完备性做出预判,把技术和流程风险想在前面。会攻坚,也会做取舍。 二、你对技术本身有热情,不只是份工作 1.你更愿意用代码、技术方案和交付结果说话。 2.你乐于折腾技术:开源项目、独立开发的应用、个人服务器/NAS、啃技术书、黑客松,乐在其中。 3.你对 AI 的兴趣是技术式的:比别人更早把 AI 用进工作和生活,并且真的去了解和学习背后的技术,而不是停留在试用 AI 产品上。 三、在 Agent 时代,你能亲力亲为地提供更多高质量的产出 1.熟练使用 AI Agent 工具进行软件开发,在 AI 辅助下能够在没有直接经验的领域(语言、技术、框架等)写出有质量保证的代码。 2.你负责做复杂场景下的技术决策,即便把大量落地交给 AI,自己仍然亲手把握 Agent 做开发的设计与实现方向。 3.你对 Agent 的产出有批判性的思考。当 Agent 提供有问题的方案时,你能够敏锐地发现并及时介入。 【方向划分】 大模型研究平台方向 岗位职责 1.负责大模型研究平台的设计与研发,将研究流程与实际需求抽象为高效、可靠、可复用的平台能力。 2.深入研究员一线工作场景,主动识别问题、推动解决方案从定义到落地,而非仅承接和交付需求。 3.建设研究员直接使用的工具与工作台,降低复杂研究流程的使用门槛,提升研究效率与体验。 4.负责核心系统的架构设计与开发,持续提升平台的稳定性、扩展性、可观测性和运行效率。 5.推动研究流程的工程化与自动化,缩短研究想法从提出、验证到迭代的周期。 6.与研究、训练及基础设施团队紧密协作,定位并解决影响研究效率的关键问题,将有效方案沉淀为长期平台能力。

任职要求

1.具备出色的编程能力、系统设计能力和技术判断力,能独立负责重要系统的设计与落地。 2.具备丰富的研发经验,在大规模分布式系统、数据平台、任务和调度系统等方向有扎实积累。 3.扎实的编程与计算机基础,熟练掌握至少一种通用编程语言,深入理解分布式系统、存储与服务架构。 4.具备良好的抽象能力、Owner 意识和跨团队协作能力,能在快速变化的需求中推动复杂问题落地。 5.对技术有持续热情与好奇心,乐于探索新技术方向与工程方法,并将探索转化为实际成果。 6.在既有技术领域有扎实积累,能将复杂系统与平台建设经验应用到 Agent、LLM 及模型训练场景中。 加分项 1.参与过 LLM 训练、Post-Training、Benchmark/Eval、Agent 研发或模型研发平台建设。 2.实际参与过模型训练,具备数据挖掘、数据处理及模型评测经验。 3.深入理解主流 AI 工具链或开源项目,有相关实践或开源贡献。 Agent 框架组件方向 岗位职责 1.面向大模型训练、数据生产与评测,建设统一的 Agent 接入与运行框架,包括执行生命周期、上下文与轨迹管理、工具与环境接口、单 Agent 与多 Agent 运行、资源与预算控制等基础能力。 2.接入和适配不同 Agent 实现,打通模型服务、沙箱环境及训练评测平台,处理模型请求转发、消息与工具协议转换、配置与能力映射、事件上报和轨迹回传等关键链路。 3.设计与建设公共 SDK,为不同平台提供稳定、易用、可演进的接入接口。 4.梳理复杂系统的真实依赖和兼容边界,在不中断现有研究任务的前提下完成渐进式重构、接口演进和版本迁移。 5.与研究员及平台开发者紧密协作,从具体需求中抽象通用能力,并对技术方案、交付质量和长期维护性负责。 岗位要求 1.扎实的编程与计算机基础,深入掌握至少一门通用编程语言(Python/Rust/Go/C++ 等)。 2.开发或长期维护过可复用的库、框架、SDK 或公共接口,对接口设计、数据建模、序列化、扩展机制和版本演进有实际理解。 3.对正确性和代码质量要求高,习惯用测试、数据和可复核证据验证方案,而不只满足于功能能够运行。 4.有较强的问题定位和抽象能力,能够跨越模型、框架、服务和运行环境之间的边界解决问题。 加分项 1.有 Agent 框架、模型 API、工具调用、MCP 或多 Agent 系统经验。 2.有 RPC 框架、网络库、编译器、搜索推荐框架等基础软件开发经验。 3.熟悉异步并发、分布式系统、容器与沙箱、状态持久化或故障恢复。 4.熟悉 tokenizer、模型消息格式、大模型训练、强化学习或评测链路。 5.有高质量开源项目或大型开源基础组件贡献。 研发效率基建方向 岗位职责 1.面向内部研发平台及中台系统,识别共性问题与需求,抽象并建设统一、可复用的基础组件与平台能力。 2.设计统一的数据模型、接口与流转规范,建设大规模数据管理能力,支持数据跨集群、跨环境的高效流转与统一治理。 3.结合公司发展阶段与研发需求,建设统一、易用的应用交付与 CI/CD 体系,支持构建、发布、灰度、回滚及多环境管理。 4.建立覆盖 Metrics、Traces、Logs、Profiles 的可观测与告警体系,提升异常发现、问题定位与稳定性治理效率。 5.推动运维与故障处理自动化,将常见问题的诊断、定位与修复经验沉淀为工具、工作流及平台能力,并探索 Agent 在自动诊断与 RCA 中的应用。 6.推动分散的平台能力逐步标准化与自动化,减少重复建设,持续提升研究与研发效率。 岗位要求 1.本科及以上学历,计算机或相关专业。 2.具备扎实的编程能力,熟练掌握至少一门编程语言,并有分布式系统设计或研发经验。 3.熟悉 Linux、容器与 Kubernetes,具备基础设施建设或生产环境运维的一线经验。 4.参与过数据平台、CI/CD、应用交付平台、PaaS 或内部开发者平台的建设,并在至少一个方向有深入理解。 5.熟悉 Prometheus、Grafana、OpenTelemetry 等常见技术,能结合指标、链路、日志与性能数据定位复杂问题。 6.具备分布式系统故障诊断与稳定性治理能力,能深入分析 CPU、内存、网络、I/O 等系统层问题。 7.具备良好的抽象能力、系统思维与工程化意识,能将不同团队的共性需求及重复性工作沉淀为可长期演进的平台能力。 8.具备较强的 Owner 意识与跨团队协作能力,能推动复杂平台项目及基础设施规范落地。 加分项 1.参与过大模型研究平台、训练平台或相关研发基础设施的建设。 2.有大规模数据管理、跨集群数据流转或数据基础设施相关经验。 3.有平台能力从零到一建设,或推动多个团队统一技术方案的经验。 4.有 Agent 在运维自动化、故障诊断或 RCA 场景中的实践经验。 5.对 AI Native 平台建设有自己的思考,能将已有的平台工程经验应用于 Agent、LLM 与模型训练场景。 DeepSeek API 方向 岗位职责 负责 DeepSeek API 服务的全链路研发工作,将前沿模型科研成果通过稳定、高效的 API 输送给全球开发者与海量用户: 1.高可用服务架构:直面超大规模 API 服务挑战,持续优化全链路性能,打造高可靠、低延迟的大模型 API 服务。 2.全链路可观测性建设:建设 API 调用链路的可观测与告警体系,提升异常发现、问题定位与稳定性治理效率,确保服务始终处于可运维、可治理的状态。 3.与研究员深度协同:与研究员紧密协作,将最新的模型能力快速转化为可调用的 API 服务,与内部推理框架共同演进,让工程与科研相互驱动。 岗位要求 1.计算机相关专业背景,熟练掌握常用数据结构与算法,具备扎实后端编程基础。 2.熟练掌握 Rust/Golang/Python/C++ 等至少一门编程语言,代码风格良好,具备优秀的系统设计和抽象能力。 3.了解高并发、分布式系统基本概念,对数据库、缓存、消息队列、负载均衡等常用技术组件有落地经验。 4.有自驱力,具备优秀的技术品味和技术热情,有责任心、肯钻研,能够积极主动地跟进研究团队的最新进展,并转化成线上高可用的功能。 加分项 1.有过大型高可用、高并发业务系统的开发经验。 2.在大型开源软件中有深度贡献,或有优秀个人开源项目。 3.了解大模型基本原理,对大模型推理细节感兴趣。 线上服务方向 岗位职责 负责 DeepSeek 线上服务相关的各类研发工作: 1.负责数千万日活用户的大模型应用的架构设计与持续迭代。 2.持续探索新技术,优化代码效率和资源占用、网络与数据库性能,保障服务的可靠性、可扩展性、可维护性。 岗位要求 1.具备扎实的计算机基础和编程能力,熟练掌握 Rust/Golang/Python/C++ 等至少一门编程语言。 2.了解高并发、分布式系统基本概念,对数据库、缓存、消息队列、负载均衡等常用技术组件有落地经验。 3.具备良好的学习能力和开拓创新精神,有责任心,积极主动,肯钻研。 加分项 1.有过大型复杂业务系统的开发经验。 2.在大型开源软件中有深度贡献,或有优秀个人开源项目。 数据工程方向 岗位职责 数据工程团队服务于从模型训练到线上服务的各个环节。每个环节的数据流都需要高效、稳定、可靠的数仓基建作为支撑。它是加速模型研究与保障线上服务的关键基础设施。 根据业务需求和个人专长,你将承担以下一个或多个职责: 1.负责数据管道的设计、开发、部署与日常运维,主导数据全链路的落地上线。 2.深入业务场景,使用各类流处理、批处理框架,开发高稳定性的实时、离线数据流。 3.负责收集、清洗、加工业务数据,保障数据质量与口径一致性。 4.协助业务团队,开发正确、高效、稳定的数据处理任务。 5.站在业务视角,主动发现现有计算任务和数据架构中的瓶颈,提出并落地关于性能提升、链路稳定性、资源优化的解决方案。 岗位要求 1.本科及以上学历,计算机或相关专业,有数据开发/数据工程/数仓建设等数据相关经验。 2.除 SQL 外,熟练掌握至少一种编程语言。 3.熟练掌握如下一种或多种方向: ·Spark、Flink 等在离线框架任务的开发与日常调优,有实际的线上任务排错经验; ·Kafka 等消息队列的使用与性能特性; ·ClickHouse / DuckDB / StarRocks / Doris / TiFlash 等至少一种 OLAP 引擎; ·Iceberg / Delta Lake 等数据湖技术,Parquet / Avro / Arrow 等至少一种数据格式的原理与应用; 4.熟悉数仓建模理论,有扎实的 SQL 功底,能独立完成从埋点日志到业务指标的数据建模。 5.有自驱力,具备优秀的技术品味和技术热情;有突出的 Owner 意识和沟通表达能力,能清晰梳理复杂业务需求。 加分项 1.参与过 C 端业务数仓落地项目。 2.深入理解训练研究需求,具备大规模模型训练数据治理经验。 3.对任一主流 OLAP 引擎底层执行模型有了解、对底层分布式系统架构(存储、计算原理)有深刻理解。 4.熟悉或关注 DuckDB / RisingWave / DataFusion 等现代大数据生态。 立即投递