Ivyea Jobs 5948 roles · 69 companies · 1 小时前
云知声 · AI 应用

大模型算法研究员

北京 社招 · 全职 研究 / 科学

职位描述

1、核心模型演进: 负责通用/领域大模型的全生命周期研发,包括超大规模指令微调(SFT)及偏好对齐(Alignment); 2、Agentic RL 研发: 针对智能体场景,研究并实现基于强化学习的决策模型。重点解决 Long-horizon Reasoning(长程推理)、Tool-use(工具调用)和 Self-correction(自我纠错)在复杂多轮交互中的表现; 3、对齐算法创新: 探索和落地超越 DPO/PPO 的最新对齐技术(如 GRPO, DAPO, Online RLHF),通过构建高精度的 Reward Model 提升模型在逻辑、代码及 Agent 任务上的胜率; 4、合成数据管线: 利用 Teacher-Student 架构,通过 AI-native 方法构建针对 Agent 动作轨迹、反思闭环的高质量合成训练集; 5、前沿跟踪: 紧跟 OpenAI o-series, Claude Opus 等最新推理模型技术路径,将长推理链、系统性思维等能力注入开源基座。

任职要求

学术背景: 计算机、数学、统计学或相关专业硕士/博士学位;在顶级会议(NeurIPS, ICLR, ICML, ACL)发表过高质量论文者优先。 1、模型训练功底: 具备Deepseek, Qwen, GLM 等主流开源大模型的实战微调经验,深刻理解 Transformer 架构及注意力机制的演进。等主流开源大模型的实战微调经验,深刻理解 Transformer 架构及注意力机制的演进; 2、强化学习经验: 熟练掌握 PPO, DPO, GRPO等强化学习算法在 NLP 领域的应用,能够独立解决 RL 训练中的不稳定性、奖励函数偏移(Reward Hacking)等挑战; 3、Agent 实战: 熟悉主流 Agent 框架(如 LangGraph, AutoGPT,ClaudeCode),有实际处理过评测集优化经验者优先; 4、工程能力: 熟练使用 Python/PyTorch,精通分布式训练工具链(DeepSpeed/Megatron),具备千卡规模下的模型并行、流水线并行调优经验。