The right data does not just improve models. It creates new capabilities.
随着基础模型规模不断扩大,单纯增加训练数据已经无法保证能力持续提升。
未来模型竞争的核心,将从“拥有多少数据”转向“是否能够构建持续产生高价值数据的能力增长系统”。
你将探索的问题包括:
什么样的数据能够真正激发模型的Reasoning、Coding和Agent能力
如何设计高质量Mid-training Data Recipe,实现能力定向增强
如何利用Synthetic Data、Self-play、Self-distillation生成模型需要的数据
如何通过数据回流和模型反馈,建立自动进化的数据闭环
如何衡量数据价值,并找到数据与能力提升之间的因果关系
你的工作将直接决定模型能力增长的方向
岗位职责
负责大模型Mid-training阶段数据算法研究,构建能力增强型数据体系。
设计和优化数据Recipe,包括数据筛选、数据混合、课程学习、合成数据生成等策略。
面向代码、数学、Reasoning、Agent、多模态等能力方向,构建高价值训练数据。
分析数据分布、数据质量与模型能力之间的关系,建立数据评估体系。
与算法训练、Evaluation团队协同,通过数据驱动模型能力持续提升。