职位描述
1、面向自研端侧、云侧模型,优化工具调用、办公生产力(Office)与 General Computer-Use 能力,推动 AI 在真实数字工作环境中有效完成任务;
2、参与数据—基础设施—算法—评测的研发闭环,实现模型在多轮交互、长程任务执行以及跨 Agent 运行框架等方面的泛化。任职要求
1、熟悉 Mid-training、SFT、RL 相关方法及训练框架,理解大规模数据与模型训练管线,具备分布式经验。在任务与环境合成、沙箱构建、Verifier 设计、执行模式优化、长轨迹信用分配等方向进行过相关实践。
2、具备扎实的工程实现能力与严谨的实验习惯,能够独立开展实验设计、训练调试、问题定位和结果分析,以可复现的实验与评测结果推动模型迭代。
加分项
1、有基座模型从业经验,对于模型训练有独到见解;
2、在任务与环境合成、自动化验证、Agentic RL 或长程任务优化方向,有代表性项目、研究成果或开源贡献。