职位描述
你将参与构建
Agent 训推框架维护:负责 Agent 训练与推理全链路框架的开发、优化与稳定性保障,支撑大规模模型训练实验的高效运转
Agent 沙箱环境稳定性:设计并维护 Agent 执行沙箱,保障代码执行、工具调用等复杂场景下的安全性、隔离性与可靠性
Agent 实验平台:构建支撑 Post-Train 团队日常实验的基础平台,涵盖实验管理、数据流水线、评测对比等核心能力
以下满足其一即可:
Agent 执行环境(Sandbox)基建与稳定性。你负责的不是单个模型服务,而是大规模 Agent 赖以运转的"地面":代码执行沙箱、容器与会话生命周期、路由与网络、镜像与预热、资源配额。任何一环抖动,上层所有 Agent 实验都会受影响。
Agent 训练/ rollout 框架与数据基建。包括 agentic rollout 框架、scaffold、terminal-use / browser-use / computer-use(非 GUI)环境与工具链、SWE 评测基建、Agent RL 训练链路、轨迹(ledger)采集与数据流水线等。
立即投递