职位描述RL框架优化:从训练、推理、环境交互、任务调度等角度,在不影响性能的前提下,优化RL训练效率; Agent框架优化:构建易用的、稳定的、高并发的agent框架;任职要求有知名Agent框架(Claude Code/Openhands/Qwen-Agent)开发/使用经验。