职位描述可选择以下一个或多个方向深入参与: 参与具身大模型统一训练架构建设,支持 VLA、世界模型、多模态生成模型及强化学习模型的接入、训练与验证。 参与分布式训练与性能优化,围绕并行策略、数据 IO、显存、计算和通信开展开发、Profiling 与性能分析。 参与规模化后训练系统建设,支持仿真、真机和世界模型 Rollout,以及轨迹数据管理、权重同步、模型版本管理与故障处理。 参与高性能推理和自动评测能力建设,支持大规模并发实验、仿真 / 真机评测、版本对比和回归检测。 复现并工程化落地前沿模型与算法,通过 Benchmark 完成正确性、效果与性能验证,沉淀测试、文档和可复用代码。任职要求1、计算机、人工智能、机器人等相关专业本科、硕士或博士在读,具备扎实的计算机基础和良好的学习能力。 2、熟练使用 Python 和 PyTorch,熟悉 Linux、Git 等开发工具,具备良好的代码能力和工程习惯。 3、理解深度学习模型的基本结构、数据流和训练过程,在分布式训练、大模型推理、强化学习系统、具身智能或性能优化中的一个或多个方向具备项目经验。 4、接触过 Megatron、DeepSpeed、FSDP、verl、RLinf 等框架中的一种或多种,能够阅读、调试和修改复杂工程代码。 5、具备主动分析和解决问题的能力,重视正确性、测试和代码质量;每周可实习4天及以上,连续实习3个月及以上。