职位描述1、负责公司算力平台的全栈开发,涵盖算力资源调度、云端训练与推理引擎构建、分布式存储等核心模块; 2、设计与实现高性能、可扩展的算力调度系统,支持千卡级GPU集群的统一管理与动态资源分配; 3、构建云端分布式训练与推理引擎,优化大模型训练、微调及推理服务的效率与稳定性; 4、参与平台整体架构设计,推动系统高可用、可扩展性及自动化能力建设; 5、优化GPU集群的利用率与通信效率,包括NCCL/IB/RoCE等网络性能调优; 6、构建训练任务的生命周期管理能力,支持任务排队、优先级调度、弹性伸缩与故障自动恢复; 7、与算法团队协作,理解大模型训练与推理的工作负载特征,持续优化平台性能与资源效率。任职要求1、本科及以上学历,计算机、软件工程、人工智能等相关专业; 2、3年以上AI基础设施、云计算或分布式系统开发经验,具备从0到1搭建算力平台经验者优先; 3、精通至少一种后端开发语言(Go/Python/Java),具备扎实的工程化能力与系统设计思维; 4、熟悉容器化技术及资源调度框架,有千卡级以上GPU集群的资源调度与优化经验; 5、了解分布式训练框架及推理引擎,有相关集成优化经验者优先; 6、熟悉高性能网络及GPU通信原理,有相关调优经验者优先; 7、了解分布式存储及并行文件系统,有AI训练数据加速经验者优先;