岗位描述
工作内容
1. 负责AI算力中心及GPU集群的日常运维与监控,保障7×24小时稳定运行。
2. 负责算力服务器、GPU卡、存储集群、高速网络等硬件的状态监控与故障处理。
3. 参与算力调度平台优化,协助完成资源分配、动态调度与容量规划。
4. 配合AI研发与大数据分析业务,提供算力环境部署与任务调度技术支持。
5. 梳理运维标准化流程与故障应急预案,输出运维报表与统计分析。
6. 跟踪AI算力及高性能计算前沿技术,输出技术调研与优化建议。
任职条件
1. 党员优先,品行端正,责任心强,作风严谨。
2. 掌握计算机底层、高性能计算或人工智能基础理论,了解GPU算力与并行计算基本原理。
3. 熟悉Linux常用命令及Python/Shell脚本,具备基础自动化运维能力。
4. 了解主流AI框架(TensorFlow/PyTorch)的使用场景与训练流程。
5. 对AI算力运维有浓厚兴趣,有相关竞赛或科研项目经历者优先。