岗位描述
职位描述:
1.团队管理与日常运维:统筹IT运维团队日常工作安排,包括高性能GPU集群、分布式并行文件系统、跨平台网络通信系统的运维管理;监督团队完成基础设施监控、资源调度、故障排查及容灾演练,确保系统高可用性与稳定性。
2.运维策略与流程优化:制定并优化IT运维技术策略及标准化流程(如集群扩容、性能调优、安全加固等),推动自动化运维工具(如监控平台、日志分析系统)的开发与落地,提升运维效率。
3.跨部门协作支持:对接研发、产品、销售等部门,保障高性能计算资源(如超算集群)对仿真开发、项目交付的支撑;参与DevOps流程建设,协同完成软硬件一体化交付技术支持。
4.技术难题攻坚:牵头解决复杂运维问题(如异构计算架构适配、大规模数据传输瓶颈),组织技术复盘与知识沉淀,形成可复用的运维解决方案。
任职要求:
1.3年以上IT运维或高性能计算集群运维经验,1年以上团队管理经验。
2.熟练掌握Linux环境下的系统管理与脚本编程(Python、Bash),熟悉Slurm集群管理系统、分布式并行文件系统(如Lustre)的部署与调优。
3.了解OpenMP、MPI、CUDA等并行编程模式,熟悉Docker/Kubernetes容器化技术及CI/CD流程。
4.掌握集群并行通信组网基本技术,具备HPC异构并行系统运维经验。
5. 软技能:优秀的跨部门沟通与团队协作能力,能独立撰写运维报告及技术文档;适应快速迭代的研发节奏,具备较强的问题分析与决策能力。