岗位描述
工作内容
1、云平台日常运维保障:负责公司混合云平台日常运维、突发故障排查、组件版本升级、平台性能优化,覆盖计算、存储、虚拟网络、云管、监控等核心模块,保障平台7×24小时持续稳定运行。
2、监控告警体系建设调优:牵头运维监控与告警能力搭建,完成告警收敛、降噪、分级治理,优化告警链路与通知机制,解决告警风暴、漏告误告问题,提升故障主动发现能力。
3、平台稳定性治理与故障压降:负责部门整体运维稳定性能力提升,落实线上故障管控;主导全量线上故障深度复盘、根因定位及闭环整改,输出改进方案,持续降低平台故障发生率与故障影响时长。
4、产品可运维性优化:从运维视角反向推动研发优化产品架构,补齐监控、日志、自愈能力,优化变更及运维流程,提升云平台原生可运维能力,降低日常运维与故障处置成本。
5、线上项目持续运营:负责线上云项目全周期持续运营,做好容量规划、日常巡检、运行状态管控,对接内外部业务及合规需求,支撑项目平稳迭代与常态化合规保障。
6、运维流程标准化:沉淀运维规范、故障预案及变更流程,推动运维工作标准化落地,协同研发、业务团队打通协作链路,提升整体运维交付效率。
任职条件
1、大学本科及以上学历,并取得相应学位,计算机、电子信息、通信工程及相关专业优先。
2、8年及以上云计算/运维相关工作经验,有大型OpenStack私有云落地及运维实战经验优先。
3、精通 OpenStack 核心组件(Nova、Cinder、Glance、Neutron等)原理及运维排障,熟悉整体云架构。
4、熟练掌握计算、存储、虚拟网络底层运维技能,理解虚拟化 KVM、分布式存储、SDN 虚拟网络技术原理。
5、具备团队统筹管理能力,能够合理安排运维团队日常工作、任务协调、跨部门沟通及问题闭环跟进。
6、熟练掌握 Linux 系统运维、Shell/Python 脚本编写,熟悉云监控、日志分析及自动化运维工具者优先。
7、具备良好的问题排查能力、抗压能力、责任心,有较强的服务意识和团队协作能力。