岗位描述
岗位职责
1.负责公司公有云平台的日常运维、监控、故障响应与处理,保障平台SLA
2.熟悉主流监控和日志系统,如Prometheus, Grafana, Zabbix, ELK Stack等,能够搭建并定制监控告警体系
3.负责云资源(计算、存储、网络、数据库等)的生命周期管理,包括申请、审核、部署、变更、回收。
4.监控和分析云资源使用情况,进行容量规划、性能调优与成本分析,提出并实施优化建议,降低总体拥有成本。
5.实施云平台的安全基线配置,管理网络访问控制、安全组、密钥对等。
岗位要求
教育水平:本科及以上学历,计算机科学、软件工程或相关专业。
培训经历:具备相关的系统运维培训经历者优先考虑。
资格证书:持有相关的系统运维认证证书者优先考虑。
工作经验:有5年以上系统运维或网络运维工作经验者优先考虑。
知识技能:1、熟悉常见的操作系统,如Linux、Windows等。
2、具备系统运维和网络运维经验,熟悉服务器部署和配置。
3、了解云计算和虚拟化技术,如AWS、VMware等。
4、熟悉常用的系统监控和故障排除工具。
5、熟悉软件开发的流程和工具,如版本控制系统、集成开发环境等。
能力素质:1.精通至少一家主流公有云服务(腾讯云TCE、AWS、阿里云、Azure等)的核心产品与服务,具备云上架构设计、运维和排障能力。持有相关云专家认证者优先。
2.精通Linux操作系统(如CentOS, Ubuntu)的运维、性能调优及故障排查
3.熟悉主流监控和日志系统,如Prometheus, Grafana, Zabbix, ELK Stack等,能够搭建并定制监控告警体系
具备出色的故障排查和问题解决能力,能承受压力,对线上问题快速响应。
其他要求:/