岗位描述
岗位职责
1. 负责Kubernetes / Docker / Nginx / Kafka / Redis / RocketMQ / Zookeeper / ElasticSearch / Nacos / Rancher 等中间件集群部署、监控、巡检和运维,确保SLA达标。
2. 处理中间件告警和事件,主导故障应急响应,完成故障复盘与改进落地。
3. 遵循变更流程,编写变更SOP,满足业务部门需求,实施生产环境变更,保障业务系统稳定。
4. 开发和维护运维脚本(Python/Shell),实现批量巡检、日志分析、配置比对、一键回滚。
5. 优化监控告警体系,降低误报率,提升故障前置发现能力。
6. 为业务团队提供中间件技术支援。
7. 输出标准化技术文档。
岗位要求
1. 全日制本科或以上学历,985、211或双一流优先;
2. 具备Kubernetes、Docker、Prometheus私有化部署和运维能力,这是岗位核心要求。
3. 5年以上生产环境中间件运维和故障处理经验,独立运维过至少三类中间件,并理解其架构原理。
4. 熟练使用Linux系统及相关工具,具备OS参数调优和故障排查能力。
5. 具备Python/Shell脚本开发能力优先。
6. 强烈的责任心与故障快速定位能力,接受7×24小时oncall应急响应和节假日值班。