岗位描述
岗位简介
本岗位为核心技术运维专家岗,聚焦公司大规模ToC业务需求、业务系统的稳定性建设、自动化运维体系搭建。主导运维效能升级与技术迭代,同时赋能团队技术能力提升。
岗位职责
1. 稳定性建设与故障治理
负责公司核心业务、服务器、中间件、数据库全链路稳定性保障,降低故障发生率与故障影响时长,保障业务连续性。
2.自动化与智能化运维建设
主导运维自动化平台、工具链的设计、开发与落地,基于Shell、Python、Go等语言开发运维、实现资源自动化交付、业务灰度发布,搭建覆盖主机、应用、接口、日志、链路、业务指标的全维度监控体系,提升运维智能化水平,降低人工运维成本。
任职资格要求
1. 学历与经验
本科及以上计算机,等相关专业,5年及以上大规模互联网/云计算行业ToC SRE运维工作经验,3年以上运维架构规划、体系搭建、故障攻坚经验,有大型集群、高并发核心业务运维专家,有运维开发项目经验者优先。
2. 核心技术能力
精通掌握Linux操作系统原理与运维调优,精通TCP/IP网络协议、网络架构运维;熟练使用Shell、Python、Go等进行运维开发,具备独立自研运维开发能力;精通Docker、K8s容器技术,熟悉容器集群运维、调度优化、故障排查。熟练掌握Jenkins、CI/CD流水线搭建、自动化部署落地,熟悉Ansible、SaltStack、Terraform等自动化运维工具。精通Prometheus、Grafana、ELK等监控日志组件,具备全维度监控体系搭建、告警治理、日志分析能力。熟练掌握MySQL、Redis、MQ等主流数据库与中间件运维、性能调优、故障排查。
3. 综合能力要求
具备极强的线上故障应急处置、根因分析与复盘能力,擅长疑难技术问题攻坚;具备良好的跨部门沟通协调能力与团队赋能能力,逻辑清晰、责任心强,能承受高强度业务保障压力。
4. 优先加分项
有大型互联网SRE、云厂商基础架构运维经验;有运维平台、监控平台自研落地经验;具备DevOps体系搭建、研发运维一体化落地经验;持有云计算、具备Go运维系统开发能力者优先。