岗位描述
岗位职责
1、负责分布式集群可靠、稳定、高效运行,参与服务运维与监控、应急响应、故障处理等;
2、制定和优化运维解决方案,包括但不限于高可用体系建设、故障自动定位、自适应容灾等;
3、致力于自动化运维平台建设,不断推动基础设施标准化和自动化;
岗位要求
1、本科以上学历,1年以上SRE或运维开发经验
2、熟练使用Docker,熟悉Kubernetes的使用、配置和运维管理。对集群底层原理(网络、调度、资源隔离等)有深入理解;
3、熟练使用prometheus、Grafana、Elastic等集中日志及运维监控工具,熟练掌握主流公有云产品的操作和使用;
4、熟练掌握一种开发语言,全栈开发经验者优先;
5、具备用户至上服务意识,有良好的责任感、团队合作精神以及沟通能力,勇于接受挑战、持续学习新技术、不断推动技术创新