锦鲤求职

自变量机器人

AI平台SRE工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 负责 AICP 在云和 Kubernetes 上的可用性、性能、容量和灾备。
2. 建立 SLI/SLO、错误预算、告警、值班、事故指挥和复盘机制。
3. 负责 PostgreSQL 高可用、备份、PITR、恢复演练、性能和升级。
4. 负责 APISIX、Ingress、魚载均衡、DNS、TLS、路由、限流和流量切换。
5. 维护应用、微服务、外部依赖、日志、指标和追踪体系。
6. 维护 CI/CD、GitOps、生产发布、数据库迁移、配置和密钥变更。
7. 负责云资源运行、成本与容量,并通过IT流程使用RAM、VPC、DNS 和安全能力。
8. 推动研发补齐幂等、超时、降级、对账和可观测性。

岗位要求
1. 5年以上 SRE、云平台或后端生产运维经验,3年以上 Kubernetes生产经验。
2. 深入理解 Linux、TCP/P、HTTP、DNS、TLS、热载均衡和微服务故障模式。
3. 熟悉 PostgreSQL 备份恢复、复制、连接、锁、索引、VACUUM 和性能分析。
4. 熟悉 Prometheus/Grafana、SLS/ELK、OpenTelemetry 中至少两类。
5. 熟悉 APISIX、Nginx、Envoy 或云网关中的一类,理解灰度、限流和熔断。
6. 熟悉阿里云 VPC、RAM、ACK、RDS/自建数据库、OSS、SLS、负载均衡和 DNS。
7. 能够使用 Terraform、Ansible、Helm、Kustomize、GitOps 或同类工具进行自动化。
8. 具备生产事故、变更、容量、灾备和跨团队沟通经验。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →