锦鲤求职

众安集团

【技研】SRE高级工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作职责:

- 负责业务全链路运维保障,涵盖系统、网络、容器、中间件、数据库领域,承担线上故障应急处置、预案建设与演练,完成故障复盘,迭代 SOP 与应急预案,形成问题经验闭环。

- 牵头处理跨域复杂线上故障,拆解排查路径、定位根因并推动问题闭环,运用大模型开展日志分析、故障诊断、脚本生成,提升问题处置效率。

- 搭建 SLI/SLO 稳定性量化体系,落地容量规划、容灾备份、流量调度,识别潜在运维风险并完成前置治理,利用 AI 能力实现流量预测、风险预判。

- 设计并落地指标、日志、链路、流量全链路可观测体系,建设分级告警与告警降噪机制,借助 AI 完成异常关联分析,缩短故障 MTTR。

- 推进运维标准化、自动化建设,沉淀 SOP 与交付规范,开发运维脚本与自动化工具,批量运维操作、简易故障自愈,探索大模型在运维场景落地,减少人工操作,降低人为变更风险。

- 负责云原生基础设施运维,开展资源效能分析与成本治理,通过 AI 完成资源画像、闲置资源识别、容量测算、弹性调优,提升资源利用率,实现成本压降。

职位要求:

- 5 年以上大规模分布式 SRE / 生产运维实战经验,具备互联网业务全链路稳定性保障项目经历。

- 精通 Linux 系统原理与故障排查,熟悉 TCP/IP、HTTP 等网络协议,能够使用 tcpdump/Wireshark 定位网络问题,了解云网络产品原理及业务适用场景。

- 熟练使用 Shell 脚本,掌握 Python/Go 至少一门开发语言,具备 SOP 体系建设经验,能够把运维实践沉淀为流程规范,并转化为自动化工具。

- 熟悉 Kubernetes 生产落地与原理,掌握 Nginx、HAProxy、Redis、消息队列、数据库等高可用架构设计与运维。

- 了解可观测体系整体设计,熟悉 Prometheus、Grafana、日志、链路追踪相关技术,熟悉云原生 CI/CD 流程,掌握灰度、蓝绿等发布策略。

- 具备较强风险意识,能够主动识别隐患并前置干预,善于使用 AI 工具实现运维提效降本,有 AIOps、AI 辅助成本治理相关经验优先。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →