锦鲤求职

天翼云

运维专家(SRE)4447

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作内容
故障定位与应急
    • 作为重大故障第一响应人,在 5-10 分钟内完成跨物理网络、虚拟网络、计算、存储等多域的快速定界;
    • 现场或远程指挥网络、虚拟化、操作系统、存储、研发等多专业团队协同作战,确保业务 30 分钟内止损。
    复盘与改进
    • 主导故障复盘,输出高质量 RCA 报告、改进计划,并推动落地;
    • 基于复盘结果,设计并落地自动化、平台化、可观测性提升方案,降低同类故障复发率 ≥50%。
    技术深耕与布道
    • 对物理/虚拟网络、虚拟化、Linux 内核、分布式存储四大方向中的 1-2 项达到“精通”水平(可深入代码层/协议栈),其余方向保持“熟练”;
    • 定期组织技术分享,沉淀故障库、SOP、Runbook,提高团队整体应急响应效率。
    日常运维与优化
    • 通过 IaC、CI/CD、Chaos Engineering 等手段持续提升资源池稳定性与弹性;
    • 参与容量规划、性能调优,保障 99.99% 以上可用性目标。

任职条件
计算机或相关专业本科以上学历,5 年以上大型互联网或云计算 SRE / 运维 / 平台工程经验;
    至少精通以下 1-2 个领域,具备源码级或协议级深度:
    • 物理网络:TCP/IP、BGP、EVPN、VXLAN、RDMA、SmartNIC、可编程交换机;
    • 虚拟网络:OVS/DPDK、SR-IOV、Calico、Cilium、Service Mesh、NFV;
    • 计算虚拟化:KVM/QEMU、libvirt、Xen、容器 Runtime、K8s 底层机制;
    • Linux 内核:调度器、内存管理、cgroups、eBPF、内核调试(ftrace/kdump);
    • 分布式存储:Ceph、Rook、分布式块/文件/对象存储、SPDK、NVMe-oF。
    对剩余领域达到“熟练”:可快速阅读日志、抓包、定位瓶颈并给出缓解方案;
    具备重大故障现场指挥经验(≥1 次 P1 级别)。
    具备出色的文字与语言表达能力:
    • 能在 1 小时内输出结构化故障快报;
    • 能在 24 小时内输出包含 Timeline、Root Cause、Action Item 的完整 RCA 报告;
    熟悉 Go/Python 任一脚本语言,能编写自动化工具或数据面/控制面补丁者优先。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →