锦鲤求职

蚂蚁集团

蚂蚁数字科技-数科技术部-平台稳定性工程师 (Platform & Stability Architect)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1. 承担平台架构负责人职责,主导全球化多云基础设施架构设计,解决多云运维管理、数据主权与合规隔离等复杂问题;
2. 负责核心云原生底座(K8s、服务网格、中间件)的规划、版本演进与高可用架构设计,保障 SaaS 平台在全球商业化场景下的极致稳定与弹性伸缩;
3. 搭建以“客户体验为中心”的 SRE 稳定性体系,制定并落地跨区域 SLA/SLO/SLI 指标;
4. 主导全链路稳定性治理:从可观测性体系建设、告警降噪与疲劳度治理,到容量规划与全链路压测,确保平台能扛住突发商业化流量洪峰;
5. 负责新兴海外市场站点的从 0-1 基建落地,主导多云/多区域的部署架构、网络打通(跨域专线/加速)、安全合规接入。统筹实施容灾演练(DR Drill)与混沌工程(Chaos Engineering),确保海外业务在极端故障下的快速恢复与业务连续性;
6. 从商业化盈利视角出发,建立按区域、按业务线的精细化云成本(FinOps)看板与治理体系。推动资源利用率优化、预留实例(RI)策略、弹性架构改造,实现全球规模化部署下的“降本增效;
7. 研发内部平台工程工具,赋能业务研发团队实现“自助化、一键式”的环境交付与运维,降低出海业务的试错成本。

岗位要求
1. 背景与经验:计算机或相关专业本科及以上学历,6 年以上平台工程、SRE 或云原生架构经验;有全球化/跨团队协作、支撑大规模商业化产品出海经验者优先;
2. 云原生与多云架构:精通 K8s 核心架构(网络 CNI、存储 CSI、调度、Service Mesh 等),具备 EKS/GKE/ACK 等大规模生产级集群的架构设计与运维实战经验;深入掌握 Terraform、Helm、ArgoCD 等 IaC 及 GitOps 工具链;
3. 云厂商与网络:精通主流公有云(AWS 优先,或阿里云)与核心网络(VPC、负载均衡、DNS、混合云互联)架构,熟悉多地域(Multi-Region)容灾与高可用网络设计;
4. 编程与工程化:熟练掌握 Go/Java/Python 中至少一门语言,具备将运维工具化、产品化的工程能力;具备优秀的系统设计能力和技术文档撰写能力;
5. 故障处理与复盘:具备主导 P0/P1 重大线上故障应急响应与事后复盘(Postmortem)的能力,有强烈的“责任闭环”意识,能够推动系统性改进,防患于未然;
6. 职业素养:责任心极强,抗压能力强;具备强烈的商业化敏感度与客户服务意识,在高压力与高复杂度的全球化业务背景下,能保持快速响应与果断处置。

加分项(强烈期望 Outbound/Biz 视角的候选人具备以下经验):
● 有海外多区域站点建设经验,熟悉东南亚、中东、欧洲等市场基础设施特点;有 PCI DSS、SOC 2、GDPR 等金融/安全合规审计或架构整改支持经验;
● 有 FinOps / 云成本治理实践经验;
● 有 GPU 集群运维、大模型推理服务部署或算法工程化经验。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →