岗位描述
岗位职责:
1. 负责公有云服务、开发者社区、代码仓库 Repo 的日常运维、全链路监控、故障应急处置、容量规划、性能调优及稳定性专项治理工作。
2. 推进 AI Agent 自动化排障平台落地搭建,完成故障自动发现、根因智能定位、故障自愈全流程能力建设。
3. 落地常态化混沌工程演练体系,主动校验系统容错、容灾能力,提前暴露潜在稳定性风险。
4. 持续优化公有云、开发者社区、代码仓库的服务可用性、安全合规能力,保障整体开发者生态稳定平稳运行。
5. 落地 FinOps 成本治理机制,完成算力资源盘点、消耗管控、资源优化,实现云资源精细化控本增效。
职位要求:
1. 计算机科学、软件工程、人工智能等相关专业,本科学历及以上。
2. 拥有云平台运维、站点稳定性保障、故障处理相关校园/实习项目实操经验优先。
3. 熟悉监控、自动化运维、容器云、服务器架构等基础技术,了解 AI 工具、混沌工程、云成本治理相关概念优先。
4. 具备优秀跨团队沟通协调能力、团队协作意识,主动抗压,责任心强,具备故障应急复盘总结能力。
5. 具备熟练的英语读写能力,可查阅海外技术文档、英文运维资料。