岗位描述
职位描述
1. 大规模数据中心底座运维: 负责数据中心服务器、网络、存储等物理基础设施的规划、建设、日常高可用运维与架构演进。
2. 裸金属自动化交付: 研发与优化裸金属(Bare Metal)自动化部署、配置及生命周期管理系统,实现物理资源的自动高效交付。
3. 可观测性: 持续提升对于底层硬件资源、网络、Kubernetes 集群组件、核心服务等的可观测性与监控告警,提升问题识别响应能力。
4. 故障自愈与容灾演练: 建设硬件故障自动隔离、节点驱逐与服务迁移的自动响应机制,设计组织各个层面以及系统整体的容灾演练。
5. 基于 AI 的管理与运维能力建设:构建新一代基于 AI 的 SRE 能力体系,提高运维效率、资源利用率、问题识别与排查能力。
职位要求
1. 教育背景:本科及以上学历,计算机、软件工程等相关专业优先。
2. Kubernetes 与云原生: 熟悉 Kubernetes 核心架构与工作原理,了解其底层组件,有 Kubernetes 二次开发或相关开源社区经验者优先。
3. 系统与编程: 熟练掌握 Go 等编程语言,具备扎实的 Linux 系统与网络基础,熟悉容器技术。
4. 硬件: 对于服务器硬件组件、GPU 、以及 Kubernetes 对底层硬件资源的管理使用有实际经验。
5. 加分项: 具备大型 AI 公司、互联网公司数据中心基础设施工作经验,在 AIOps 、DevSecOps 、FinOps 等领域有研究或实践经验者优先。