岗位描述
岗位职责:
1.端到端负责GPU研发环境的运维管理,包括环境规划、部署、运维、优化
2.组织运维过程中的故障根因分析,形成闭环策略,并推动落地
3.主导K8s集群及业务系统运维架构和体系优化,推动云原生、微服务升级
4.完善全链路监控体系,建立智能告警,主导重大故障应急与复盘,落地故障管理SOP。
5.跟踪Aiops/agent、云原生领域前沿技术,结合公司业务场景进行技术选型与落地实践,持续完善K8s集群平台功能,推动团队运维智能化
6.跨部门协作,对接研发、测试团队,优化流程提升交付效率
职位要求:
1.8年+DevOps/运维开发经验,3年+公有云及K8s运维经验,有大规模服务器(含GPU)自动化运维经验
2.有三~五人团队管理经验者优先
3.对K8S有深入了解,能够有效提升容器调度优化效率
4.了解AIOPS技术栈,有实际操作经验优先
5.熟悉Linux系统,熟悉网络协议,具备扎实的系统、网络、存储知识,能独立解决复杂故障。
6.熟悉K8s及相关生态圈,有大规模K8s实战经验;熟悉GPU运维,有高算力及AI调度经验者优先。
7.熟悉主流监控工具,能独立搭建全链路监控,具备监控优化及问题排查能力。
8.了解掌握Python、Shell、Golang中等运维开发语言,熟悉Ansible,有自动化脚本开发经验。
9.熟悉SRE方法论,具备优秀的故障排查、根因定位及复盘能力。
10.具备良好的沟通协作与管理能力,责任心强、能抗压