锦鲤求职

紫光展锐

智能化运维工程师8246

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作职责
1. 统一监控体系建设

•设计并落地覆盖 网络、机房、服务器、存储 的一体化监控架构,构建指标(Metrics)、日志(Logs)、链路(Traces)全栈可观测性平台。

•主导监控工具链选型与自研,推进 Prometheus、Zabbix、Grafana等系统的规模化部署与高可用调优。

2. CMDB 规划与建设

•负责 CMDB 配置管理数据库的整体规划、模型设计及常态化运营,确保 IT 资产与配置数据精准、实时、完整。

•建立跨领域数据自动发现与消费机制:打通网络设备(SNMP/Netconf)、服务器(IPMI/Redfish/iDRAC/iLO)、存储设备及机房动环的自动入库链路。

•将 CMDB 作为监控、告警、变更、自动化、成本分析等场景的统一数据底座,推动消费侧应用。

3. 运维看板与可视化大屏建设

•构建面向不同角色(NOC 值班、领域专家、管理者、决策者)的运维看板与指挥大屏,整合网络拓扑、机房动力环境、服务器性能、存储容量等多维数据。

•使用 Grafana等工具,实现资源水位、健康度评分、SLA 合规率、告警风暴趋势等核心指标可视化。

•探索 3D 机房可视化、数字孪生展示,提升数据中心基础设施的可视化运营能力。

4. 智能化运维(AIOps)落地

•基于海量监控数据,开发并落地智能异常检测、趋势预测、告警收敛降噪、根因分析等算法模型,大幅降低告警噪音与平均发现时间(MTTD)。

•设计故障自愈策略,联动自动化平台实现网络链路切换、服务容灾、磁盘隔离等场景的闭环处置,缩短平均修复时间(MTTR)。

5. 告警管理与流程优化

•制定多领域统一的告警分级、抑制、升级与通知策略,对接 IT 服务管理(ITSM)系统,实现告警到工单的自动流转。

•定期复盘告警有效性,持续推进告警治理,确保每一条告警都具有明确可操作的处置路径。

6. 硬件运维标准化与跨品牌管理

•建立覆盖多品牌的服务器、存储设备运维标准,包括带外管理接入规范、固件/驱动版本基线、硬件故障诊断手册及备件更换流程。

•协同厂商技术支持和各领域运维工程师,完成设备巡检、健康检查、批量固件升级及生命周期管理,确保不同品牌设备运维的一致性。

7. 横向拉通与标准化

•协同网络、系统、存储、数据中心设施团队,制定监控标准化规范(采集对象、指标口径、标签命名、阈值模板),保障多领域数据可融合、可关联。

•推动监控与运维数据的治理,建设运维数据湖/数仓,支撑多维分析与 AIOps 算法训练。

工作要求
1.学历与经验

•计算机科学、通信工程、电子信息等相关专业本科及以上学历。

•8 年以上运维开发或监控系统建设经验,其中 3 年以上专注于大型数据中心基础设施监控或智能化运维领域。

2.服务器与存储品牌运维经验(必须项)

•服务器:精通主流 x86 服务器品牌硬件架构及运维,包括但不限于 Dell PowerEdge、HPE ProLiant、Lenovo ThinkSystem、Inspur、Supermicro 等,熟悉其带外管理系统(iDRAC、iLO、BMC)、RAID 配置、故障诊断面板及固件升级方法。

•存储:熟悉主流存储设备品牌及运维,包括但不限于 Dell EMC(Unity/PowerStore)、HPE Primera/3PAR、NetApp FAS/AFF、华为 OceanStor、Pure Storage 等,能够进行 LUN/卷管理、性能分析、控制器/磁盘故障排查及容量规划。

•具备跨品牌硬件统一纳管经验,能制定兼容多品牌的监控采集模板与自动发现规则,实现硬件级指标的标准化暴露。

3.CMDB 领域

•深刻理解 CMDB 架构与 ITIL 配置管理流程,有 Atlas、iTop、NetBox 或自研 CMDB 实战经验。

•精通数据模型设计、自动发现规则与 API 开放,熟悉网络、服务器、存储、机房设备的纳管技术。

4.监控系统与看板

•精通至少一种主流监控系统(如 Prometheus+Thanos/VictoriaMetrics、Zabbix、Nightingale、商业产品如 Datadog),具备 10 万+指标吞吐量系统的调优经验。

•熟练使用 Grafana 设计复杂看板,掌握 PromQL/LogQL/SQL 查询语言,有大屏可视化设计经验,具备前端(Vue/React)基础者优先。

5.领域技术覆盖

•网络监控:熟悉 SNMP、Syslog、NetFlow/sFlow、Streaming Telemetry、NETCONF 等,能监控路由器、交换机、防火墙、负载均衡器等全量网络设备。

•机房监控:掌握 DCIM/BMS 系统集成,熟悉动环监控(UPS、精密空调、温湿度、电力、漏水检测),Modbus/BACnet 等工业协议经验优先。

•服务器监控:精通 Linux/Windows 系统监控,带外管理(IPMI、Redfish、各品牌带外接口),物理机、虚拟机(KVM/VMware)及容器化(Kubernetes)环境的指标与日志采集。

•存储监控:理解 SAN(FC)、NAS、分布式存储、对象存储架构,可监控 IOPS、吞吐量、时延、容量利用率、磁盘/控制器健康状态等关键指标,并具备不同品牌存储的差异化监控适配能力。

6.AIOps 与开发能力

•具备真实的 AIOps 落地经验,熟悉异常检测、时序预测、告警聚合等常见算法,有使用 PyTorch/TensorFlow 或商业智能运维平台(如 Splunk ITSI、Dynatrace)的经验。

•扎实的编程能力,精通 Python 或 Go,能够独立开发监控采集器、告警插件与自动化脚本,有 API 集成开发经验。

7.软技能

•优秀的跨团队沟通与推动能力,能同时协调网络、系统、设施等多领域团队,达成监控标准共识。

•对运维数据治理有较深认知,善于用数据衡量运维质量。

【加分项】

•持有主流服务器/存储厂商认证(如 Dell Technologies Certified、HPE ASE、NetApp NCDA、华为 HCIP-Storage 等)。

•持有 CCIE、RHCA、AWS/GCP/Azure 专业级架构师认证。

•参与过开源监控或运维项目(如 OpenTelemetry、Nightingale、Grafana 插件)贡献。

•熟悉运维数据仓库技术栈(ClickHouse、Kafka、Flink),有海量指标/日志处理经验。

•有基础架构即代码(IaC)和自动化编排(Ansible/Terraform)的实践经验,以及通过 Redfish/Ansible 模块批量管理多品牌服务器的实战能力。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →