岗位描述
岗位职责:
1、负责AI服务器集群、GPU服务器、存储及网络设备的日常巡检、监控、故障排查和应急处理,保障集群稳定运行。
2、负责服务器上架、下架、布线、BMC配置、操作系统及驱动维护,并协助处理GPU、硬盘、内存、网卡等硬件故障及售后维修。
3、负责集群资源、设备状态、容量和故障情况的统计分析,完善监控、告警、巡检和运维文档。
4、负责服务器、GPU、网卡、硬盘、内存、线缆及备件等高价值硬件资产的入库、出库、调拨、借用、盘点和台账维护。
5、建立并维护设备序列号、机柜位置、配置信息、保修状态及备件库存等资产信息,确保账实一致。
6、协调供应商、机房及内部使用团队,跟进设备采购、到货验收、维修、更换和报废等事项。
任职要求:
1、计算机、网络、通信、电子信息等相关专业本科及以上学历。
2、具备2年及以上服务器、数据中心、集群或网络运维经验,有GPU/AI算力集群运维经验者优先。
3、熟悉Linux系统运维,具备Python或Shell脚本能力,能够进行基础自动化运维和问题排查。
4、熟悉服务器硬件、BMC/IPMI、网络、存储等基础知识,能够独立定位常见软硬件故障。
5、了解NVIDIA GPU服务器、CUDA/驱动、InfiniBand/RoCE或高速以太网、分布式存储等技术者优先。
6、具备硬件资产、备件或仓储台账管理经验,工作细致,能够妥善管理高价值设备。
7、责任心强,具备良好的沟通协调能力,可适应必要的现场支持和故障应急处理。
加分项:
有Slurm、Kubernetes、Ansible、Prometheus/Grafana、DCGM、OFED、CMDB或资产管理系统使用经验者优先;有GPU服务器、IB网络或高价值电子物料管理经验者优先。