锦鲤求职

思特威

AI集群运维工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:

1、负责AI服务器集群、GPU服务器、存储及网络设备的日常巡检、监控、故障排查和应急处理,保障集群稳定运行。

2、负责服务器上架、下架、布线、BMC配置、操作系统及驱动维护,并协助处理GPU、硬盘、内存、网卡等硬件故障及售后维修。

3、负责集群资源、设备状态、容量和故障情况的统计分析,完善监控、告警、巡检和运维文档。

4、负责服务器、GPU、网卡、硬盘、内存、线缆及备件等高价值硬件资产的入库、出库、调拨、借用、盘点和台账维护。

5、建立并维护设备序列号、机柜位置、配置信息、保修状态及备件库存等资产信息,确保账实一致。

6、协调供应商、机房及内部使用团队,跟进设备采购、到货验收、维修、更换和报废等事项。

任职要求:

1、计算机、网络、通信、电子信息等相关专业本科及以上学历。

2、具备2年及以上服务器、数据中心、集群或网络运维经验,有GPU/AI算力集群运维经验者优先。

3、熟悉Linux系统运维,具备Python或Shell脚本能力,能够进行基础自动化运维和问题排查。

4、熟悉服务器硬件、BMC/IPMI、网络、存储等基础知识,能够独立定位常见软硬件故障。

5、了解NVIDIA GPU服务器、CUDA/驱动、InfiniBand/RoCE或高速以太网、分布式存储等技术者优先。

6、具备硬件资产、备件或仓储台账管理经验,工作细致,能够妥善管理高价值设备。

7、责任心强,具备良好的沟通协调能力,可适应必要的现场支持和故障应急处理。

加分项:

有Slurm、Kubernetes、Ansible、Prometheus/Grafana、DCGM、OFED、CMDB或资产管理系统使用经验者优先;有GPU服务器、IB网络或高价值电子物料管理经验者优先。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →