锦鲤求职

思特威

AI集群运维实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

实习内容将结合个人基础与兴趣,在指导下安排具体、可执行和可验收的集群运维及设备管理任务。

岗位职责:

1、参与AI服务器集群、GPU服务器、存储及网络设备的日常巡检和监控,协助收集设备状态、告警、日志及容量数据。

2、协助完成服务器上架、下架、布线、BMC配置、操作系统安装、驱动维护及基础环境配置。

3、协助复现和排查服务器、GPU、硬盘、内存、网卡及网络连接等常见软硬件问题,整理故障现象和处理记录。

4、参与服务器、GPU、网卡、硬盘、线缆及备件的入库、出库、借用、调拨、盘点和台账维护,核对序列号、机柜位置、配置及保修信息。

5、使用Python、Shell或Ansible编写基础运维脚本,协助改进巡检、信息采集、配置检查和告警处理效率。

6、维护操作手册、巡检记录、资产台账和故障文档,与团队成员协作完成阶段性运维任务。

任职要求:

1、计算机、网络、通信、电子信息、自动化或相关专业本科及以上在读。

2、熟悉Linux基本操作和常用命令,能够独立完成基础软件安装、网络配置和日志查看。

3、掌握Python或Shell中的至少一种,能够编写和调试基础脚本。

4、了解服务器硬件、BMC/IPMI、网络和存储等基础知识,对GPU服务器及AI集群运维有兴趣。

5、工作认真细致,责任心强,能够规范记录和管理高价值设备及备件。

6、具备良好的动手能力、问题分析和沟通协作能力,可参与必要的现场支持。

7、能够使用Git维护脚本和文档,能够阅读基础英文技术资料。

加分项:

接触过NVIDIA GPU/CUDA驱动、InfiniBand/RoCE、Slurm、Kubernetes、Ansible、Prometheus/Grafana、DCGM、OFED、CMDB或资产管理系统者优先。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →