岗位描述
岗位职责
岗位职责:
1、使用标准化压测工具,对新上架的GPU服务器进行批量性能压测(包含NCCL allreduce、HBM、网卡、磁盘等基线测试),判断机器是否达到交付标准。
2、压测过程中识别硬件报错信息,根据报错内容准确判断故障部件(如GPU、内存、CPU、网卡、硬盘、主板等),并按流程报修给维修工程师。
3、跟踪维修全过程,对接RMA返修流程,负责故障恢复闭环,维修完成后进行复测验证。
4、配合二线团队完成服务器固件与驱动的批量变更验证(BIOS、BMC、网卡固件、GPU驱动等)及灰度发布后的回滚操作。
5、规范整理维修记录台账,记录故障现象、更换部件、返修单号、复测结果等关键数据,定期输出测试覆盖率、问题率等基础统计报表。
岗位要求
任职要求:
1、熟悉Linux操作系统,能熟练使用常用命令查看系统日志、硬件信息和网络状态(如dmesg、nvidia-smi、lspci、ipmitool、ethtool等)。
2、具备基础硬件故障识别能力,能根据常见报错判断故障方向
3、了解GPU服务器常见硬件组成(GPU、CPU、内存、SSD、网卡、电源等)。
4、有服务器产线测试、硬件维修或数据中心现场运维经验。
5、了解NVIDIA HGX系列(A100/H100等)服务器架构;能看懂SEL、MCE等硬件日志;有RMA返修流程对接经验;具备基本Shell脚本阅读能力。