岗位描述
岗位职责
1、使用标准化压测工具,对新上架的GPU服务器进行批量性能压测(包含NCCL allreduce、HBM、网卡、磁盘等基线测试),判断机器是否达到交付标准。
2、压测过程中识别硬件报错信息,根据报错内容准确判断故障部件(如GPU、内存、CPU、网卡、硬盘、主板等),并按流程报修给维修工程师。
3、跟踪维修全过程,对接RMA返修流程,负责故障恢复闭环,维修完成后进行复测验证。
4、配合二线团队完成服务器固件与驱动的批量变更验证(BIOS、BMC、网卡固件、GPU驱动等)及灰度发布后的回滚操作。
5、规范整理维修记录台账,记录故障现象、更换部件、返修单号、复测结果等关键数据,定期输出测试覆盖率、问题率等基础统计报表。
岗位要求
1、专业技能:
熟悉Linux操作系统,能熟练使用常用命令查看系统日志、硬件信息和网络状态(如dmesg、nvidia-smi、lspci、ipmitool、ethtool等)。
具备基础硬件故障识别能力,能根据常见报错判断故障方向,例如:
GPU报错 → 判断GPU卡或散热/供电问题
内存ECC错误 → 判断内存条故障
网卡链路异常/丢包 → 判断网卡/光模块/线缆故障
磁盘I/O错误 → 判断硬盘或RAID卡问题
无法上电或POST卡住 → 判断主板/电源/CPU等方向
了解GPU服务器常见硬件组成(GPU、CPU、内存、SSD、网卡、电源等)。
2、综合素质:
责任心强,对压测质量和维修闭环负责,不放过任何异常。
主动意识好,发现异常能及时上报并主动跟进处理进度。
工作细致,维修记录表格填写规范、数据完整。
沟通表达清晰,能与维修工程师和二线团队有效协作。
虚心好学,愿意在实战中积累硬件故障排查经验。
3、加分项(非必需)
有服务器产线测试、硬件维修或数据中心现场运维经验。
了解NVIDIA HGX系列(A100/H100等)服务器架构。
能看懂SEL、MCE等硬件日志。
有RMA返修流程对接经验。
具备基本Shell脚本阅读能力。