锦鲤求职

浙江文投

算力运维工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1.GPU集群日常运维。负责GPU算力集群(国产GPU)的日常巡检、监控和运维操作,保障集群稳定运行;执行集群监控告警的响应与处理,及时发现并排查硬件故障(GPU掉卡、ECC错误、温控异常等);维护集群操作系统环境,包括驱动安装、软件栈升级、系统补丁管理等;参与集群扩容、设备上下架等物理运维工作。
2.算力调度与资源管理。操作和维护基于Kubernetes和/或Slurm的算力调度平台,执行训练与推理任务的资源分配;处理用户提交的算力需求工单,完成资源配额调整、任务排队和优先级调度;监控GPU利用率、显存占用、网络带宽等关键指标,输出资源使用周报;协助优化调度策略,提升集群整体资源利用率。
3.大模型推理与训练运维。负责大模型推理服务的部署上线、版本更新和日常运维;监控推理服务性能指标(吞吐量、延迟、首token时间等),及时发现和解决性能退化问题;支撑大模型分布式训练任务的运行环境配置,协助处理训练中断、checkpoint异常、通信故障等常见问题;维护训练任务的可观测性看板,跟踪loss曲线、梯度范数、GPU利用率等关键指标。
4.国产GPU适配支持。参与国产GPU(华为昇腾、海光DCU、阿里真武等)的部署测试和适配验证工作;协助完成国产GPU软件栈(CANN、DTK、Neuware等)的安装配置和基础功能验证;记录国产GPU适配过程中的问题和经验,形成可复用的操作手册和FAQ文档。
5.文档与知识沉淀。编写和更新运维操作手册、故障处理SOP、巡检清单等标准化文档;记录典型故障案例和解决方案,建设运维知识库;参与值班交接和团队技术分享,促进知识流转。

任职要求
1.本科及以上学历,计算机科学、电子信息、网络工程等相关专业;2年以上Linux系统运维或高性能计算相关经验,熟悉常用系统管理工具(systemd、journalctl、top/nvidia-smi等),熟悉Kubernetes基础运维操作,了解Pod、Deployment、Service等核心概念,熟练使用Shell或Python编写运维脚本。
2.有GPU相关运维经验,熟悉NVIDIA GPU驱动安装、CUDA环境配置、nvidia-smi/GPU监控;了解至少一种推理框架(vLLM、TensorRT-LLM、SGLang等)的基本使用和部署流程;了解Prometheus、Grafana等监控工具的配置和使用;了解基本的网络知识(TCP/IP、DNS、负载均衡),有RDMA/InfiniBand经验或Docker容器化部署经验者优先。
3.了解国产AI芯片的基本产品线(华为昇腾、海光DCU、阿里真武等);有国产GPU相关学习或实操经验者优先考虑。
4.责任心强,具备良好的值班意识和故障响应能力,善于记录和总结,具有文档写作习惯,具备团队协作精神,能够与上下游团队顺畅配合,对AI基础设施技术栈有持续学习的热情。
5.具有以下工作经验者优先考虑:有百卡以上规模GPU集群运维经验。了解Slurm HPC调度系统基本操作;有智算中心、超算中心或云计算平台工作背景;熟悉分布式存储(Lustre、Ceph等)基础运维;持有CKA/CKAD、Linux RHCE等相关认证。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →