锦鲤求职

中兴通讯

智算集群运维专家

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:

1. 智算集群独立运维与稳定性保障(核心职责)

负责大规模异构算力集群(包括GPU/NPU服务器、InfiniBand/RoCE高速网络、并行存储系统)的7×24小时日常运维、巡检与容量管理,对集群整体可用性(SLA)负责。

独立处理集群层面的复杂故障,快速响应并解决GPU掉卡、节点宕机、集群瘫痪、网络拥塞导致训练中断等重大问题,具备独立进行硬件级故障诊断与固件升级的能力。

2. 风险预防与深度优化

主导制定并完善集群的应急预案、风险排查机制和标准操作流程(SOP),通过巡检数据分析和主动运维,提前发现并消除潜在的系统性风险。

持续优化智算监控体系(如Prometheus+Grafana),对GPU利用率、温度、功耗、网络流量等全链路指标进行深度分析,编制专业分析报告并提出落地优化方案。

3. 自动化运维体系建设

利用Shell、Python或Go等语言开发自动化运维工具与脚本,实现集群批量部署、配置管理、故障自愈、日志分析等日常运维工作的平台化与自动化,提升运维效率。

参与算力调度系统(Slurm、Kubernetes)的运维与调优,优化资源调度策略,提升算力利用率和任务吞吐量。

4. 技术攻坚与协同

在重大故障处理中,作为甲方或业务侧的技术主导,与硬件厂商、IDC机房及研发团队高效协同,精准划定故障边界,推动问题根因修复,而非临时规避。

负责GPU服务器驱动、CUDA环境、NCCL通信库以及容器化环境(Docker/K8s)的配置、调优与版本管理。

任职要求:

1. 基本条件

全日制本科及以上学历,计算机、网络工程、电子信息、自动化等相关专业。

8年以上大型数据中心或云计算平台运维经验,其中至少最近2年以上大规模GPU智算集群或HPC集群的一线运维经验。

2. 核心技术能力

硬件与系统: 精通Linux系统管理与内核调优,熟悉主流GPU服务器(如NVIDIA DGX、浪潮、华为等)硬件架构,能独立诊断处理服务器主板、内存、GPU卡(含显存错误、NVLINK降级)、PCIe链路等硬件故障。

网络与存储: 深入理解InfiniBand或RoCEv2高速网络协议,具备处理网络拥塞、丢包等问题的实战经验。熟悉分布式存储(如Ceph、Lustre)的运维与调优。

调度与容器: 精通Kubernetes或Slurm算力调度平台的部署、运维与策略配置。熟悉容器化技术,能解决GPU透传、RDMA网络插件等容器化部署难题。

自动化与脚本: 熟练掌握Shell、Python或Go,具备独立开发自动化运维脚本及工具的能力。

3. 综合素质

独立作战与问题解决能力: 具备极强的责任心与抗压能力,能在高压环境下快速响应并独立解决复杂技术问题。

风险意识与文档能力: 具备敏锐的风险预判意识,擅长编写故障处理报告、应急预案及运维SOP规范文档。

沟通与协作: 具备与厂商进行技术博弈的能力,能基于底层日志输出清晰的故障证据链,推动外部资源高效解决问题。

4. 加分项

持有NVIDIA(如NCA)、华为、红帽等厂商相关认证证书者优先。

拥有万卡级AI集群建设或运维经验者优先。

熟悉国产GPU(如华为昇腾、摩尔线程)生态与运维者优先。

具备AI大模型训练框架(PyTorch/TensorFlow)分布式训练调优经验者优先。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →