岗位描述
岗位职责
1、负责 H200/B300 GPU 集群的部署、运维、监控和故障处理。
2、建设 Kubernetes、GPU Operator、驱动、CUDA、镜像、存储和节点管理体系。
3、负责 IB/RoCE、RDMA、NCCL、NVLink、NVMe 和 GPU 拓扑运维。
4、实现 PXE、烤机、健康检查、自动纳管、节点池和维修池。
5、建立 GPU、节点、网络、存储和推理单元的故障检测和自动隔离。
6、实现 Cell、部署单元、权重分发、节点迁移和资源回收。
7、建立 Prometheus、Grafana、OpenTelemetry、日志、告警和值班体系。
8、参与故障注入、主备切换、摘流、恢复和发布回滚演练。
9、完成领导交办的相关工作。
岗位要求
1、2 年以上 GPU 集群、HPC、云基础设施或 Kubernetes SRE 经验。
2、熟悉 NVIDIA GPU、CUDA、DCGM、NCCL、GPU Operator。
3、熟悉 IB/RoCE、RDMA、NVLink、PCIe、NVMe 和 Linux 性能分析。
4、熟悉 Kubernetes、Helm、Ansible、Terraform 或类似工具。
5、熟悉 Prometheus、Grafana、日志和链路追踪。
6、能处理 GPU 掉卡、XID、ECC、链路错误、节点故障和慢节点问题。
7、 优先条件
有 H100、H200、B200、B300 集群经验。
有 100 节点以上 GPU 集群建设或维护经验。
有 PXE、裸机自动化、并行文件系统和权重 P2P 分发经验。
有 7×24 值班、故障演练和高可用平台经验。