岗位描述
"1. 负责智算中心 GPU 服务器集群的日常运维管理,包括服务器硬件巡检、故障定位与报修跟进,保障算力资源稳定可用;
2. 负责国产 GPU(真武、昆仑芯、沐曦等)服务器的驱动、固件、算力组件的部署与版本维护;
3. 负责大模型训练与推理环境的部署与调优,包括模型权重管理、推理服务(vLLM/TGI 等)部署、显存与算力资源分配;
4. 负责模型管理平台的日常运维,包括模型仓库管理、镜像构建、容器编排(Docker/Kubernetes)、服务发布与回滚;
5. 负责智算集群监控告警体系的维护,覆盖服务器硬件、GPU/NPU 状态、网络、存储及模型服务运行指标,及时响应并处理告警;
6. 配合开发与算法团队完成大模型训练/推理任务的环境搭建、资源调度与问题排查;
7. 编写运维自动化脚本与操作手册,沉淀运维知识库,持续提升运维效率。" "1. 本科及以上学历,计算机、软件工程、通信等相关专业,3 年及以上 Linux 系统运维或 AI 基础设施运维经验;
2. 熟悉国产 GPU 服务器(真武、昆仑芯、海光、沐曦等)的基本架构与运维操作,了解 npu-smi、xpu-smi 等厂商管理工具的使用;
3. 了解大模型部署的基本流程,具备 vLLM、TGI、Ollama 等推理框架的实际部署经验,理解模型量化、批处理、显存优化等基本概念;
4. 熟练使用 Docker 容器技术,了解 Kubernetes 基本架构与常用资源对象(Pod、Deployment、Service 等),能独立完成容器化应用的部署与排障;
5. 熟悉 Linux 系统管理,掌握 Shell/Python 至少一种脚本语言,能编写自动化运维脚本;
6. 了解 TCP/IP 网络基础、分布式存储(Ceph/NFS 等)基本概念,具备网络与存储故障的初步排查能力;
7. 具备良好的问题分析与故障排查能力,责任心强,能接受非工作时间应急响应。" "1. 有国产算力栈实际使用经验者优先;
2. 了解 KubeFlow、Ray、Slurm 等 AI 任务调度框架者优先;
3. 有 Prometheus、Grafana、ELK 等监控日志平台搭建与维护经验者优先;
4. 了解 CI/CD 流水线(GitLab CI/Jenkins)与 Git 版本管理工具者优先;
5. 有智算中心、大模型训练平台或异构算力集群运维经验者优先;
6. 持有相关认证者优先。"