岗位描述
岗位职责:
1.负责公司现有业务系统的日常运维保障,处理突发故障;
2.负责基于 Kubernetes (K8S) 和 Docker 的容器化平台的日常巡检、维护与扩缩容;
3.负责 GPU 计算节点及集群的日常维护,保障 AI 模型训练等算力任务的稳定运行;
4.负责业务服务**(含AI模型推理/训练服务)**的容器化部署、镜像管理及应用更新;
5.负责基础存储资源的管理与分配,以及与容器环境的挂载对接;
6.参与 AI 模型训练平台(开源或自建)的底层环境支持与维护;
7.协助完善基础监控体系,包含对 GPU 算力资源及训练任务的监控告警,处理日常运维告警。
任职要求
1. 2027届统招本科及以上学历,计算机、软件工程、人工智能等相关专业;
2. 掌握Linux操作系统基础操作,熟悉Python/Shell等至少一门脚本语言;
3. 了解Docker/K8s等容器化技术,具备基础的服务部署与调试能力;
4. 对大模型、机器学习相关基础技术有认知,了解GPU算力调度基本逻辑优先;
5. 具备良好的问题分析能力与跨团队沟通意识,工作严谨细致、责任心强;
6. 能够快速学习新技术,有云计算运维、开源项目实践经历者优先。