岗位描述
岗位职责:
一、算力平台日常运维保障
1.负责医疗 AI 中试基地算力集群7×24 小时稳定运行,包含 GPU、服务器、存储、网络等硬件设备巡检、故障排查、停机抢修,及时处理宕机、算力卡顿、存储爆满、网络延迟等问题。
2.监控算力负载、资源利用率、能耗、温度等指标,搭建可视化监控看板,对高负载、异常占用资源及时预警、调度优化,保障客户业务稳定运行。
3.管理算力机房环境、供电、散热、安防,定期硬件点检、备件更换,形成设备运维台账,降低硬件故障发生率。
二、算力资源运营调度管理
1.统筹算力资源分配,对接医院、药企、内部研发团队需求,按需分配训练、推理算力资源,制定资源预约、占用、回收标准化流程,提升整体算力使用率。
2.统计算力使用量、使用时长、客户资源消耗数据,输出算力运营报表,支撑算力计费、成本核算与业务定价。
三、算力平台软件与环境维护
1.负责算力集群操作系统、容器调度、分布式训练框架、驱动、AI 开发环境部署、升级、补丁更新。
2.维护数据存储池,配合数据团队完成数据集存取、迁移、备份,保障 150TB 行业数据集读写安全、高速稳定,定期数据备份与灾备校验。
3.处理训练任务报错、环境依赖冲突、分布式通信异常,优化训练流水线,缩短模型迭代耗时。
四、算力能力建设与流程规范
1.搭建算力运维标准化制度、操作流程、故障应急处置预案,完善开关机、资源调度、故障上报、机房准入等管理规范。
2.输出运维操作手册,对内培训研发、项目人员算力平台使用规范,减少人为操作导致的算力故障。
3.持续优化算力调度策略、节能方案、扩容规划,根据业务增长制定算力扩容方案,支撑全国多省份医疗业务扩容需求。
任职资格:
1. 计算机科学与技术、电子信息、通信工程、自动化、软件工程等相关专业本科及以上学历。
2. 具备3年以上算力或GPU集群运维、高性能计算平台运维经验。有医疗AI、人工智能、云计算行业算力平台从业经验者优先,有百卡级以上GPU集群日常运维与故障处置经验者优先。
3. 熟练掌握Linux系统(CentOS/Ubuntu等)的安装、配置、调优与排障,能熟练编写Shell/Python脚本实现自动化运维。
4. 熟悉Docker、Kubernetes容器与编排体系,能独立完成容器化AI训练环境部署、资源配额管理及Pod调度策略调优。
5. 熟悉NVIDIA GPU生态,包括CUDA、cuDNN、NCCL、NVIDIA Driver、Fabric Manager等组件的安装部署与版本兼容管理,了解NVLink/NVSwitch拓扑架构;熟悉至少一种主流分布式训练框架(如PyTorch DDP、DeepSpeed、Megatron-LM、Ray等)。
6. 熟悉Ceph、NFS、Lustre、GPFS等分布式存储方案,具备TB级数据集存取迁移、备份灾备的实操经验;熟悉RDMA(RoCE/InfiniBand)网络配置与排障,了解高性能网络拓扑与拥塞控制。
7. 熟练使用Prometheus+Grafana或同类工具搭建可视化监控看板,能对GPU利用率、温度、功耗、网络延迟、存储容量、机房能耗等指标进行采集与告警配置。
8. 具备服务器、GPU、交换机、PDU等硬件巡检、故障定位的实操能力,熟悉IDC机房环境管理规范。具备7×24小时运维保障意识,具备体系化思维,能独立搭建运维制度、操作SOP、应急预案等标准化文档;具备算力扩容规划、成本管控意识。
9.持有NVIDIA专业认证(如NCA/NCP)、Kubernetes认证(CKA/CKAD)、红帽RHCE等证书者优先;有AI中试基地、智算中心、超算中心从零到一算力平台建设经验者优先;了解医疗影像、药物研发等AI训练场景算力需求特征者优先;有大型模型(LLM)训练或微调工程实践经验者优先;有PUE优化、液冷散热管理、绿色数据中心相关经验者优先;持有数据安全相关认证(如CISP)者优先。