岗位描述
职位职责:
1、服务器与算力架构规划:负责根据业务要求进行算力中心服务器架构设计、选型评估及算力资源池化方案,参与硬件配置评审,确保架构匹配算力需求。与模型研发团队对接,理解模型训练流程中的算力痛点,转化为服务器配置、网络拓扑、存储分层等架构方案。
2、算力平台软件运维与调优:负责服务器系统、K8S集群、MaaS平台、分布式存储及高速网络的软件运维,保障业务稳定运行。负责CPU/GPU算力环境的软件治理,建立算力效能基线,包括CUDA/cuDNN/驱动/容器配置、性能调优与故障排查。
3、算力分配与资源治理:设计多租户、多任务场景下的算力分配策略(队列、优先级、抢占、配额),提升GPU利用率与研发效率。搭建监控告警体系,对核心指标做可视化与预警,主导线上故障处理与复盘。
4、运维自动化:后续牵头搭建并带领运维团队制定运维规范、变更流程与应急预案,推动运维自动化与自愈能力建设。引入CI/CD、IaC、自动化测试等手段,实现训练环境快速交付与配置一致性。
5、硬件故障排查和预防,软硬件隔离、迁移及恢复策略,主导软硬协同的根因分析。
6、主动跟踪AI基础设施领域的前沿技术,结合业务痛点引入创新方案,持续提升算力效率与平台能力
任职要求:
1、本科及以上学历,计算机、云计算、网络工程、人工智能、运维相关专业优先
2、3年+大规模服务器集群运维经验,2年+K8s生产集群搭建运维经验,百卡GPU算力集群搭建/运维实战经验。
3、深入理解NVIDIA及昇腾架构,能独立解决CUDA、驱动、GPU Direct、容器GPU感知等软件问题。
4、熟悉典型训练框架(PyTorch/TensorFlow)的资源占用特征。
5、熟悉分布式训练网络需求,了解NVLink、IB、RoCE等高速互联技术,具备设计通信拓扑能力。
6、有AI场景或工业视觉平台运维经验优先,熟悉模型训练全流程对计算、存储、网络的需求模型。
7、具备服务器选型能力,熟练掌握算力、显存、存储带宽等需求评估方法,输出整机配置方案。
8、熟悉分布式存储(Ceph/Lustre/并行文件系统)及高速网络在AI场景的应用与调优。
9、具备跨部门沟通能力,极强的学习能力与责任心,对算力效率、成本有敏感度。