锦鲤求职

机器人

【AI Infra】基础架构工程师(SRE)(J12900)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、做什么:
负责 GPU 算力集群的调度、运维与优化,以及阿里云资源的维护与管理,为模型训练和数据处理提供稳定、高效、弹性的算力基础设施。

2、核心职责:
- GPU 集群(H20 等)部署、运维与资源调度系统建设
- 分布式训练环境搭建(NCCL 网络优化、RDMA 配置、Checkpoint 自动保存与恢复)
- 阿里云资源维护与混合云架构设计(弹性伸缩、成本优化)
- 集群级监控体系与告警策略,容量规划支撑算力增长

岗位要求
1、任职要求:
- 计算机/软件工程 等相关专业,本科及以上
- 熟悉 Linux 系统、网络(TCP/IP/RDMA)、存储原理
- 熟悉 Kubernetes,有 GPU 集群调度基础
- 了解阿里云/AWS 等公有云资源管理
- 熟悉监控告警体系(Prometheus/Grafana/ELK)

2、加分项:
- 大规模 AI 训练集群(千卡级)运维经验
- NCCL/MPI 分布式通信库与网络拓扑优化经验
- 基础设施即代码(Terraform/Pulumi)实践

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →