锦鲤求职

小红书

AI Infra SRE 工程师(正式)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
负责司内AI平台和AI算力的日常运维、故障处理、资源管理和稳定性保障工作。
负责AI相关配套资源的运维和管理支持工作,与供应商对接问题,保证资源服务可用性。
建设算力/存储/网络/CPU 的 SLO 追踪与告警监控,推动利用率提升与低效治理。
参与SRE运维平台建设,集成多集群的服务监控、资源管理、可观测等能力和定制化需求开发。
保障 Dots 大模型推理服务高可用,覆盖部署、升级、发布准出、容灾演练全流程。

岗位要求
本科及以上,计算机相关专业,5 年左右 SRE / 运维 / 基础设施研发经验;
精通 Linux / Kubernetes/网络等基本知识,熟悉主流云厂商云服务与控制台操作
熟悉至少一种以上开发语言(Python/Shell/Go),具备独立开发运维平台或自动化工具的能力;
熟悉 GPU 基础知识(型号、算力、显存、GPU 网络),有故障发现和排障能力;
对大模型推理服务的调用全链路有清晰认知和运维经验;
具备 SLO / 容量规划 / 变更管理 / 故障复盘等 SRE 方法论意识,沟通推动能力强。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →