锦鲤求职

洋葱学园APP(智能学伴)

运维工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 保障系统稳定:负责 Web 服务、微服务、数据库、中间件、K8s 集群及 AI 服务的稳定性建设,完善监控告警、故障定位、自愈与复盘机制,降低故障率和恢复时间。
2. 建设智能运维:基于大模型、RAG 和自动化工作流,落地日志分析、异常诊断、运维问答及自动化巡检,减少重复人工操作。
3. 负责云原生与 AI 基础设施:运维并优化 K8s、Docker、GPU 集群、大模型部署、推理服务及向量数据库,保障资源调度和服务稳定。
4. 打通 DevOps 流程:建设 CI/CD、自动化测试、灰度发布及回滚机制,规范发布流程,提升交付效率并降低上线风险。
5. 优化资源与成本:治理服务器、云资源、GPU、存储和带宽,持续提升资源利用率,定期输出成本与性能优化成果。
6. 完善运维规范:建设运维 SOP、应急预案、权限与备份规范,以及运维知识库和故障案例库,推动经验复用和问题根治。

岗位要求
1. 经验与基础:本科及以上学历,3 年以上互联网或科技公司运维经验;非纯桌面或机房运维。熟悉 Linux、网络及 TCP/IP,能独立排查系统、网络和服务故障。
2. 云原生与交付:熟悉 Docker、K8s 集群运维和调优,掌握 Helm、Jenkins 等 CI/CD 工具及灰度、蓝绿发布、回滚实践。
3. AI 运维:有 AIOps 或智能运维实践;熟悉 GPU 集群、大模型本地部署、推理服务及显存优化,了解 RAG、运维自动化工作流和向量数据库。
4. 数据库与中间件:熟悉 PostgreSQL、Redis、Kafka、ELK 等组件的部署、备份、高可用和调优,能处理慢查询、消息堆积及日志异常等问题。
5. 自动化开发:熟练使用 Python 或 Go,能独立编写运维脚本和自动化工具,并根据业务需要开发轻量工具或 AI 运维能力。
6. 工作方式:主动发现风险,具备故障止损、定位、复盘和根因治理能力,能持续改进系统与运维流程。
加分项
- 有 AIOps 或智能监控平台从 0 到 1 的建设经验;
- 有大模型训练/推理集群或 GPU 异构算力运维经验;
- 熟悉 LangChain、LlamaIndex、Dify 等框架并搭建过运维智能体;
- 有运维安全、等保合规或安全加固经验;
- 有可量化的集群优化、降本增效或自动化运维成果。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →