岗位描述
岗位职责
岗位一:分布式存储 SRE 工程师(AIOps / 存储智能运维方向)
岗位职责
1、负责分布式存储业务集群的日常运行维护,参与线上值班、故障应急响应处理,保障存储底座的高可用与数据可靠性
2、推动存储监控体系演进,结合业务拓扑实现监控指标、服务日志等分析;探索 AI 算法与规则引擎结合的告警智能聚合、降噪与异常根因推导
3、设计并开发面向存储故障的智能化诊断 Agent,能通过变更、监控指标、知识库等自动化分析,将排错 SOP 转化为可落地的自动化分析与自愈能力
4、基于存储集群水位、IOPS、带宽等多维运行数据进行智能容量规划,持续优化弹性扩缩容机制与资源利用率,兼顾成本与性能冗余。
岗位要求
任职要求
1、扎实的计算机体系结构与操作系统知识,熟悉 Linux 基础原理及日常操作、性能分析命令
2、熟练掌握 Python 或 Go 其中至少一种语言,具备良好的代码规范、数据结构与算法功底
3、了解分布式系统的基本概念(如一致性协议、高可用、数据分片、数据复制等),对主流存储(Ceph / HDFS / 对象存储 / KV / 块存储等)有一定认知或浓厚兴趣
4、关注 LLM / Agent 前沿技术,熟悉 Prompt Engineering,了解 LangChain / LangGraph 等常见 Agent 框架设计思想,有兴趣将 AI 与系统工程深度结合
5、对线上生产环境怀有敬畏之心,具备严谨的工程思维与出色的逻辑推演能力
6、良好的沟通表达与团队协作能力,遇到复杂问题善于复盘总结与文档沉淀
加分项(满足任意一条优先考虑)
1、熟悉 Linux 内核、文件系统(Ext4/XFS)、网络协议栈或有内核调优经验。
2、有分布式存储(Ceph、MinIO、HDFS、RocksDB 等)源码研读、科研课题或生产/测试环境部署经验
3、有基于 LLM / Agent 开发过实际可运行的 Demo、竞赛项目,或深入了解 RAG、Tool Calling 等落地机制
4、曾在中大型互联网/云厂商拥有分布式系统开发、SRE 或云计算基础设施相关实习经历。