岗位描述
岗位职责
岗位二:计算 SRE 工程师(智算 / 通算平台方向)
岗位职责
负责私有化通算与智算(GPU)基础设施的日常运维、巡检排查与值班保障;参与线上突发故障的快速止损、定位与恢复,保障异构算力集群的高可用
主导并推进计算平台指标、日志、事件的统一观测体系建设,利用智能分析手段实现故障快速预警与根因定位
结合变更事件、容量水位与运维知识库,设计并研发面向计算集群的智能运维 Agent;将传统人工排错 SOP 转化为可自动执行的“异常初筛 - 根因分析 - 故障自愈”链路,推动运维自动化与智能化转型
主导沉淀标准化运维 SOP、知识库及自动化运维工具
岗位要求
任职要求
计算机相关专业,本科及以上学历
2. 扎实的计算机网络与操作系统功底,熟悉 Linux 常用命令、系统调用及常见性能瓶颈分析
3. 熟练掌握 Python 或 Go 至少一种开发语言,具备良好的数据结构与算法基础,具备编写自动化运维工具/脚本的能力
4. 对云计算与 IaaS 基础设施有基本认知,理解计算、网络、存储的基本协作模型;对容器或虚拟化有一定了解
5. 关注大模型与智能体技术,了解 Prompt 工程,对 LangChain / LangGraph 等框架设计思想有基本理解,乐于探索 AI 与 SRE 结合的落地场景
6. 对生产环境怀有敬畏之心,具备严谨的工程逻辑与线上故障排查推演能力
7. 良好的沟通表达、团队协作能力与抗压能力,善于总结沉淀与文档编写
加分项(满足任意一条优先考虑)
熟悉 Kubernetes 架构与核心组件运作机制,或有 OpenStack 部署与运维实操经验。
熟悉 GPU 硬件架构(如 NVIDIA Ampere/Hopper 架构)、NCCL、InfiniBand / RoCE 高性能网络,或有 AI 训练/推理任务运维与性能调优经验。
有基于 LLM / Agent 框架开发过实际 Demo/工具的经验,或熟悉 RAG、Function Calling 等技术原理。
曾在中大型互联网、云计算服务商或 AI 算力厂商有相关运维、基础设施或云原生实习经历。