锦鲤求职

金山云

高级运维工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
一、岗位职责
1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。
2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。
3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。
4. 设计并落地全链路可观测体系,实现链路可追踪能力。
5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。
6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。
7. 参与成本治理,优化训练成本与单Token推理成本。

二、岗位要求
1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。
2. 深入理解 Linux、网络、存储及分布式系统原理。
3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。
4. 熟悉监控与可观测体系设计,有落地经验。
5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。

高鹏程:高级运维工程师(T6)

一、岗位职责
1. 负责智算平台整体稳定性与SLA体系建设,覆盖算力集群、训练平台、推理与Token服务。
2. 主导分布式训练稳定性治理(如训练失败、Hang、慢卡、资源不均衡等问题)。
3. 负责推理服务与Token API的性能优化与SLO建设(P99延迟、吞吐、可用性)。
4. 设计并落地全链路可观测体系,实现链路可追踪能力。
5. 主导复杂故障排查与根因分析(RCA),推动系统性优化。
6. 推动自动化运维与自愈体系建设(自动隔离节点、自动恢复作业、弹性扩缩容)。
7. 参与成本治理,优化训练成本与单Token推理成本。

岗位要求
二、岗位要求
1. 本科及以上学历,5年以上SRE / 云平台 / 大规模系统运维经验。
2. 深入理解 Linux、网络、存储及分布式系统原理。
3. 熟悉 Kubernetes 及云原生体系,具备大规模集群(百节点以上)经验。
4. 熟悉监控与可观测体系设计,有落地经验。
5. 具备自动化运维能力(Python / Golang / 运维平台建设经验)。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →