岗位描述
岗位职责
1. 负责事业部各产品线的日常运维、管理及性能调优,保障系统稳定、高效运行。
2. 负责 Kubernetes(K8S)集群的规划、部署、维护与故障排查,持续优化容器化应用运行环境。
3. 参与公司 To B 业务项目的交付与实施,负责客户现场环境部署、系统运维及技术问题排查,解决项目实施过程中的复杂技术问题。
4. 负责自动化运维工具、脚本及平台能力建设,通过 Shell、Python、Go 等技术提升运维效率,推动运维工作的标准化、自动化。
5. 建设和完善监控、日志、链路追踪及告警体系,能够结合 Prometheus、Grafana、ELK/EFK、VictoriaMetrics 等技术进行系统运行状态分析及故障定位。
6. 积极探索 AI 在运维领域的应用,使用大语言模型(LLM)、AI Agent、RAG 等技术提升故障排查、日志分析、知识检索、运维自动化及问题处理效率。
7. 能够熟练使用 ChatGPT、Claude、Gemini、GLM 等 AI 工具辅助日常工作,包括代码编写与审查、Shell/Python/Go 脚本生成、日志分析、故障排查、技术文档编写等。
8. 参与 AI 运维(AIOps)相关能力建设,将 Kubernetes、监控指标、日志、Trace、事件等运维数据与 AI 能力结合,实现智能告警分析、故障诊断、根因分析(RCA)及运维知识问答。
9. 根据业务需求参与大模型推理服务的部署和运维,了解 vLLM、KServe、Ollama 等模型服务技术,以及 GPU/NPU 等 AI 算力资源的基础运维。
10. 持续关注 AI、云原生及运维领域的新技术,并结合实际业务场景推动技术落地。
岗位要求
会python/shell/java均可