岗位描述
1. 大数据平台资源管理与运维
- 负责MaxCompute、Hologres、Dataphin等大数据组件的日常资源管理,包括项目空间(Project)创建、计算与存储资源(CU/存储空间)的配额分配与动态调整。
- 负责监控平台资源水位(CPU/内存/存储使用率),根据业务增长趋势制定扩容计划,保障资源供给充足。
2. 权限管控与流程执行
- 严格按照公司安全规范,依据已审批通过的工单/邮件,执行Dataphin、Hologres及MaxCompute的用户权限开通、角色分配与权限回收。
- 负责数据导入导出(导数)流程的操作执行层工作,确保操作符合公司规范和要求。
- 负责将审批后的变更发布到UAT和生产环境。
3. 日常健康巡检与故障跟踪
- 每日执行平台日报巡检:检查离线任务运行状态,识别并标记失败任务,第一时间通知对应开发人员,并持续跟踪直至任务恢复运行。
- 每日执行基础环境检查:验证云上云下节点间的基础网络连通性,确保底层链路可用。
4. 版本升级与供应商(阿里云)对接
- 配合公司升级计划,负责测试环境中的版本预演,以及生产环境升级时的操作执行与进度跟踪。
- 作为阿里云工单接口人,负责跟进平台侧(如Dataphin/Hologres)的Bug修复或技术咨询工单,推动问题闭环。
5. 运维工具开发与自动化
- 利用Python或Shell编写自动化脚本,优化日常重复性手动操作(如批量资源回收、自动告警降噪等)。
6. 协助排查(平台侧)
- 协助数据开发团队排查任务运行报错,对于平台侧问题(如内存溢出、队列阻塞)进行快速干预和恢复。
任职要求
1. 基本条件
- 统招本科及以上学历,计算机、软件工程、信息技术等相关专业。
- 2年以上云计算或大数据平台运维经验,有企业级大数据集群(如Hadoop/Spark)或云原生数据仓库运维背景。
2. 专业技能
- 阿里云生态实操:熟悉阿里云大数据产品体系,有Maxcompute,
Hologres或Dataphin运维经验者优先考虑。
- 脚本能力:熟练使用Shell,并掌握Python或Java中的至少一门语言,能独立编写运维监控或自动化处理脚本。
- SQL基础:熟悉标准SQL语法,能够通过日志定位慢查询任务,并识别是否为资源不足(Queue busy)或数据倾斜导致的失败。
- 网络基础:了解基础网络知识(如VPC、交换机、白名单/IP段配置),能配合进行基础的防火墙策略验证。
- 企业级 IT 服务实操:了解基于 ITIL 服务框架的 IT 运维管理体系
3. 软素质
- 责任心强:对生产环境抱有敬畏心,做事细致,能严格按照SOP(标准作业程序)执行变更操作。
- 沟通高效:具备清晰的沟通表达能力,能承上启下,在开发团队与阿里云售后技术支持之间建立高效沟通桥梁。
加分项(非必须)
- 持有阿里云ACP(大数据方向 或 云计算方向)专业认证。
- 熟悉Prometheus/Grafana等开源监控组件,或有运维自动化平台建设经验。
- 具备企业级 AI 应用、AI 数据服务相关的开发或运维经验。