岗位描述
岗位职责:
1、 MPP 集群建设与运维
1.1、负责 Presto(Trino)、StarRocks 等 MPP 分析型引擎集群的规划、部署、升级、扩缩容与日常运维,保障集群高可用与稳定性。
1.2、负责集群节点的资源规划与容量管理,合理配置 Coordinator / Worker(FE / BE / Compute Node)角色与规格。
1.3、建立并维护集群的监控告警体系(CPU、内存、磁盘、网络、连接数、慢查询等核心指标),做到故障早发现、早定位、早处置。
2、性能调优与稳定性治理
2.1、持续优化查询性能,定位并解决慢查询、数据倾斜、内存溢出(OOM)、GC 压力、并发瓶颈等问题。
2.2、负责表结构(分区分桶、排序键、物化视图、索引)、统计信息、执行计划层面的优化。
3. 故障处理与应急处置
3.1、负责 7×24 小时值班响应(轮班制),快速处理集群中断、节点宕机、数据不一致等生产故障,输出故障复盘报告(RCA)。
4、平台化与自动化建设
4.1、参与编写/维护自动化运维工具与脚本(Shell、Python、Ansible 等),实现集群的一键部署、自动化巡检与自愈。
5、跨团队协作
5.1、与数据开发、业务分析团队协作,提供引擎选型建议与最佳实践支持,推动 SQL 优化与数据架构演进。
任职要求:
1、必备项:
1.1、计算机相关专业本科及以上学历,3 年以上大数据平台运维开发经验。
1.2、精通 Presto / Trino 或 StarRocks 的架构原理,深入理解其执行引擎、优化器、存储引擎与分布式调度机制。
1.3、熟悉 MPP 架构,了解 ClickHouse、Doris、Impala 等同类引擎者尤佳。
1.4、扎实的 Linux 系统运维能力,熟悉网络、存储、内核参数调优。
1.5、熟悉至少一种脚本语言(Shell / Python),具备编写自动化运维工具的能力。
1.6、熟悉 Hadoop 生态(HDFS、Hive、YARN)、Kafka、MySQL 等,理解离线与实时数仓链路。
1.7、具备良好的故障定位与问题分析能力,能独立完成复杂生产问题的排查。
2、加分项:
2.1、有 100+ 节点、PB 级数据规模 的集群运维与调优实战经验。
2.2、熟悉 Kubernetes / Docker,有容器化部署 MPP 引擎经验。
2.3、了解 湖仓一体架构,熟悉 Iceberg、Hudi、Hive Metastore。
2.4、有开源社区贡献、源码阅读或客制化二次开发经验。
2.5、熟悉 Prometheus、Grafana、周界告警等可观测性体系搭建。
软素质:
1、责任心强,具备良好的抗压能力和故障应变能力。
2、良好的沟通与跨团队协作能力,能清晰表达技术方案。
3、数据安全意识强,严格遵守生产变更与保密规范。