岗位描述
一、岗位职责
负责公司大数据平台及数据产品相关功能的设计、开发、建设和持续优化。
负责大数据采集链路建设,能够根据业务场景完成结构化、半结构化及实时数据的采集、同步和接入,包括数据库、消息队列、日志、接口及设备数据等。
负责离线及实时数据处理任务开发,基于 Spark、Flink、Kafka、Hive 等大数据组件完成数据清洗、转换、聚合、关联及计算处理。
负责数据仓库及数据模型建设,包括数据分层、数据建模、指标加工、数据质量处理等工作。
负责复杂 SQL 的开发与优化,能够处理大规模数据场景下的多表关联、聚合计算、窗口计算、多维分析等业务需求。
使用 Java、Scala、Python 等语言进行数据处理程序、数据服务及大数据平台相关功能开发。
负责大数据计算、存储及查询组件的性能分析和优化,包括任务执行效率、资源使用、数据倾斜、并行度、内存、Shuffle、IO 等方面的调优。
负责大规模数据存储及查询性能优化,根据不同业务场景进行数据模型、分区、分桶、索引、文件格式、压缩方式及存储结构优化,提升数据查询及分析效率。
负责 Spark、Flink、Kafka、Hive、Doris、StarRocks、ClickHouse 等相关组件的性能调优、问题定位及稳定性优化。
参与大数据技术方案设计,根据数据量、实时性、查询性能、成本及业务需求进行技术选型和架构设计。
负责线上大数据任务及平台问题排查,通过日志、监控、执行计划及性能指标定位数据处理、存储和查询瓶颈。
配合产品、业务及其他研发人员完成数据需求分析、技术方案设计及项目落地。
二、任职要求
本科及以上学历,计算机、软件工程、大数据、数学等相关专业,具备 3 年及以上大数据开发工作经验,有实际生产环境的大数据项目建设、开发或优化经验。
熟悉 Java、Scala、Python 中至少一种开发语言,具备良好的工程开发能力;熟悉 Java 或 Scala 者优先。
熟练掌握 SQL,具备复杂 SQL 编写能力,能够通过执行计划、数据分布、Join 策略等方式进行 SQL 性能分析与优化。
熟悉主流大数据技术体系,对以下一种或多种组件具有实际项目经验:
Hadoop / HDFS
Hive
Spark
Flink
Kafka
HBase
Elasticsearch
Doris / StarRocks / ClickHouse
5.具备较完整的大数据采集和处理能力,熟悉一种或多种数据采集、同步或 CDC 技术,例如:
Flink CDC
DataX
SeaTunnel
Canal
Kafka Connect
Debezium
Logstash
6.熟悉离线计算和实时计算相关技术,理解批处理、流处理及实时数仓相关架构。
7.具备大数据组件性能调优能力,能够针对 CPU、内存、网络、磁盘 IO、Shuffle、数据倾斜、GC、并发度等问题进行分析和优化。
8. 具备大规模数据查询优化能力,熟悉 SQL 执行计划、Join 优化、分区裁剪、谓词下推、索引、预聚合、物化视图等常见优化方式。
9.具备数据存储优化能力,理解分区、分桶、数据排序、冷热数据、文件大小、压缩算法以及 Parquet、ORC 等列式存储格式对性能的影响。
10.熟悉数据仓库基本理论,了解事实表、维度表、维度建模、数据分层及指标体系等相关知识。
11.熟悉 Linux 环境,具备较强的问题定位及故障排查能力。
12.具备良好的技术学习、问题分析及沟通协作能力,能够独立完成模块设计、开发和技术问题处理。
三、加分项
有数据平台、数据中台、实时数仓、数据治理、指标平台、数据服务平台等相关项目经验。
有 Doris、StarRocks、ClickHouse 等 OLAP 引擎查询性能优化经验。
有 Hadoop、Hive、HDFS、Kafka 等大数据基础组件集群部署、参数配置或性能调优经验。
熟悉 Iceberg、Hudi、Paimon 等数据湖或湖仓技术。
有百亿级以上数据量、TB/PB 级数据存储及高并发查询优化经验。
有 Spark、Flink 等计算引擎性能调优或大规模生产环境实践经验。
有 Spring Boot、Spring Cloud 等 Java 后端开发经验,能够参与数据平台服务端开发。
有制造业、工业互联网、MES、IoT、设备数据或时序数据处理经验。