岗位描述
岗位职责
主要方向:数据治理平台、数据编织、逻辑数据平台、虚拟数据湖、统一查询、数据Pipeline
一、岗位职责
1. 负责逻辑数据平台 / 虚拟数据湖核心模块研发,构建统一元数据、联邦查询、跨源数据服务能力。
2. 负责大数据查询引擎、任务调度、统一 SQL 网关、多引擎智能路由的设计、开发与性能优化。
3. 负责数据治理平台建设,包括元数据管理、数据血缘、数据权限、数据质量、数据服务等能力。
4. 深度参与 Spark 内核、SQL 优化、执行引擎、Shuffle、存算分离等方向研发与性能调优。
5. 负责数据ETL、数据集成、数据Pipeline管道的设计与实现,支撑离线 / 实时一体化数据处理。
6. 跟踪前沿技术,推动湖仓一体、人工智能融合、基于本体的自动化治理等能力落地。
岗位要求
1. 硕士及以上学历,计算机相关专业,5 年及以上大数据研发经验。
2. 精通 Java/Scala 至少一种,熟悉分布式系统、数据库原理、SQL运行机制。
3. 深入掌握 Spark,包括 Spark Core、Spark SQL、Spark Streaming 等,有内核优化 / 性能调优 / ETL 优化经验者优先。
4. 熟悉数据 Pipeline 构建、任务调度、流 / 批数据集成、任务依赖编排等相关技术。
5. 熟悉主流大数据技术栈:Flink/Trino (Presto)/Hive/ClickHouse/Doris/YARN 等。
6. 了解数据编织、逻辑数据湖、联邦查询、统一查询相关理念或实践经验优先。
7. 具备良好的系统设计、复杂问题排查、性能调优、跨团队推动落地能力。
三、加分项
1. 有统一查询、SQL 网关、联邦查询、虚拟数据湖、逻辑数据平台项目经验。
2. 有开源社区贡献(Apache Spark/Flink/Trino/Gravitino/Kyuubi)优先。
3. 参与过大型数据中台、数据治理平台、ETL 平台、数据集成平台架构设计与落地。