岗位描述
岗位职责
1、参与大数据平台的设计与研发,协助构建高效、稳定的数据管道,支持业务数据分析和应用场景落地;
2、参与数据仓库模型设计及 ETL 流程开发与优化,在实战中学习并实践数据分层存储与计算优化;
3、在导师带领下,参与大数据组件(如 Spark、Flink)的性能调优工作,深入理解海量数据下的分布式计算与存储原理;
4、与数据分析师、业务团队紧密协作,支持数据需求对接,协助推动数据驱动决策的落地实施。
岗位要求
1、本科及以上学历在读,计算机、软件工程、大数据、人工智能等相关专业;
2、熟悉 Hadoop/Spark/Flink 等大数据计算框架中的至少一种,有分布式系统基础理论储备,有实际项目或课程实践经历;
3、掌握 SQL,了解 Hive、Presto/Trino、Doris 等数据仓库工具的基本使用和适用场景;
4、了解 ETL 开发流程,接触过 Airflow、DolphinScheduler 等调度工具者优先;
5、了解 Kafka、Pulsar 等消息队列的基本原理,对实时数据流处理有学习兴趣或初步经验;
6、熟悉 Java/Scala/Python 中至少一门编程语言,具备良好的编码习惯和数据处理脚本编写能力;
7、加分项:
(1)有云原生大数据服务使用经验(如 AWS EMR、Databricks、阿里云 MaxCompute);
(2)有个人技术博客、GitHub 开源项目贡献或大数据相关竞赛获奖经历;
(3)对数据治理、数据湖(如 Iceberg/Hudi/Paimon)有初步了解。