岗位描述
岗位定位
你将作为核心开发力量,负责数据从采集到服务的全链路工程落地,确保数据模型的高可用、高效率与高质量,同时能理解并执行整体数据架构规划。
核心职责
ETL 开发与数据流构建
主导核心业务线的 ELT/ETL 流程开发,构建高吞吐、低延迟的批处理与实时计算任务。
编写高质量 SQL/Python/Java 代码,负责复杂逻辑的数据清洗、转换与加载。
解决数据处理过程中的性能瓶颈(如数据倾斜、内存溢出),进行代码级调优。
数仓模型落地与维护
基于维度建模理论,负责 ODS-DWD-DWS-ADS 各层数据模型 的物理实现与迭代。
维护现有数据资产,优化表结构设计,提升存储效率与查询响应速度。
保障数据产出的准确性与及时性,建立数据质量监控与告警机制。
技术组件应用与集成
熟练使用 DataPhin、MaxCompute、Hologres 等云平台工具,完成数据开发与运维任务。
运用 Spark、Flink、Kafka 等分布式组件,搭建实时数仓与流批一体处理链路。
架构规范执行与优化
参与数据架构评审,在开发过程中落实数据标准与建模规范。
针对现有架构痛点,提出工程层面的优化方案(如计算资源优化、存储成本降低)。
任职要求
技能(Must-Have)
编程与开发:精通 SQL,具备优秀的复杂查询编写能力;熟练掌握 Python 或 Java,能独立开发数据处理脚本。
大数据组件:深入理解 Spark/Flink 运行原理,有实际的大规模数据处理调优经验。
云平台实战:熟练使用阿里云数据平台栈(MaxCompute, DataPhin, Hologres),熟悉 OSS 存储机制。
建模能力:扎实的维度建模基础,熟悉数仓分层理论;了解本体建模思想,能结合业务语义构建概念模型,辅助复杂数据关系梳理或语义层设计。
加分项(Nice-to-Have)
-有 实时数仓(Real-time DW) 建设经验,熟悉 Kafka 消息队列的高可用配置。
具备 湖仓一体(Lakehouse) 技术栈(如 Iceberg/Hudi)的实操经验。
-有数据治理工具开发或数据质量自动化检测体系建设经验。
综合素质
具备极强的工程代码规范意识,习惯编写技术文档与操作手册。
对数据敏感,具备快速定位并解决生产环境数据故障(Data Incident)的能力。
具备良好的跨部门沟通能力,能将业务需求高效转化为技术实现方案。