岗位描述
1. 数据集成与数据开发
- 负责基于阿里云 DataWorks 的数据集成、数据同步、数据开发、任务调度与运维管理;
- 维护各类业务系统、日志系统、第三方数据源到数据仓库的数据链路;
- 保障离线与实时数据任务的稳定性、准确性和时效性;
- 处理数据同步、任务调度、依赖关系、失败重跑、资源优化等日常问题。
2. 数据仓库基础设施建设
- 参与公司数据仓库体系建设,包括 ODS、DWD、DWS、ADS 等分层设计与落地;
- 负责数据模型设计、指标口径沉淀、公共维度建设和主题域规划;
- 推动数仓规范化建设,包括命名规范、分层规范、开发规范、调度规范等;
- 优化数据存储、计算性能和任务运行效率。
3. 数据质量治理
- 建设和维护数据质量监控体系,包括完整性、准确性、一致性、及时性、唯一性等规则;
- 设计数据质量校验规则、告警机制和问题追踪流程;
- 协同业务、产品、研发等团队定位并解决数据异常问题;
- 推动数据质量治理从事后发现向事前预防、事中监控演进。
4. 大数据工具与平台维护
- 熟悉并参与维护常见大数据组件及工具,包括但不限于:
- Elasticsearch / OpenSearch
- Flink
- Hive / Spark
- MaxCompute
- Kafka / RocketMQ
- HDFS / HBase 等
- 根据业务需要支持实时计算、搜索分析、日志分析、数据服务等场景;
- 参与数据平台能力建设,包括任务监控、血缘分析、元数据管理、权限管理等。
5. 业务支持与数据方案设计
- 深入理解业务场景,抽象数据需求,设计合理的数据模型和数据链路;
- 支持业务分析、BI 报表、运营看板、风控策略、推荐系统等数据应用;
- 能够将复杂业务问题拆解为清晰的数据建设方案;
- 主动发现数据体系中的问题并推动解决。
任职要求:
1. 基础能力
- 本科及以上学历,计算机、软件工程、数据科学、信息管理、数学、统计等相关专业优先;
- 具备扎实的 SQL 能力,熟悉复杂 SQL 编写、性能优化和数据建模;
- 熟悉数据仓库理论,理解维度建模、宽表设计、指标体系建设、数据分层等方法;
- 具备良好的工程意识,关注系统稳定性、可维护性、可扩展性和数据质量。
2. DataWorks 与云上数仓经验
- 熟悉阿里云 DataWorks 的数据集成、数据开发、调度运维、数据质量、数据地图等模块;
- 熟悉 MaxCompute / Hologres / AnalyticDB 等阿里云数据产品者优先;
- 有基于阿里云搭建企业级数据仓库或数据中台经验者优先;
- 能够独立设计并维护稳定的数据同步链路和任务调度体系。
3. 大数据技术能力
- 熟悉 Elasticsearch,了解索引设计、查询优化、数据写入、集群维护等;
- 熟悉 Flink,理解流式计算、窗口、状态管理、Checkpoint、Exactly-once 等核心概念;
- 熟悉至少一种消息队列,如 Kafka、RocketMQ 等;
- 熟悉 Hive、Spark、Hadoop 生态中的一种或多种技术;
- 了解实时数仓、湖仓一体、数据湖等架构者优先。
4. 编程与工程能力
- 熟悉 Java、Scala、Python 中至少一种编程语言;
- 能够编写数据处理脚本、自动化运维脚本或数据校验工具;
- 具备良好的代码规范意识和问题排查能力;
- 熟悉 Git、CI/CD、任务发布流程者优先。
5. 软性能力
- 具有很强的执行力,能够高质量推动任务落地;
- 具备良好的业务理解能力,能够快速理解业务逻辑和数据含义;
- 具备较强的抽象思考能力,能够从复杂业务中提炼通用模型和数据方案;
- 具备较好的沟通协作能力,能够与业务、产品、研发、算法等团队高效协同;
- 对数据质量、数据价值和数