锦鲤求职

奥特维

大数据开发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

一、岗位职责

负责公司大数据平台及数据产品相关功能的设计、开发、建设和持续优化。

负责大数据采集链路建设,能够根据业务场景完成结构化、半结构化及实时数据的采集、同步和接入,包括数据库、消息队列、日志、接口及设备数据等。

负责离线及实时数据处理任务开发,基于 Spark、Flink、Kafka、Hive 等大数据组件完成数据清洗、转换、聚合、关联及计算处理。

负责数据仓库及数据模型建设,包括数据分层、数据建模、指标加工、数据质量处理等工作。

负责复杂 SQL 的开发与优化,能够处理大规模数据场景下的多表关联、聚合计算、窗口计算、多维分析等业务需求。

使用 Java、Scala、Python 等语言进行数据处理程序、数据服务及大数据平台相关功能开发。

负责大数据计算、存储及查询组件的性能分析和优化,包括任务执行效率、资源使用、数据倾斜、并行度、内存、Shuffle、IO 等方面的调优。

负责大规模数据存储及查询性能优化,根据不同业务场景进行数据模型、分区、分桶、索引、文件格式、压缩方式及存储结构优化,提升数据查询及分析效率。

负责 Spark、Flink、Kafka、Hive、Doris、StarRocks、ClickHouse 等相关组件的性能调优、问题定位及稳定性优化。

参与大数据技术方案设计,根据数据量、实时性、查询性能、成本及业务需求进行技术选型和架构设计。

负责线上大数据任务及平台问题排查,通过日志、监控、执行计划及性能指标定位数据处理、存储和查询瓶颈。

配合产品、业务及其他研发人员完成数据需求分析、技术方案设计及项目落地。

二、任职要求

本科及以上学历,计算机、软件工程、大数据、数学等相关专业,具备 3 年及以上大数据开发工作经验,有实际生产环境的大数据项目建设、开发或优化经验。

熟悉 Java、Scala、Python 中至少一种开发语言,具备良好的工程开发能力;熟悉 Java 或 Scala 者优先。

熟练掌握 SQL,具备复杂 SQL 编写能力,能够通过执行计划、数据分布、Join 策略等方式进行 SQL 性能分析与优化。

熟悉主流大数据技术体系,对以下一种或多种组件具有实际项目经验:

Hadoop / HDFS

Hive

Spark

Flink

Kafka

HBase

Elasticsearch

Doris / StarRocks / ClickHouse

5.具备较完整的大数据采集和处理能力,熟悉一种或多种数据采集、同步或 CDC 技术,例如:

Flink CDC

DataX

SeaTunnel

Canal

Kafka Connect

Debezium

Logstash

6.熟悉离线计算和实时计算相关技术,理解批处理、流处理及实时数仓相关架构。

7.具备大数据组件性能调优能力,能够针对 CPU、内存、网络、磁盘 IO、Shuffle、数据倾斜、GC、并发度等问题进行分析和优化。

8. 具备大规模数据查询优化能力,熟悉 SQL 执行计划、Join 优化、分区裁剪、谓词下推、索引、预聚合、物化视图等常见优化方式。

9.具备数据存储优化能力,理解分区、分桶、数据排序、冷热数据、文件大小、压缩算法以及 Parquet、ORC 等列式存储格式对性能的影响。

10.熟悉数据仓库基本理论,了解事实表、维度表、维度建模、数据分层及指标体系等相关知识。

11.熟悉 Linux 环境,具备较强的问题定位及故障排查能力。

12.具备良好的技术学习、问题分析及沟通协作能力,能够独立完成模块设计、开发和技术问题处理。

三、加分项​

有数据平台、数据中台、实时数仓、数据治理、指标平台、数据服务平台等相关项目经验。​

有 Doris、StarRocks、ClickHouse 等 OLAP 引擎查询性能优化经验。​

有 Hadoop、Hive、HDFS、Kafka 等大数据基础组件集群部署、参数配置或性能调优经验。​

熟悉 Iceberg、Hudi、Paimon 等数据湖或湖仓技术。​

有百亿级以上数据量、TB/PB 级数据存储及高并发查询优化经验。​

有 Spark、Flink 等计算引擎性能调优或大规模生产环境实践经验。​

有 Spring Boot、Spring Cloud 等 Java 后端开发经验,能够参与数据平台服务端开发。​

有制造业、工业互联网、MES、IoT、设备数据或时序数据处理经验。​

​

​

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →