锦鲤求职

大疆

Data Infra 工程师(上海)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

职位简介:

关键字:多模态湖仓、数据资产、数据治理与服务

如果说大模型是AI时代的“大脑”,那么数据就是它的“神经元”与“血液”。我们相信,模型效果的边界,由数据基建的上限决定。在这个岗位上,你不是简单的“查数工具人”,而是负责构建支撑千亿参数模型训练的自研数据基座。你将直面EB级数据的实时流转、清洗与配比难题,用极致的系统性能,缩短模型迭代的数据准备时间从“周”到“小时”。

工作职责:

1. 湖仓:设计AI场景的湖仓一体架构(Iceberg / Delta Lake / Hudi)处理 PB 级数据,主导多模态湖仓整体架构(结构化 + 非结构化 + 向量数据统一存储与访问);

2. 多模态处理:设计大规模多模态处理框架(并行处理、质量评估、标注管理、去重),构建多模态统一表征与检索(embedding 存储、向量数据库、跨模态检索),建设面向AI训练的样本工厂;

3. 资产治理:设计完整治理体系(数据标准、质量监控、血缘、生命周期、分级分类、权限),主导企业级数据资产平台(发现、共享、成本核算、价值评估);

4. 查询优化:对PB级查询做系统性优化(物化视图、数据倾斜、资源调度),设计平台级方案(自适应Query Plan、智能缓存、计算存储分离),建立SLA容量规划;

5. 流水线:设计批流一体、多数据源接入、数据版本管理。主导平台全链路建设,设计面向AI训练的特征工程平台+高效样本生产线。

任职要求:

1. 本科及以上学历,计算机、软件工程、大数据、人工智能等相关专业;

2. 熟练掌握Python、C++、GO或Java中至少一种开发语言;

3. 精通SQL,理解复杂查询的执行逻辑及性能调优方法;

4. 熟悉至少一种大数据分布式计算或存储组件(如Spark、Flink、Hadoop、Kafka、Hive);

5. 了解数据仓库、ETL流程和数据建模的基本理论;

6. 具备扎实的计算机基础,包括数据结构、算法和操作系统知识;

7. 熟悉Iceberg、Paimon、Hudi、Alluxio、JuiceFS、Docker、K8S等技术,加分;

8. 了解向量数据库或图数据库,有多模态数据处理或RAG应用实践经验,加分。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →