岗位描述
职位简介:
关键字:多模态湖仓、数据资产、数据治理与服务
如果说大模型是AI时代的“大脑”,那么数据就是它的“神经元”与“血液”。我们相信,模型效果的边界,由数据基建的上限决定。在这个岗位上,你不是简单的“查数工具人”,而是负责构建支撑千亿参数模型训练的自研数据基座。你将直面EB级数据的实时流转、清洗与配比难题,用极致的系统性能,缩短模型迭代的数据准备时间从“周”到“小时”。
工作职责:
1. 湖仓:设计AI场景的湖仓一体架构(Iceberg / Delta Lake / Hudi)处理 PB 级数据,主导多模态湖仓整体架构(结构化 + 非结构化 + 向量数据统一存储与访问);
2. 多模态处理:设计大规模多模态处理框架(并行处理、质量评估、标注管理、去重),构建多模态统一表征与检索(embedding 存储、向量数据库、跨模态检索),建设面向AI训练的样本工厂;
3. 资产治理:设计完整治理体系(数据标准、质量监控、血缘、生命周期、分级分类、权限),主导企业级数据资产平台(发现、共享、成本核算、价值评估);
4. 查询优化:对PB级查询做系统性优化(物化视图、数据倾斜、资源调度),设计平台级方案(自适应Query Plan、智能缓存、计算存储分离),建立SLA容量规划;
5. 流水线:设计批流一体、多数据源接入、数据版本管理。主导平台全链路建设,设计面向AI训练的特征工程平台+高效样本生产线。
任职要求:
1. 本科及以上学历,计算机、软件工程、大数据、人工智能等相关专业;
2. 熟练掌握Python、C++、GO或Java中至少一种开发语言;
3. 精通SQL,理解复杂查询的执行逻辑及性能调优方法;
4. 熟悉至少一种大数据分布式计算或存储组件(如Spark、Flink、Hadoop、Kafka、Hive);
5. 了解数据仓库、ETL流程和数据建模的基本理论;
6. 具备扎实的计算机基础,包括数据结构、算法和操作系统知识;
7. 熟悉Iceberg、Paimon、Hudi、Alluxio、JuiceFS、Docker、K8S等技术,加分;
8. 了解向量数据库或图数据库,有多模态数据处理或RAG应用实践经验,加分。