锦鲤求职

小米集团

MiMo-大模型数据链路工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
【岗位定位】
连接“全网海量异构数据”与“大模型训练”的核心数仓枢纽。负责万亿级 Token 预训练语料的数据湖仓架构设计、数仓分层治理(ODS/DWD/DWS)以及高吞吐分布式清洗流水线开发。通过高效的工程手段将清洗、去重、打分等策略规模化落地,打造极致纯净、可追溯的数据底座。

【岗位职责】
1. 语料湖仓架构与分层治理:基于 Apache Paimon / Iceberg 构建流批一体的预训练语料湖仓,设计规范的数仓分层(ODS 原始抓取 -> DWD 清洗去重 -> DWS 质量打分与配比),负责语料元数据管理与版本血缘追溯。
2. 清洗与去重工程化落地:负责海量文本清洗逻辑、指纹/语义去重(MinHash/LSH 等算法的分布式工程实现)以及质量打分策略的大规模并行化高效落地。
3. 采样与配比数据管道:配合算法团队,设计并开发大规模数据集的特征统计、分布分析与多样性采样数据管道,高效产出符合训练要求的配比数据集。
4. 原始数据海量存储与成本:设计 PB 级全网原始数据(Raw Staging)的高吞吐落盘、分块存储、压缩与冷热分级策略,保障存储高可用与极致成本管控。
5. 极致吞吐与性能优化:深入 Spark / Ray / Flink 计算引擎与数据湖读写机制,调优海量数据处理在分布式集群中的内存开销、数据倾斜、I/O 瓶颈与计算吞吐。

岗位要求
【职位要求】
1. 本科及以上,计算机/软件工程/数据工程相关专业,3~5 年大数据数仓建设、高吞吐分布式处理或数据工程经验。
2. 扎实的数仓与工程功底:精通 SQL,精通 Python,且熟练掌握 Java / Scala / Go / C++ 之一,具备良好的代码工程化能力与数据建模思维。
3. 分布式计算引擎:深入理解 Spark / Flink / Ray 等分布式计算框架,具备在超大规模集群上进行并行化任务开发、大规模去重、数据清洗及 OOM/数据倾斜调优的实战经验。
4. 海量存储与湖仓实战:熟练掌握 Apache Paimon(或 Iceberg/Hudi)及 HDFS/S3/MinIO 等存储方案,精通湖仓分层设计、元数据管理与高并发读写优化。
5. 数据质量与血缘:具备严谨的数据质量控制意识,熟悉数据血缘链路建设与数据比对校验。

【加分项】
• 有 PB 级海量文本、日志或非结构化数据处理经验者优先
• 熟悉 Parquet / Arrow 等高效列式存储与内存格式的底层原理
• 了解 Ray Data 或单机高性能计算引擎(如 DuckDB / DataFusion)
• 有大模型预训练(Pre-training)语料清洗或数据集治理工程落地经验者优先

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →