锦鲤求职

面壁智能

大模型数据工程师 / Data Pipeline

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
负责大模型训练数据 Pipeline 和数据生产基础设施建设,推动数据接入、清洗、质检、交付流程工程化、配置化和平台化。
岗位职责
1、负责大规模数据接入、解析、清洗、去重、采样及任务编排;
2、建设标准化、配置化 Data Pipeline,将高频处理能力沉淀为可复用算子和自助生产能力;
3、建设数据版本、血缘、任务状态、异常恢复及质量追踪能力;
4、联动数据、质检、标注和实验平台,推动自动质检、验收及数据效果反馈链路建设。

岗位要求
1、 Python 工程能力扎实,熟悉大规模数据处理;
2、熟悉 Spark / Ray 等至少一种分布式计算框架;
3、熟悉对象存储、Parquet / JSONL /LanceDB等数据格式及大规模 IO;
4、有大模型数据、数据平台、Workflow、数据质量相关经验优先。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →