锦鲤求职

阶跃星辰

实习-LLM 预训练数据算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责

你将参与工业级 LLM 预训练数据体系的构建与优化,包括但不限于:

从 Web、Book、Code 等多源数据中进行数据挖掘与质量分析,直接贡献到万亿级别 token 的高质量语料库;

利用大规模 CPU/GPU 集群优化数据管线,支撑 PB 级数据的处理与持续迭代;

参与数据策略制定与消融实验设计,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响。

任职要求

计算机、数学、数据科学等相关专业,本科及以上学历;

CS/Coding 功底扎实,熟悉 Python,具备深度学习/强化学习基础知识;

对数据科学有兴趣,有较好的数据 sense,能从大规模数据分析与实验中识别影响模型表现的关键信号;

具备强烈的好奇心与自驱力,对 AI 数据体系建设与模型优化充满热情;

(加分项) 有参与 LLM 预训练数据相关工作的经验(如开源数据集构建、评测集设计、数据清洗 pipeline 等)优先;

每周不少于4天到岗,且能实习3个月以上。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →