锦鲤求职

阶跃星辰

Pre-train data 算法研究员/工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

Data doesn't just train models. It defines their potential.

随着模型规模逐渐接近,同样的模型结构,不同的数据策略却可能带来完全不同的能力表现。

什么样的数据真正促进推理能力?数据规模与数据质量之间如何平衡?如何建立能够持续驱动模型演进的数据 Flywheel?

你将负责探索:

如何构建覆盖文本、代码、多语言等场景的高质量 Pre-training 数据体系

如何建立数据质量评估方法,而不仅仅依赖经验规则

如何利用课程学习、数据混合、合成数据、自蒸馏等策略持续释放数据价值

如何建立自动化的数据生产与迭代流程,使数据持续驱动模型能力增长

如何理解数据分布变化对于模型泛化能力和 Emergent Ability 的影响

如果模型能力来自训练,那么训练能力首先来自数据。

岗位职责

负责 Foundation Model Pre-training 数据算法研究,构建覆盖数据采集、清洗、过滤、质量评估、配比及迭代优化的完整数据体系。

研究 Curriculum Learning、Data Mixing、Synthetic Data、Self-training、自蒸馏等关键技术,不断优化模型训练效果。

建立数据质量评估体系,分析不同数据策略对模型知识、推理及泛化能力的影响。

与模型训练、Evaluation 团队共同构建 Data Flywheel,让数据成为模型持续成长的重要驱动力。

任职要求

2026 届或 2027 届计算机、人工智能、数学、电子、自动化等相关专业硕士及以上或优秀本科生;

熟悉 NLP、数据挖掘、大规模数据处理或 Data-centric AI 相关方向。

具备优秀的数据分析能力及工程能力,能够独立完成数据实验设计、效果分析与 Pipeline 开发。

对数据驱动模型能力增长具有深入理解或实践经验,有 Synthetic Data、Data Scaling 等相关研究经历者优先。

在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →