锦鲤求职

阶跃星辰

Mid-train 算法工程师(数据方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

The right data does not just improve models. It creates new capabilities.

随着基础模型规模不断扩大,单纯增加训练数据已经无法保证能力持续提升。

未来模型竞争的核心,将从“拥有多少数据”转向“是否能够构建持续产生高价值数据的能力增长系统”。

你将探索的问题包括:

什么样的数据能够真正激发模型的Reasoning、Coding和Agent能力

如何设计高质量Mid-training Data Recipe,实现能力定向增强

如何利用Synthetic Data、Self-play、Self-distillation生成模型需要的数据

如何通过数据回流和模型反馈,建立自动进化的数据闭环

如何衡量数据价值,并找到数据与能力提升之间的因果关系

你的工作将直接决定模型能力增长的方向

岗位职责

负责大模型Mid-training阶段数据算法研究,构建能力增强型数据体系。

设计和优化数据Recipe,包括数据筛选、数据混合、课程学习、合成数据生成等策略。

面向代码、数学、Reasoning、Agent、多模态等能力方向,构建高价值训练数据。

分析数据分布、数据质量与模型能力之间的关系,建立数据评估体系。

与算法训练、Evaluation团队协同,通过数据驱动模型能力持续提升。

任职要求

熟悉NLP、大模型数据处理、数据挖掘或Data-centric AI相关技术。

具备较强的数据分析能力和工程能力,能够独立完成数据Pipeline建设和实验验证。

对Synthetic Data、Data Flywheel、Self-training、数据Scaling等方向有研究兴趣或实践经验。

在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →