岗位描述
The right data does not just improve models. It creates new capabilities.
随着基础模型规模不断扩大,单纯增加训练数据已经无法保证能力持续提升。
未来模型竞争的核心,将从“拥有多少数据”转向“是否能够构建持续产生高价值数据的能力增长系统”。
你将探索的问题包括:
什么样的数据能够真正激发模型的Reasoning、Coding和Agent能力
如何设计高质量Mid-training Data Recipe,实现能力定向增强
如何利用Synthetic Data、Self-play、Self-distillation生成模型需要的数据
如何通过数据回流和模型反馈,建立自动进化的数据闭环
如何衡量数据价值,并找到数据与能力提升之间的因果关系
你的工作将直接决定模型能力增长的方向
岗位职责
负责大模型Mid-training阶段数据算法研究,构建能力增强型数据体系。
设计和优化数据Recipe,包括数据筛选、数据混合、课程学习、合成数据生成等策略。
面向代码、数学、Reasoning、Agent、多模态等能力方向,构建高价值训练数据。
分析数据分布、数据质量与模型能力之间的关系,建立数据评估体系。
与算法训练、Evaluation团队协同,通过数据驱动模型能力持续提升。
任职要求
熟悉NLP、大模型数据处理、数据挖掘或Data-centric AI相关技术。
具备较强的数据分析能力和工程能力,能够独立完成数据Pipeline建设和实验验证。
对Synthetic Data、Data Flywheel、Self-training、数据Scaling等方向有研究兴趣或实践经验。
在各类竞赛中取得突出成绩,或在开源社区有重要贡献者优先。