岗位描述
岗位职责
1. 负责预训练数据管道的架构设计与迭代,覆盖数据采集、清洗、去重、质量过滤、配比优化、格式标准化等全流程
2. 构建大规模数据质量评估体系:设计并优化数据质量打分模型/规则,识别并过滤低质、重复、有害、污染类数据
3. 探索数据配比与Curriculum策略:结合Scaling Law研究成果,持续优化不同领域/语言/来源数据的配比方案,寻找最优的数据组合策略
4. 推进多元数据源的持续挖掘与整合:包括网页、书籍、代码、学术文献、多模态数据等,扩展数据的广度和知识密度上限
5. 搭建数据去污染(Decontamination)机制,确保训练数据与评测基准之间不存在数据泄漏,保障模型能力评估的可信度
6. 持续跟踪并复现业界前沿的Data‑Centric AI方法(如数据筛选算法、数据质量代理模型、数据蒸馏等),推动数据管道技术路线的持续迭代
7. 与其他团队紧密协作,确保数据管道的产出能够高效、稳定地服务于大规模预训练任务
岗位要求
1、 计算机科学、人工智能、数据科学等相关专业硕士及以上学历,或有等同的行业实战经验
2、具备扎实的编程能力(Python为主),能够独立设计并实现大规模数据处理pipeline,熟悉分布式数据处理框架(如Spark/Ray等)
3、对大模型预训练的基本原理有清晰理解,了解数据质量与模型能力之间的关联机制
4、具备良好的数据敏感度,能够从海量原始数据中快速识别质量问题和优化空间