岗位描述
大模型数据工程师
工作地点:上海/杭州
岗位职责
参与大模型训练数据体系建设,负责数据采集、清洗、去重、过滤、加工等数据处理工作;
建设高效、稳定的大规模数据处理 Pipeline,支持预训练、SFT、强化学习等不同阶段的数据需求;
参与数据质量评估体系建设,通过规则、模型及自动化方法持续提升训练数据质量;
参与合成数据生成、数据配比及数据策略优化,支持大模型能力持续迭代;
与算法、训练及平台团队协作,建设数据处理工具和平台。
任职要求
本科及以上学历,计算机、人工智能、软件工程、数学、统计学等相关专业;
具备扎实的数据结构和算法基础,熟悉 Python,具备良好的编程及工程实现能力;
了解大规模数据处理方法,熟悉 Spark / Flink / Ray 等框架者优先;
对大语言模型有基本理解,了解预训练、SFT、强化学习等流程及数据需求;
具备较强的数据分析和问题解决能力、学习能力、技术好奇心和自驱力。