岗位描述
岗位职责
负责大模型后训练数据体系建设,围绕 SFT、DPO、KTO、RLAIF、Reward Model 等训练范式,设计数据标准、标注规范、质量评估方法和迭代流程。
面向 AI Agent、工具调用、多轮对话、复杂指令遵循、结构化输出、长上下文、个性化记忆、安全拒答等业务场景,构建高质量训练与评测数据。
从线上 trace、用户反馈、人工评审、模型 bad case 中挖掘问题,完成问题归因、样本构造、数据增强、数据回流和效果验证。
设计和建设偏好数据体系,包括 response pair、ranking、rejection sample、hard negative、contrastive sample、self-refinement 等数据形态。
建设数据合成 pipeline,结合强模型生成、规则校验、LLM-as-judge、人工抽检和自动化过滤,提升数据规模、覆盖度和质量。
与算法、工程、产品团队协作,推动后训练实验,包括数据配比、数据消融、训练策略对比、模型评测和线上效果分析。
建设后训练评测集和数据质量指标,覆盖指令遵循率、工具调用成功率、JSON/schema 遵循率、幻觉率、安全性、个性化一致性、业务解决率等指标。
跟踪 LLM post-training、alignment、synthetic data、preference optimization、agent training 等方向前沿方法,并推动在业务场景中落地。
岗位要求
计算机、人工智能、机器学习、NLP、数据科学等相关专业本科及以上学历。
具备 2 年以上 NLP、搜索推荐、对话系统、大模型数据、算法评测或机器学习数据建设相关经验。
熟悉大模型后训练基本流程,理解 SFT、RLHF、DPO、KTO、RLAIF、Reward Model、Instruction Tuning 等方法。
有较强的数据敏感度,能够从模型失败案例中抽象问题类型,并设计可训练、可评测、可复用的数据样本。
熟悉数据清洗、数据标注、数据质检、数据合成、自动化评测等流程,能够制定清晰的数据规范和验收标准。
熟练使用 Python,能够独立完成数据处理、样本分析、评测脚本、质量检查和实验分析。
具备良好的实验分析能力,能够通过数据分布、错误类型、消融实验和指标变化判断数据策略是否有效。
具备较强 Ownership,能独立负责一个后训练数据方向,从问题定义、数据建设、训练支持到效果复盘形成闭环。
加分项
有 SFT / DPO / RLHF / RLAIF / Reward Model 数据建设或训练落地经验。
有 Agent、Function Calling、Tool Use、RAG、多轮对话、代码模型、数学推理、复杂任务规划相关数据经验。
有线上 trace 分析、bad case mining、自动化标注、LLM-as-judge、数据合成 pipeline 建设经验。
熟悉 Hugging Face、TRL、LLaMA-Factory、Axolotl、vLLM、SGLang 等训练或推理生态。
有大规模标注项目管理经验,能够设计标注规范、质检机制和标注员培训材料。
有顶会论文、开源项目、竞赛或大模型产品落地经验优先。