岗位描述
工作职责:
1. 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。
2. 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板。
3. 建设细粒度评测和错误分类体系,对模型失败案例进行聚类、归因和优先级判断。
4. 研究难例挖掘、数据筛选、数据合成、拒绝采样、偏好构造和数据配比等策略。
5. 建设视频生成偏好数据,包括 Pairwise Ranking、评分标准、标注规范及质量控制机制。
6. 探索基于多模态模型、Reward Model 和自动评测器的数据生产与筛选方法,提升数据生产效率。
7. 与模型团队共同开展 SFT、DPO、Reward Fine-tuning、RL 等实验,分析不同数据策略对模型能力的影响。
8. 结合离线评测、人工反馈和实际使用反馈,形成“模型评测—数据归因—数据构造—训练验证”的后训练数据飞轮。
工作要求:
1. 有视频,图片,音频大规模数据处理经验或相关的预训练,后训练经验。
2. 2028 届及以后本科或研究生在读,计算机、人工智能、数学、统计学等相关专业优先。
3. 熟悉深度学习和生成模型基础,了解 SFT、偏好学习、Reward Model、DPO 或强化学习中的一种或多种方法。
4. 对视频内容和模型生成结果敏感,能够识别模型问题并形成结构化的错误分类和数据方案。
5. 熟练使用 Python,掌握 PyTorch,具备良好的实验分析、统计和可视化能力。
6. 具备较强的逻辑分析能力,能够围绕模型问题提出假设、设计实验并完成效果归因。
7. 具备 High Agency,能够主动发现问题、定义问题并推动数据与训练实验落地。
8. 每周可实习 4 天及以上,连续实习 3 个月以上,能长期实习者优先。