锦鲤求职

生数科技

视频生成算法工程师 (强化学习)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
负责视频生成模型的后训练算法,基于 reward model、人工偏好和自动评测信号,提升模型在文本对齐、审美、动态、稳定性和用户满意度上的综合表现:

1. 设计视频生成后训练流程,包括 SFT、DPO、diffusion RL 等。
2. 基于多维 RM 构建训练 reward,优化文本-视频对齐、运动质量、美感、主体一致性和崩坏率。
3. 探索 reward hacking 防御、多 reward balance、online/offline preference data mixing。
4. 支持 recaption model RL,探索基于 benchmark 或 RM 的 prompt rewriting 优化。
5. 与 RM / 评测团队协作,构建可用于训练的高质量 preference 数据。
6. 分析后训练带来的能力提升和副作用,推动稳定迭代。

岗位要求
1. 熟悉 DPO、GRPO、NFT等经典 LLM / diffusion 后训练算法。
2. 有 LLM / diffusion 后训练、多模态 RL 经验优先。
3. 对 reward design、数据偏差、评测污染、reward hacking 有较深理解。
4. 能独立设计实验,并从复杂 case 中归因问题来源。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →