锦鲤求职

哔哩哔哩

【B-UP】强化学习训练算法工程师(实习)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
工作要求:
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3、熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
4、熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
5、有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
6、在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →