锦鲤求职

阿里巴巴

研究型实习生 - 基于Verifier Engineering的强化学习训练范式

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1. 探索更多可scalable的verfifier信号,并通过RL提升模型的各项能力。
2. 提升reward model在创作、人类偏好、指令遵循等各专项上的能力,减少reward hacking和bias。
3. 研究reasoning path压缩和外推,实现更高质量的推理思考。
4. 将LLM的reasoning能力和Agent以及其他模态相结合,探索统一模态的reasoning。

岗位要求
1. 计算机、机器学习等相关专业,博士及硕士优先。
2. 具有post-training或强化学习相关方向经验。
3. 精通Python以及Pytorch等深度学习框架,具有较强的代码工程能力。
4. 加分项:
①熟悉LLM推理引擎(如vLLM,SGLang)的实现。
②曾发表顶级会议论文并具有一定的学术影响力,包括但不限于NeurIPS、ICLR、ICML、ACL等。
③拥有知名开源项目,在开源社区具有较好的影响力。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →