锦鲤求职

商汤科技

大模型强化学习研究员

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 针对多模态大模型设计并实现强化学习算法,提升模型在推理、工具调用、Agentic 能力上的表现。
2. 参与大模型的强化学习训练流水线设计与实现,包括奖励建模、策略优化、对齐训练等环节。
3. 关注行业内顶尖机构在 Agentic RL、多智能体学习、多模态推理 等方向的最新成果,基于前沿研究提出创新性方法,推动模型在复杂推理、长程规划、多轮对话等方向的突破。

岗位要求
1. 拥有计算机科学、人工智能、统计学、应用数学或相关领域的硕士及以上学历。
2. 熟悉主流的强化学习算法(如 PPO, GRPO, GSPO 等)及其在大型模型上的应用。
3. 熟悉 Python 编程,并熟练掌握至少一种主流深度学习框架(PyTorch)。
4.熟悉常见 AI 编程工具(如 Claude Code、Cursor、GitHub Copilot等),能将其有效融入日常开发工作流,具备借助 AI 工具进行代码编写、调试及提效的主动意识。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →