锦鲤求职

商汤科技

大模型训练实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、参与多模态理解生成一体模型的 Pre-training / SFT / Post-training 训练,研究数据配比、训练策略、Loss 与采样策略对模型能力的影响;
2、参与多模态模型强化学习训练,实践 PPO / GRPO / DPO 等 RL / Preference Learning 方法,设计 RL Training Pipeline,分析并解决 Reward Hacking、训练不稳定、策略退化等问题;
3、负责 / 参与 Reward Model 的设计与训练,针对图文一致性、视觉质量、信息准确性、指令遵循等维度构建 Reward
4、探索 VLM-as-a-Judge 与自动化 Reward;
5、构建 RL / Reward 数据闭环,参与 Badcase 分析、实验设计与模型迭代;
6、跟踪前沿研究,复现论文方法并结合实际模型进行改进。

岗位要求
1、扎实的机器学习 / 深度学习基础
2、较强的 Coding 能力
3、较强的实验设计与问题分析能力
4、对大模型训练 / 强化学习有强烈兴趣
5、实习时间稳定

加分项:
有 LLM / VLM / MLLM 训练经验,或相关方向 paper / 开源项目;
有 SFT / RLHF / RLAIF / DPO / PPO / GRPO 实践经验;
有 Reward Model / Preference Model 训练或 Reward Engineering 经验;
有 VLM-as-a-Judge、图文生成、视觉推理相关项目经验;
熟悉 Transformers、DeepSpeed、FSDP、Megatron、vLLM,有多 GPU 分布式训练经验;
数学基础好,对优化、强化学习理论感兴趣;
能快速阅读英文论文。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →