岗位描述
任职要求:
1. 扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念;
2. 熟练使用 PyTorch,有 RL 或 LLM 训练的实际项目经验;
3. 熟悉至少一种 RL框架:Verl、Slime、Roll、AReal等;
4. 良好的工程能力与代码规范,能独立排查训练问题。
岗位职责
1. 参与强化学习框架在国产芯片的适配开发及优化;
2. 参与强化学习及其框架开源社区的推动和发展;
3. 参与基于国产芯片的强化学习相关项目的落地和交付;
4. 跟踪前沿论文与开源方案,推动新方法在业务场景落地。
加分项
1. 有大模型 RLHF/RLAIF 全流程落地经验;
2. 熟悉分布式训练框架:DeepSpeed、Megatron-LM、FSDP、Ray;
3. 有 Agent / 工具调用 / 多步推理 的 RL 训练经验;
4. 在 NeurIPS、ICML、ICLR 等顶会发表过论文;
5. 有强化学习开源社区相关贡献者优先。