锦鲤求职

壁仞科技

强化学习训练工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

任职要求:

1. 扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念;

2. 熟练使用 PyTorch,有 RL 或 LLM 训练的实际项目经验;

3. 熟悉至少一种 RL框架:Verl、Slime、Roll、AReal等;

4. 良好的工程能力与代码规范,能独立排查训练问题。

岗位职责

1. 参与强化学习框架在国产芯片的适配开发及优化;

2. 参与强化学习及其框架开源社区的推动和发展;

3. 参与基于国产芯片的强化学习相关项目的落地和交付;

4. 跟踪前沿论文与开源方案,推动新方法在业务场景落地。

加分项

1. 有大模型 RLHF/RLAIF 全流程落地经验;

2. 熟悉分布式训练框架:DeepSpeed、Megatron-LM、FSDP、Ray;

3. 有 Agent / 工具调用 / 多步推理 的 RL 训练经验;

4. 在 NeurIPS、ICML、ICLR 等顶会发表过论文;

5. 有强化学习开源社区相关贡献者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →