锦鲤求职

中国电信

强化学习系统研发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作职责
1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练;

2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率;

3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。

4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。

工作要求
1. 扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具;

2. 深入了解 Megatron、DeepSpeed、SGLang、vLLM 等主流训推引擎;

3. 具备扎实的 RL 算法基础(PPO/DPO/GRPO等)与实际大规模训练经验;

4. 加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR;或在 RL 稳定性、环境工程等方向发表过顶会论文。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →