锦鲤求职

小鹏汽车

AI Infra Engineer(Agentic RL 训练框架)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。

【职位描述】
1. 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口;
2. 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入;
3. 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 CI 回归体系,理解不同训练场景的运行特征,定位影响端到端效率与资源利用率的关键瓶颈,结合真实业务负载开展优化并推动成果落地;
4. 业务训练闭环:与算法团队协作完成具身模型 RL 后训练等真实业务的训练闭环,参与训练需求分析、技术方案设计与联调验证,支持新训练方法的接入与工程化落地;
5. 自动化与研发效能:完善任务配置、实验追溯、排障诊断与模型交付工具及文档,降低实验配置、管理与排障成本,提升框架使用体验与算法研发效率。

岗位要求
1. 扎实的 Python 编程与软件工程能力,熟悉 Linux 开发环境,具备良好的代码设计、调试和维护能力;
2. 熟悉 PyTorch,理解大模型训练与推理的基本流程,具有相关框架或基础设施的实际研发经验;
3. 具备分布式训练或推理系统经验,熟悉 FSDP、Megatron、vLLM、SGLang 等框架中的至少一种,能够理解其执行机制并定位实际问题;
4. 具备系统性能分析能力,能够结合 CPU、GPU、内存和通信等运行信息定位瓶颈,并通过实验验证优化效果;
5. 了解强化学习中采样、训练、环境交互和权重更新的关系,能够理解算法需求并转化为合理的工程实现;
6. 具备独立负责模块开发与问题闭环的能力,能够与算法及业务团队有效协作,完成方案设计、开发验证和持续迭代。

【加分项】
1. 有 AReaL、verl、RLinf 等强化学习框架的使用、集成或开发经验;
2. 有训练或推理框架源码开发、多后端适配、分布式通信或显存优化经验;
3. 熟悉 PyTorch Profiler、Nsight 等性能分析工具,或具有 CUDA、Triton、算子优化相关经验;
4. 有多模态、Agentic RL、异步强化学习等场景的工程实践,或有服务化、资源调度和自动调优相关经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →