岗位描述
工作内容
1. 参与端到端模型多阶段训练,探索RL在端到端模型、生成式规划、下一代大模型中的应用
2. 设计、优化、迭代RL系统奖励函数设计、目标函数设计及训练框架搭建,落地基于RL的闭环策略训练
3. 分析并优化OnPolicy/OffPolicy数据集,构建高效的模型闭环迭代训练评估流程
4. 跟踪学术界和工业界在强化学习和自动驾驶领域的最新进展,推进RL在端到端中的深度实践
任职条件
工作地可选:保定、北京、上海、苏州、成都、深圳、天津
锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。
工作内容
1. 参与端到端模型多阶段训练,探索RL在端到端模型、生成式规划、下一代大模型中的应用
2. 设计、优化、迭代RL系统奖励函数设计、目标函数设计及训练框架搭建,落地基于RL的闭环策略训练
3. 分析并优化OnPolicy/OffPolicy数据集,构建高效的模型闭环迭代训练评估流程
4. 跟踪学术界和工业界在强化学习和自动驾驶领域的最新进展,推进RL在端到端中的深度实践
任职条件
工作地可选:保定、北京、上海、苏州、成都、深圳、天津
先核对岗位要求与自己的经历,再准备档案、投递和面试。