岗位描述
工作职责:
1、推进模仿学习 + 强化学习等组合方案的落地,完成模型训练、离线评测,并与仿真闭环、路测结果对齐分析。
2、参与数据闭环建设:日志采集与清洗、场景挖掘、标注 / 回放,支撑模型迭代与问题复现。
3、建设并维护「训练—评测—回流」流水线,完成实验配置、指标统计、bad case 归档与阶段性复盘。
4、跟踪强化学习与自动驾驶领域前沿,推动有价值方法的预研与工程转化。
任职要求
1、计算机、自动化、机器人、人工智能、数学等相关专业。
2、扎实掌握强化学习基础理论(PPO\GRPO\Actor-Critic),能独立完成算法实现与实验分析。
3、在以下方向中至少一项有较深入实践:
(1)在线或者离线强化学习
(2)Reward Function 设计,Reward Model 训练
(3)自动驾驶强化学习仿真闭环设计与应用
(4)强化学习后训练
4、熟练使用 Python 及 PyTorch,熟悉 Linux 与 Git;具备将算法原型工程化的能力,了解 C++ 者优先。
5、数学基础扎实(概率统计、优化、线性代数),逻辑清晰,具备良好的实验记录与技术文档习惯。
优先考虑
1、有强化学习相关高水平项目、论文复现或一作 / 共一论文;
2、有自动驾驶决策、规划、轨迹预测相关实习、竞赛或开源经验;
3、熟悉闭环仿真评测、分布式训练或大规模日志数据挖掘;
4、有 ACM / 数学建模 / 机器人相关竞赛获奖经历。