岗位描述
工作职责
负责机械臂抓取、吸取、操作等机器人技能的强化学习算法研发,覆盖在线强化学习、离线强化学习、Sim2Real等技术方向,持续提升机器人操作的精度、泛化性与样本效率;
设计并实现强化学习算法从训练到部署的全链路方案,完成多模态感知信息与决策策略的工程集成,保障算法在真实业务环境中的稳定运行与效果迭代;
参与搭建高保真仿真训练环境,设计域随机化、域适应等 Sim2Real 迁移方案;主导真机策略调试与数据闭环优化,打通仿真训练与真机落地的技术路径;
追踪 CoRL、ICRA、NeurIPS、ICML 等国际顶会前沿技术,探索强化学习技术在具身操作场景的落地转化,沉淀核心技术资产。
任职资格
硕士及以上学历,计算机科学、人工智能、机器人工程、自动化等相关专业;
扎实的工程实现能力,熟练掌握 Python 与 C++ 编程语言,熟悉 ROS 机器人开发框架,有强化学习算法工程化与部署经验;
深入理解强化学习基础理论,熟练掌握 PPO、SAC 、TD3等经典强化学习算法,具备完整的算法训练、调优与问题排查经验;
熟练掌握至少一种主流强化学习框架,如RLlib、RLinf、RSL_RL、HIL-SERL等;
具备良好的逻辑思维与问题解决能力,有强烈的技术好奇心与自驱力,善于学习前沿技术并落地应用,具备良好的跨团队协作意识。
优先考虑
具备机械臂、夹爪、灵巧手等具身平台的强化学习算法研发与真机调试经验;
有离线强化学习、Sim2Real 迁移相关项目经验,或具备基于LLM、VLM、VLA等模型开展强化学习训练与策略优化的研究 / 项目经验;
在 CoRL、ICRA、IROS、ICML、NeurIPS、RSS 等机器人与人工智能顶会发表过论文;
有 Isaac Sim、MuJoCo、Gazebo 等仿真环境搭建与强化学习训练经验。