锦鲤求职

均胜电子

RL/真机后训练实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

我们是专注于具身智能的硬科技公司。这里没有繁杂的PPT文化,只有真机、真数据、真场景。你将直接接触下一代AI与物理世界的交互边界。

职责内容:

• 参与基于SFT、BC、DAgger、离线RL(IQL/CQL)、在线RL(PPO/SAC)、偏好优化(DPO/GRPO)等方法进行策略后训练与迭代;

• 参与负责数据策略设计,包括轨迹筛选、成功/失败样本分析、正负样本构造、hard case mining、数据重加权与课程学习;

• 参与设计奖励函数与偏好对齐机制(任务完成奖励/过程奖励/安全约束/接触质量/动作平滑性/碰撞惩罚等);

• 参与真机数据采集、策略部署与Bad Case闭环迭代,多维拆解任务失败原因(数据/模型/动作空间/感知/控制/sim-to-real gap/场景分布/评测定义);

• 参与建立策略评测体系,定义成功率、稳定性、动作质量、安全性、恢复能力等指标,建立回归评测流程。

任职要求:

• 招募对象:大三大四本科生、研一研究生、直博一年级至三年级博士生。

• 专业方向:计算机、人工智能、机器人等相关理工科专业。

• 工程能力:

精通Python/C++;熟悉至少一种RL/模仿学习框架;

理解PPO/SAC/IQL/CQL/DPO 等算法基本原理,能根据任务特点判断方法适用边界;

具备真机/仿真联调经验,能处理仿真与真机间的物理不匹配问题;

具备系统实验设计能力,能围绕任务设计训练方案、对照实验与失败归因。

加分项:如有实验室项目、开源贡献、竞赛(ACM/ROBOCUP/RoboMaster)还是个人Github 仓库,请附上对应链接。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →