锦鲤求职

理想汽车

AI Agent / 强化学习 研究实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
我们在做什么
让 AI Agent 在真实商业环境中做出可靠决策并持续进化。我们有大规模、长周期、带真实结果标签的业务数据,因此也有一批学术界很难接触到的开放问题。
你会参与什么
环境建模与策略学习:从真实交互数据学习行为倾向模型;构建高保真可交互环境;在模拟环境中用 RL / Self-play 训练策略模型。
多智能体协同研究:分工与通信机制、成本与延迟约束下的协作。
如果你对 Kaggle、天池等竞赛感兴趣,我们也支持参加竞赛并提供算力与思路指导——可选支线。

岗位要求
我们在找什么样的人
计算机 / AI / 数学 / 统计相关专业研究生在读;机器学习基础扎实,Python 与 Linux 环境熟练。
对强化学习或多智能体系统有系统性理解——懂 PPO、DPO、GRPO 的优化目标和适用边界。
面对边界不清晰的问题,能自己形成假设、积极主动推进。
以下有一项即可
顶会 / 高水平期刊论文;Kaggle、天池、ACM-ICPC 等竞赛获奖;LLM 后训练 / RLHF / Reward Modeling / Agentic RL 实践;多智能体(MARL 或 LLM-based)研究或工程经验;熟悉 LLaMA-Factory、veRL 等训练框架。
你能得到什么
只要认真参与,论文一作一定归属你本人(前一批实习生3~4个月时间已产出多篇论文)
高校导师 + 企业导师联合指导,有丰富科研与国际竞赛经验
真实业务数据 + 算力与 API 资源
其他
地点 北京|建议实习 6 个月以上
简历发至邮箱:public_MARL@lixiang.com,标题「AI Agent 研究实习-姓名-学校」;欢迎附论文、GitHub、竞赛主页或你最自豪的项目

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →