锦鲤求职

阿里巴巴

研究型实习生-大模型自进化(RSI)与 Agentic 前沿算法研究

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
我们正在探索通向大模型递归式自我改进(Recursive Self-Improvement,RSI)的算法与工程路径:让模型在可交互、可验证、可扩展的环境中主动发现能力边界,通过任务生成、轨迹采集、自动评测、训练优化与回归验证形成持续闭环,逐步实现“AI 训 AI”与智能体能力的可控自进化。你将参与从 Agent 到 Self-Improving Agent 的前沿研究,并在真实风险、安全及复杂业务场景中验证研究价值。
重点研究方向包括:
1、Agentic GYM 与可验证任务环境构建面向长程任务的 GYM/靶场与交互式训练环境,研究环境抽象、工具与协议接口、状态管理、沙箱隔离、确定性回放及结果校验;探索真实任务挖掘、程序化任务生成、难度分级、课程学习和对抗式环境演化,形成可 scale、可 verify、可复现的 Agent 训练基础设施。
2、长程任务与 Agentic RL围绕多轮、长时序、稀疏奖励和开放式决策任务,研究规划、搜索、记忆、反思及工具使用等能力的联合训练;探索 RLVR、GRPO/PPO 及其变体、过程奖励与结果奖励、轨迹级/步骤级信用分配、分层策略、多智能体协同与自我博弈,解决长轨迹训练中的采样效率、方差控制、奖励投机和能力坍塌问题。
3、Evaluation-Driven Learning 闭环构建“评测—诊断—数据—训练—再评测”的自动化飞轮:开展能力解构、Benchmark 与动态任务集建设,研究模型裁判、可验证奖励、过程监督、失败归因、弱点聚类和定向数据合成;提升评测的准确性、抗污染性和抗 Reward Hacking 能力,使 Evaluation 从结果度量升级为驱动模型持续学习的核心系统。
4、RSI 与 AI 训 AI研究模型自举与递归改进机制,让 AI 参与提出任务、生成环境、合成数据、构造奖励、评审轨迹、发现缺陷并验证改进效果;探索 Teacher-Student、自蒸馏、自博弈、自动课程、协议进化与群体智能等范式,建立具有安全边界、可解释增益和回滚能力的 Self-Improving Agent。
5、前沿研究与真实落地持续跟进 Agentic AI、Reasoning、RL、Test-Time Scaling、World Model、Synthetic Data 与 Automated AI R&D 等前沿方向;将研究成果沉淀为模型能力、GYM 环境、训练算法、评测基础设施和高质量数据资产,目标产出顶会论文、开源项目与具有实际业务价值的技术系统。

岗位要求
1、计算机、人工智能、自动化、软件工程、信息安全、数学、统计等相关专业硕士/博士在读,博士在读优先;
2、具备扎实的机器学习、深度学习与强化学习基础,理解大语言模型的预训练、SFT、DPO、PPO/GRPO、RLHF/RLAIF/RLVR、奖励建模等主流技术;
3、熟悉 Agent 关键技术与范式,如 ReAct、Tool Calling、Planning、Memory、Reflection、Multi-Agent、MCP 等;有从零搭建 Agent、训练环境、Benchmark 或自动化评测系统的经验;
4、熟练使用 Python 与 PyTorch,具备良好的算法实现、系统调试和实验分析能力;熟悉至少一种主流后训练/RL 框架(如 verl、OpenRLHF、TRL、AReaL、slime 等),有多机多卡训练经验者优先;
5、具备较强的科研能力与研究品味,能够独立完成文献调研、问题定义、方案设计、实验验证、消融分析和结果归因;具备良好的英文论文阅读、写作与技术表达能力;
6、对“模型如何自主发现问题并持续改进”有强烈兴趣,愿意挑战长程信用分配、开放环境泛化、自动化评测和自我进化等高不确定性问题。
加分项(满足其一即可)
1、在 NeurIPS、ICML、ICLR、ACL、EMNLP、KDD、WWW、AAAI、IJCAI、SOSP/OSDI、USENIX Security、CCS、NDSS 等国际顶级会议或期刊以主要作者身份发表过论文,或拥有高质量 arXiv、开源项目及竞赛成果;
2、有 Agentic RL、Long-Horizon Agent、Self-Play、Automated Curriculum、Synthetic Data、Reward Model/Evaluator Model 等方向的研究或工程实践;
3、在 SWE-bench、GAIA、WebArena、BrowserGym、OSWorld、CyberGym 等长程任务或交互式 Benchmark 上有训练、评测或环境建设经验;
4、熟悉 Docker/Kubernetes、分布式任务调度、沙箱隔离、可观测性或大规模 Rollout 基础设施,能够将研究原型建设为稳定系统;
5、有程序分析、自动化代码生成/修复、网络安全靶场、CTF、红蓝对抗或复杂仿真环境经验。
我们期待的你
1、既关注前沿算法,也愿意深入系统与环境,把一个开放问题推进为可复现、可验证的研究结果;
2、具有强烈的问题驱动意识和探索精神,能够在快速变化的研究方向中抓住关键矛盾、持续迭代;
3、乐于协作,愿与模型、强化学习、评测、安全和工程团队共同建设下一代自进化智能体系统。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →