锦鲤求职

阿里巴巴

研究型实习-大模型长程任务训练/Agentic算法

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
针对行为风控场景高度对抗、动态演化、目标稀疏、决策链路极长的问题,探索通过多轮交互、跨源证据关联、链路还原与路径推演、多层级结果验证的Agentic技术方案。
1、Agent 训练环境与任务合成
面向风控场景场景,研究可scale,可verify的Agent训练环境与沙箱:环境抽象与工具接口设计、任务自动合成与难度分级、课程学习与"能力边界"自适应采样、执行结果驱动的自动化校验,探索环境规模化对 Agent 泛化能力的 scaling 规律。
2、长程任务的强化学习与信用分配
围绕多轮、长时序、稀疏奖励的复杂风控任务,研究 Agentic RL 的训练稳定性与有效性问题:轨迹级/步骤级信用分配、过程奖励与结果奖励的耦合设计、Reward System 与可验证奖励(verifiable reward)构建、长轨迹下的方差控制与熵坍塌抑制、多轮 rollout 的采样效率优化,以及自我博弈(self-play)在动态对抗场景中的应用。
3、Agent 自我进化与自动化协议工程
研究智能体的自动化演进机制,探索从人工提示工程向自动化协议工程的范式迁移;结合失败案例的自动归因、弱点聚类与定向数据生成,构建可持续自我改进的智能体系统。
4、评测体系与 Benchmark 建设
针对长程 Agentic 风控任务设计系统化评测方案:任务分级、能力解构、过程可信度与结果正确性的联合度量、对抗鲁棒性评估;沉淀高质量 Benchmark 与评测基础设施,推动研究结论可复现、可比较。

岗位要求
1、博士在读优;计算机、人工智能、自动化、软件工程、信息安全、数学、统计等相关专业硕士以上学历;
2、具备扎实的科研训练与研究品味:在 NeurIPS / ICML / ICLR / ACL / EMNLP / KDD / WWW / AAAI / IJCAI / USENIX Security / CCS 等国际顶级会议或期刊以第一作者/共同一作发表论文者优先;有高质量 arXiv 预印本、开源项目(可观 Star 数)或竞赛成绩者同等考量;
3、熟悉大模型后训练与强化学习技术栈:SFT / DPO / PPO / GRPO 及其变体、RLHF / RLVR、奖励建模、Agentic RL;熟悉至少一种主流 RL 训练框架(如 verl、OpenRLHF、TRL、AReaL、slime 等);
4、熟悉主流 Agent 框架与范式(如 ReAct、Tool Calling、Multi-Agent 编排、MCP 等),具备从零搭建 Agent 系统或训练环境的实践经验;
5、编程基础扎实,精通 Python,熟练使用 PyTorch,具备多机多卡分布式训练调试与工程排障能力;
6、具备独立推动课题的能力:能够独立完成文献综述、问题定义、方案设计、实验验证与结果归因,具备良好的英文科技写作与学术表达能力。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →