锦鲤求职

阿里巴巴

Agentic训练与强化学习算法研究-阿里星/Bravo Star

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1.研发下一代 Agentic System:通过多步规划(Planning)、反思(Reflection)与工具调用(Tool-Use)能力,为全球商家构建自动化"数字员工",实现复杂任务闭环(如自动化选品、智能营销策划),端到端交付高价值业务结果,定义 AI 原生的 B2B 贸易新范式;
2.面向阿里国际站海量异构 API 生态,构建基于强化学习的训练决策迭代技术:设计并实现复杂任务流下的环境模拟器(Environment Design)与多维度奖励函数(Reward Shaping),通过 RL 训练提升模型在动态、高并发 API 环境下的编排、纠错与执行能力。

岗位要求
1.系统掌握强化学习理论,熟悉 PPO / DPO / RLHF 等主流算法的原理与工程实践;
2.具备大模型 Agent、Tool-Use、Planning / Reflection 等方向的研究或落地经验;
3.有环境模拟器(Environment Design)或奖励函数(Reward Shaping)设计经验者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →