锦鲤求职

阿里巴巴

日常实习生-大模型算法(Agentic RL / Reward 方向)-Qwen基础模型

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
你将加入 Qwen 团队,深度参与大模型在 Agent 与 Coding 场景下的前沿算法研究。核心方向是构建支撑大规模 Agentic RL 训练的奖励信号体系,提升模型的对齐质量与 RL 训练上限。具体包括:
1. Coding Reward System:参与面向 Code Agent 的 Reward System 研发,探索 Outcome 与 Process Level 的自动化 Rewarding 机制,助力解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。
2. Agentic User Experience Reward:参与 Agent 任务的用户体验建模与 Reward 优化研究,协助探索 User Reward Modeling,为弥合 Benchmark 指标与用户实际体验之间的鸿沟提供数据与算法支持。
3. Reward 评估与数据迭代:以 Reward 信号为核心,参与数据筛选、难例挖掘与合成迭代实验。

你将获得:
1. 顶级算力资源与工程基础设施,直接参与 Qwen 基座模型核心训练流程。
2. 资深算法工程师带教,深入 Agentic RL 与 Reward System 最前沿方向。
3. 实习期间的工作成果有机会落地到 Qwen 正式版本。

岗位要求
1. 学历:计算机、人工智能、数学等相关专业本科及以上在读。
2. 编程基础:精通 Python,熟练使用 PyTorch;具备扎实的机器学习与深度学习基础。
3. LLM 认知:对大语言模型的基本原理有一定了解,使用过或关注过主流 LLM。
4. RL 兴趣:对强化学习与大模型对齐有浓厚兴趣,了解 PPO / GRPO 等基本流程。

加分项(非硬性要求,有以下任一经历优先):
1. 有 Agent 框架使用经验(如 LangChain、LangGraph 等)或 Coding Agent 相关项目经验。
2. 做过 RL 相关课程项目、论文复现,或参与过 Reward Shaping / Credit Assignment 方向的探索。
3. 有 Kaggle 等竞赛经历,或在顶会发表过相关论文。
4. 有开源项目贡献经历。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →