锦鲤求职

Shopee

(27届 ASP)LLM-大模型强化学习算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

关于团队

Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 演进。当前,我们正聚焦前沿技术突破,全力打造架构更先进、能力更卓越的下一代基座大模型,打造全球领先的多语言与自主智能体(Agentic LLM)技术体系。我们将通过对算法和数据策略的深入研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,打通从数据治理到智能涌现的确定性路径。我们追求将现有技术做到极致。

岗位描述

我们正在探索面向复杂真实任务的 Agentic AI 训练方法,目标是让大模型智能体在长程、多步骤、工具调用、多轮反馈的环境中具备更强的任务拆解、规划执行、错误恢复和持续优化能力。

你将参与长程 Agentic 任务的训练环境、奖励建模、轨迹数据、RL 算法和评测体系建设,推动模型在代码、浏览器使用、深度研究、工具调用、多智能体协作等任务上的可靠性提升。

岗位职责

参与长程 Agentic 任务训练与评测环境建设,包括 coding 、browser use、tool use、research 、SWE、多智能体协作等场景。

研究并实现面向长程任务的 RL/Post-training 方法,包括 PPO、GRPO、DPO/RLHF/RLAIF、trajectory-level reward、process reward、verifiable reward 等。

设计长程任务的奖励信号、自动评测器、任务成功率指标和轨迹质量分析方法。

分析 Agent 在长链路任务中的失败模式,例如上下文遗忘、错误累积、无效探索、工具误用、目标漂移、低效重试等,并提出训练或系统改进方案。

参与高质量 Agent 轨迹数据构建,包括任务生成、轨迹过滤、失败样本挖掘、偏好数据、合成数据和蒸馏数据。

进行算法实验和 ablation,分析数据、模型、奖励、环境、上下文管理策略对长程任务表现的影响。

跟踪 Agentic RL、long-horizon agents、computer use agents、agent evaluation 等方向的前沿论文和开源框架,并快速复现或落地。

岗位要求

计算机、人工智能、机器学习、数学等相关专业本科高年级、硕士或博士27届毕业生。

熟悉机器学习和深度学习基础,了解大模型训练、微调或 post-training 基本流程。

对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。

熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力。

对 AI Agent、工具调用、RAG、多轮推理、任务规划、代码智能体或浏览器智能体有兴趣或实践经验。

能独立阅读英文论文,具备较强的问题拆解、实验设计和结果分析能力。

加分项

有 LLM post-training、RLHF、RLAIF、DPO、PPO、GRPO、verl、TRL、Ray、vLLM 等经验。

熟悉 SWE-bench、WebArena、OSWorld、GAIA、ALFWorld、WebShop、BrowseComp 等 Agent/长程任务 benchmark。

有 coding agent、browser agent、workflow agent、multi-agent system、tool-use agent 项目经验。

有自动评测、reward design、trajectory analysis、sandbox execution、Docker/容器环境经验。

在 NeurIPS、ICLR、ICML、ACL、EMNLP、AAAI 等会议发表过相关论文,或有高质量开源项目。

有算法竞赛、Kaggle、ACM/ICPC、系统工程或复杂工程项目经验。

你将获得

深入参与前沿 Agentic RL/Post-training 方向的研究与落地。

接触真实长程任务环境、Agent 训练数据、评测体系和大规模实验流程。

与算法、工程、产品团队合作,将研究结果转化为可用的 Agent 能力。

有机会产出论文、技术报告、开源项目或核心业务成果。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →