锦鲤求职

Shopee

【MPI&D】资深算法工程师–智能客服机器人

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

团队介绍

我们是Shopee 的智能客服机器人团队,面向多语言、多业务场景构建新一代智能客服系统,服务广大消费者与商家。团队专注于将大语言模型(LLM)、智能体(Agent)、强化学习(RL)等前沿应用于真实客服场景,通过Post-Training、Agentic RL、Harness、Loop Engineering 持续提升模型的理解、决策、规划与执行能力。

我们已经基于 AI Agent 架构落地了全新的智能客服系统,希望进一步借助 Harness 和 Loop Engineering,对齐人类能力,推动系统从“回答问题的 Chatbot”演进为“能够理解场景、规划与执行方案并自我进化的智能客服 Agent”,达到并且超越人工客服的水平。

欢迎具备扎实研究背景、愿意在真实业务中打磨方法与系统的你加入。

岗位职责

一、围绕 AI Agent 架构与 Harness / Loop Engineering / Post-Training / Agentic RL 方向,参与或主导如下工作:

1. AI Agent 架构与 Harness(智能体架构与运行框架)

设计与迭代 AI Agent 架构(Planning / Tool Use / Memory / 多 Agent 协同等),建设工具集、上下文工程、SOP / 知识接入等 Harness,让基座模型的能力在客服场景中充分利用;

2. 推动 Agent 系统提效,通过模型分层、并行调度、上下文压缩与缓存复用等手段,降低端到端时延与推理成本。

二、Loop Engineering(数据与训练自进化闭环)

1. 建设“线上真实反馈(CSAT、转人工、人工改写等)→ 自动评估 → 训练数据生产 → Post-Training / RL → 灰度验证”的自进化闭环,让系统随真实流量持续变强;

2. 以“达到并超越人工客服”为目标,搭建自动化评估与 LLM-as-a-Judge 体系,从离线指标与业务指标共同衡量效果。

三、Post-Training 与 Agentic RL

1. 设计面向客服场景的 SFT / DPO / GRPO / PPO 等后训练策略,基于显式与隐式反馈(用户评分、CSAT、转人工、人工改写等)构造偏好与 Reward 信号;

2. 围绕 Agent 关键决策环节(动作选择、Tool 调用、澄清 / 追问策略等),设计 Agentic RL 目标与训练方法,探索 RLHF / RLAIF 在对话策略中的应用;

四、前沿实践

持续跟进 Post-Training、RL、Agent、Harness / Loop Engineering 等方向的最新研究进展并推动在业务中落地。

任职要求

1. 计算机科学、人工智能相关专业硕士及以上学历,应届或具有 1–3 年研究 / 工程经验均可;

2. 扎实的计算机与数学基础,良好的算法与数据结构能力;

3. 系统掌握机器学习与深度学习基础理论,对 Transformer 与 LLM 架构有较深入理解;

4. 至少在以下方向中 1–2 个方向具备较深研究或项目经历:

-Post-Training(SFT / DPO / GRPO 等);

-强化学习 / Agentic RL;

-Agent 方向(Planning / Reasoning / Tool Use / Memory / Multi-Agent 等);

-Harness / Loop Engineering(Agent 运行框架、自动评估与数据自进化闭环);

5. 熟练掌握 Python,熟悉 PyTorch / TensorFlow 等主流深度学习框架;

6. 具备良好的英文论文阅读与技术沟通能力;

7. 对 研究 + 工程 + 业务 的交叉问题有兴趣,愿意在真实场景中验证和打磨方法。

加分项(优先考虑)

1. 具备国内外一线 AI 团队(OpenAI、Google DeepMind、Anthropic、Meta、字节 Seed、阿里通义、腾讯混元、百度文心等)Agent 或大模型项目经验;

2. 有 AI Agent 系统设计与规模化落地经验,或有 Agent 推理提效(模型蒸馏、模型路由、并行调度、上下文工程等)实践经验;

3. 在 NLP、LLM、RL、Agent 等相关方向于顶会 / 顶刊(如 ACL、EMNLP、NeurIPS、ICLR、ICML 等)有论文产出,或有完整的研究工作;

4. 有实际参与 LLM Post-Training / 强化学习(含 Agentic RL)项目的经验;

5. 有在对话 / 客服 / Agent 场景中开展 RLHF / Agentic RL 的实践经历;

6. 熟悉分布式训练与大模型优化(如 DeepSpeed、FSDP、Megatron 等)。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →