锦鲤求职

Shopee

【MLP】大模型训练研发工程师/高级专家

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

职位描述

1. 负责大模型分布式训练框架、工具链及配套生态的研发与建设,支撑超大规模模型从预训练、SFT 到 RL 的端到端训练。

2. 负责千卡规模及以上训练任务的性能优化与稳定性建设,覆盖计算、通信、显存、数据加载和存储等关键链路,持续提升训练吞吐、资源利用率及集群可靠性。

3. 设计、实现并优化分布式训练核心能力与并行策略,包括数据并行、张量并行、流水线并行、专家并行及混合并行等。

4. 面向 SFT、RL 等后训练场景,建设和优化训练框架核心能力,包括多轮对话数据处理、长序列训练、动态批处理、样本生成与回放、奖励建模及在线训练等相关能力。

5. 跟踪并探索大模型训练、SFT/RL 后训练、分布式系统及软硬件协同优化领域的前沿技术,推动技术能力在业务场景中的落地与演进。

职位要求

1. 熟悉大模型分布式训练的核心原理与工程实践,具备数据并行、张量并行、流水线并行、ZeRO/FSDP 等一种或多种技术的实际项目经验。

2. 熟练使用 PyTorch,了解 Megatron-LM、FSDP、DeepSpeed、VeRL 等主流分布式训练框架,能够独立定位和解决训练框架及任务运行中的复杂问题。

3. 熟悉 Transformer 架构及大模型训练流程,了解预训练、SFT、RL 等训练范式,以及混合精度训练、梯度检查点、激活重计算等常用优化技术。

4. 具备扎实的性能分析与问题排查能力,能够定位复杂训练场景中的性能、稳定性和资源瓶颈,并推动优化方案的设计与落地。

5. 具备良好的工程能力、学习能力和团队协作意识,能够与算法、平台、基础设施等团队高效协同,推进关键项目交付。

加分项

1. 有大规模 LLM 预训练、SFT、RL 训练系统研发或优化经验。

2. 有大规模 GPU 集群训练、性能调优或稳定性治理经验。

3. 熟悉高速互联与通信优化,如 RDMA、InfiniBand、RoCE、NVLink/NVSwitch 等。

4. 有开源分布式训练框架、深度学习编译器或 CUDA 相关项目贡献。

团队介绍

AI 平台团队致力于打造 Shopee 人工智能研发的基础平台,专注于引入和发展前沿的人工智能工程技术,为客户创造价值。我们的目标是让 Shopee 的 AI 研究员与工程师在处理复杂的数据、算法和算力问题时,能够轻松且高效地开展工作。团队成员在人工智能领域拥有多年经验,曾建设过业界一流的深度学习工具与平台。加入我们,你将有机会:

- 参与建设新一代超大规模、云原生、弹性可伸缩的 AI 平台,实现数据管理、模型训练到算法上线的全流程一站式标准化操作,助力团队在 LLM(Large Language Model,大语言模型)时代高效开发和部署模型。

- 面向现代高性能计算、网络和存储设备,设计并构建全新的基础设施方案,深度挖掘硬件潜能,为 LLM 的高效运行提供强大支持。

- 探索千亿参数级别大规模深度学习的高效训练方法,优化 LLM 训练流程,提升模型性能和效率。

- 研发完整的便捷模型工具链,通过量化、压缩、剪枝、蒸馏等方式,将深度学习模型转化为高效可用的算法服务,特别关注 LLM 的优化和部署。

- 构建一套可复用的高质量基础深度学习算法模型库,助力算法研究员与工程师快速应用业界最新研究成果解决业务问题,为 LLM 的开发和应用提供丰富的基础模型支持。

- 根据需求持续改进和增强常用深度学习框架,形成最佳实践,以更好地适配 LLM 的开发需求。

- 应用 AI 能力提升大规模系统的自动化水平,为用户和管理者提供卓越的智能体验,特别是在 LLM 驱动的智能服务领域。

我们是一个充满活力、锐意进取的团队,期待你的加入,与我们一同探索人工智能的无限可能,为人类创造更多价值。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →