岗位描述
职位描述
1. 负责大模型分布式训练框架、工具链及配套生态的研发与建设,支撑超大规模模型从预训练、SFT 到 RL 的端到端训练。
2. 负责千卡规模及以上训练任务的性能优化与稳定性建设,覆盖计算、通信、显存、数据加载和存储等关键链路,持续提升训练吞吐、资源利用率及集群可靠性。
3. 设计、实现并优化分布式训练核心能力与并行策略,包括数据并行、张量并行、流水线并行、专家并行及混合并行等。
4. 面向 SFT、RL 等后训练场景,建设和优化训练框架核心能力,包括多轮对话数据处理、长序列训练、动态批处理、样本生成与回放、奖励建模及在线训练等相关能力。
5. 跟踪并探索大模型训练、SFT/RL 后训练、分布式系统及软硬件协同优化领域的前沿技术,推动技术能力在业务场景中的落地与演进。
职位要求
1. 熟悉大模型分布式训练的核心原理与工程实践,具备数据并行、张量并行、流水线并行、ZeRO/FSDP 等一种或多种技术的实际项目经验。
2. 熟练使用 PyTorch,了解 Megatron-LM、FSDP、DeepSpeed、VeRL 等主流分布式训练框架,能够独立定位和解决训练框架及任务运行中的复杂问题。
3. 熟悉 Transformer 架构及大模型训练流程,了解预训练、SFT、RL 等训练范式,以及混合精度训练、梯度检查点、激活重计算等常用优化技术。
4. 具备扎实的性能分析与问题排查能力,能够定位复杂训练场景中的性能、稳定性和资源瓶颈,并推动优化方案的设计与落地。
5. 具备良好的工程能力、学习能力和团队协作意识,能够与算法、平台、基础设施等团队高效协同,推进关键项目交付。
加分项
1. 有大规模 LLM 预训练、SFT、RL 训练系统研发或优化经验。
2. 有大规模 GPU 集群训练、性能调优或稳定性治理经验。
3. 熟悉高速互联与通信优化,如 RDMA、InfiniBand、RoCE、NVLink/NVSwitch 等。
4. 有开源分布式训练框架、深度学习编译器或 CUDA 相关项目贡献。
团队介绍
AI 平台团队致力于打造 Shopee 人工智能研发的基础平台,专注于引入和发展前沿的人工智能工程技术,为客户创造价值。我们的目标是让 Shopee 的 AI 研究员与工程师在处理复杂的数据、算法和算力问题时,能够轻松且高效地开展工作。团队成员在人工智能领域拥有多年经验,曾建设过业界一流的深度学习工具与平台。加入我们,你将有机会:
- 参与建设新一代超大规模、云原生、弹性可伸缩的 AI 平台,实现数据管理、模型训练到算法上线的全流程一站式标准化操作,助力团队在 LLM(Large Language Model,大语言模型)时代高效开发和部署模型。
- 面向现代高性能计算、网络和存储设备,设计并构建全新的基础设施方案,深度挖掘硬件潜能,为 LLM 的高效运行提供强大支持。
- 探索千亿参数级别大规模深度学习的高效训练方法,优化 LLM 训练流程,提升模型性能和效率。
- 研发完整的便捷模型工具链,通过量化、压缩、剪枝、蒸馏等方式,将深度学习模型转化为高效可用的算法服务,特别关注 LLM 的优化和部署。
- 构建一套可复用的高质量基础深度学习算法模型库,助力算法研究员与工程师快速应用业界最新研究成果解决业务问题,为 LLM 的开发和应用提供丰富的基础模型支持。
- 根据需求持续改进和增强常用深度学习框架,形成最佳实践,以更好地适配 LLM 的开发需求。
- 应用 AI 能力提升大规模系统的自动化水平,为用户和管理者提供卓越的智能体验,特别是在 LLM 驱动的智能服务领域。
我们是一个充满活力、锐意进取的团队,期待你的加入,与我们一同探索人工智能的无限可能,为人类创造更多价值。