锦鲤求职

Shopee

大模型训练研发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

职位描述

负责大模型分布式训练框架、工具链及配套生态的研发与建设,支撑超大规模模型从预训练、SFT 到 RL 的端到端训练。

负责千卡规模及以上训练任务的性能优化与稳定性建设,覆盖计算、通信、显存、数据加载和存储等关键链路,持续提升训练吞吐、资源利用率及集群可靠性。

设计、实现并优化分布式训练核心能力与并行策略,包括数据并行、张量并行、流水线并行、专家并行及混合并行等。

面向 SFT、RL 等后训练场景,建设和优化训练框架核心能力,包括多轮对话数据处理、长序列训练、动态批处理、样本生成与回放、奖励建模及在线训练等相关能力。

跟踪并探索大模型训练、SFT/RL 后训练、分布式系统及软硬件协同优化领域的前沿技术,推动技术能力在业务场景中的落地与演进。

职位要求

熟悉大模型分布式训练的核心原理与工程实践,具备数据并行、张量并行、流水线并行、ZeRO/FSDP 等一种或多种技术的实际项目经验。

熟练使用 PyTorch,了解 Megatron-LM、FSDP、DeepSpeed、VeRL 等主流分布式训练框架,能够独立定位和解决训练框架及任务运行中的复杂问题。

熟悉 Transformer 架构及大模型训练流程,了解预训练、SFT、RL 等训练范式,以及混合精度训练、梯度检查点、激活重计算等常用优化技术。

具备扎实的性能分析与问题排查能力,能够定位复杂训练场景中的性能、稳定性和资源瓶颈,并推动优化方案的设计与落地。

具备良好的工程能力、学习能力和团队协作意识,能够与算法、平台、基础设施等团队高效协同,推进关键项目交付。

加分项

有大规模 LLM 预训练、SFT、RL 训练系统研发或优化经验。

有大规模 GPU 集群训练、性能调优或稳定性治理经验。

熟悉高速互联与通信优化,如 RDMA、InfiniBand、RoCE、NVLink/NVSwitch 等。

有开源分布式训练框架、深度学习编译器或 CUDA 相关项目贡献。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →