岗位描述
岗位职责
分析国内外先进大模型的模型结构和训练方法,挖掘性能优化空间,参与优化方案的设计与实现。
开展大模型训练性能预估与仿真,分析计算、通信和显存开销,优化并行策略和资源配置。
基于 Megatron-LM、DeepSpeed、PyTorch FSDP、verl 等框架,参与预训练、后训练及并行策略相关 Infra 开发。
跟踪 MoE、Attention、RLHF、Agentic RL 等前沿技术,解决大模型训练中的性能问题。
职位要求
计算机、电子信息、软件工程、自动化等相关专业,本科及以上学历。
熟悉 PyTorch 等深度学习框架,了解大模型训练及分布式并行的基本原理。
具备良好的编程和问题分析能力,有大模型相关项目或科研经验。
加分项
使用过 Megatron-LM、DeepSpeed、PyTorch FSDP、verl 等训练框架。
有大模型预训练、后训练、性能优化经验。
在这里你可以获得
深入理解先进大模型的结构、训练方法和优化思路。
参与训练优化方案及并行策略 Infra 的设计与实现。
积累大模型预训练、后训练和分布式训练实战经验。
注:本岗位设置笔试环节,请留意邮件或短信通知。