岗位描述
岗位职责
(满足以下任意一方向):
1. 负责dense/moe/多模态/强化学习等模型的大规模分布式优化,持续提高大规模分布式场景的算力利用率;
2. 负责大模型训练框架及相关定制通信算子的开发、调试、优化与维护;
3. 负责大规模训练容错库相关开发,优化在超大规模场景下的快速恢复;
4. 负责超大规模集群下的训练性能建模;
5. 跟踪分布式前沿优化技术和社区动态,持续改进产品性能;
岗位要求
1. 掌握现代c++,python编程,熟悉linux系统及程序调试分析方法,熟悉cuda编程模型,了解常见AI芯片架构及底层硬件原理,了解并行计算、异构计算、分布式系统等相关知识。
2. 掌握pytorch高性能编程方法,熟悉Megatron、DeepSpeed、Transformer Engine、Verl、Slime、Vllm、SGlang等框架之一。
3. 熟悉至少一种人工智能领域场景;
4.加分项:
a. 熟悉mpi,nccl,分布式通信优化策略者优先。
b.具有多机多卡调试经验者优先。
c.具有大模型训练容错经验者优先。
d.具有nvshmem、mooncake、deepep等之一定制通信库使用开发经验者优先。
e.具有fp8/fp4训练经验者优先。
f.具有训练框架、算子融合开发优化经验者优先。
g. 具有强化学习框架使用开发优化经验者优先。
h.熟悉常用数学建模及验证方法者优先。