岗位描述
【工作职责】
1. 大规模分布式训练的性能优化,包括数据读取、算子优化、通信优化、显存优化等,加快训练速度,提升训练系统稳定性和资源利用效率;
2. 持续分析&优化大规模多机集群的训练性能,与基础设施同事优化训练系统的整体效率和稳定性;
3. 跟进业内先进的训练框架和训练优化技术。
【任职要求】
1. 计算机科学、信息工程、电子工程、机器人等专业本科及以上学历;
2. 具备扎实的编程能力,熟练使用Python/C++/CUDA进行开发;
3. 熟练使用至少一种深度学习训练框架(Pytorch/Tensorflow/OneFlow/MindSpore等),掌握训练性能分析方法;
4. 熟悉常见的分布式训练优化技术,如数据并行、模型并行、流水线并行等;
5. 具备良好的编程风格习惯、文档撰写能力、团队协作和沟通表达能力。