岗位描述
【工作职责】
1. 构建大模型训练框架并针对多模态大模型场景进行深度优化,包括并行策略优化、模型计算与通信优化、数据读取优化,框架稳定性优化等;
2. 研发大模型分布式训练加速技术,包括AutoML、混合精度训练、分布式梯度压缩等技术,支持多模态大模型预训练、强化学习算法等,支撑十PB级规模大数据的高效训练;
3. 研发大模型推理加速技术,包括投机采样、并行解码、量化压缩、KV-Cache优化等;
4. 研发自动化训练技术,实现模型训练、过程监控、评测、量化、转换的端到端自动化工作流,加速算法从研究到落地的转化;
5. 与基础设施 & 高性能计算工程师协作,针对分布式训练系统和推理引擎进行协作优化;与嵌入式工程师协作,针对产品平台进行算法优化和部署。
【任职要求】
1. 计算机科学、信息工程、电子工程、软件工程等专业本科及以上学历;
2. 具备扎实的编程能力,熟练使用C++/Python进行开发;
3. 熟练使用DeepSpeed/Megatron/LaMMA-Factory等分布式训练框架,熟悉模型并行、数据并行、流水线并行等加速策略;
4. 具备良好的编程风格习惯、文档撰写能力、团队协作和沟通表达能力;
5. 有Cuda编程经验,了解分布式缓存、大数据计算框架原理;
6. 有ACM/ICPC竞赛经验者优先。