岗位描述
工作内容
1,参与工业垂直领域的基础大模型预训练、全量微调技术以及参数高效微调工作;
2,参与研究分布式训练加速与显存优化框架,设计高效的数据并行、模型并行或混合并行策略;
3,针对特定工业数据特征,参与探索并优化深度学习前沿网络架构,持续提升模型的生成质量与泛化能力;
4,面向工业大规模多模态数据的高效处理流,为大模型训练构建构建高质量训练数据流。
任职条件
1,理解Transformer架构及其衍生模型的核心机制;熟悉主流的生成式AI算法;
2,熟练使用深度学习框架,具备多机多卡分布式训练的实操经验;熟悉分布式训练框架及显存优化技术,熟悉混合精度训练与显卡利用率调优;
3,编程与工程能力,熟练掌握Python编程,具备优秀的算法实现与工程封装能力,熟悉Linux开发环境及Docker容器化技术,有大模型训练项目或开源贡献,熟悉模型压缩、量化如QAT者优先。