岗位描述
【工作职责】
针对自动驾驶业务需求,搭建大规模分布式训练框架和系统,研发大数据预训练技术。作为技术专家,主导以下一项或多项研发工作:
1. 分布式训练框架的深度优化,包括并行优化策略、模型计算与通信优化、框架稳定性优化等;
2. 分布式训练算法优化技术,包括AutoML、混合精度训练、低比特训练、分布式梯度压缩等技术,支持PB级数据规模的高效训练;
3. 大规模数据的高效学习算法,包括大规模预训练、多任务学习、自监督/半监督学习等算法,提升数据利用效率;
4. 深度学习系统工具链的开发和优化,实现模型训练、量化、转换、测试的端到端自动化工作流,加速算法从研究到落地的转化;
5. 与基础设施 & 高性能计算工程师协作,针对分布式训练系统进行优化;与嵌入式工程师协作,针对产品平台进行算法优化和部署。
【任职要求】
1. 计算机科学、信息工程、电子工程、机器人等专业硕士及以上学历;
2. 具备扎实的编程能力,熟练使用C++/Python进行开发;
3. 熟练使用至少一种深度学习框架(Pytorch/Tensorflow等);
4. 熟悉常见的分布式训练框架、训练加速方法;
5. 具备良好的编程风格习惯、文档撰写能力、团队协作和沟通表达能力。
加分项:
1. 有ACM/ICPC竞赛经验;
2. 有Cuda编程经验;
3. 了解分布式训练系统、大数据计算框架原理。