锦鲤求职

Shopee

【S&R&A】机器学习平台研发专家(训练方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

关于团队

EGO团队致力于打造一个业界领先的机器学习平台,来有效地支撑公司推荐、搜索、广告等众多业务下的算法落地,针对GR(Generative Recommendation)模型和传统大规模稀疏参数模型的训练和预估进行极致的优化,使其在电商场景下发挥最大的效能,为公司带来更大的收益。

EGO平台涵盖深度机器学习的整套流程,从样本的组织和摄入、训练,到模型build和发布,再到线上加载模型和提供预估服务,并配有完备的Web Portal和灵活易用的Restful API接口,为用户提供端到端的一站式机器学习平台。

职位描述

负责模型的分布式训练平台研发与优化,支撑Shopee各业务线高效的深度模型训练需求;

专注于构建高性能、可扩展的训练平台,持续深入进行模型CPU/GPU训练相关的优化,不断降低模型训练的成本;

探索LLM与搜广推模型相结合的训练方式,支持模型并行(单机多卡、多机多卡),加速GR模型从试验到生产的落地过程;

建设与维护高可用、高吞吐的分布式训练平台,提升平台易用性和迭代效率;

职位要求

本科及以上学历,计算机/电子/自动化/软件等相关专业,不低于2年工作经验;

精通C++编程,底层技术功底扎实,熟练掌握多线程编程,锁优化,内存池,线程池,模版编程,GDB调试,程序性能调优,RPC框架等技术;

具备GPU相关的经验,包括自定义或调优CUDA Kernel,使用Nsight等Profiling工具进行性能分析与瓶颈定位,通信与计算overlap提升GPU利用率等;

熟悉深度学习训练框架(如PyTorch、TensorFlow等)及其分布式训练机制;

对计算机技术有极高的热情,能够积极主动的学习,有深度钻研和实践精神,对交付的code高标准、严要求,做事严谨细致;

有模型并行(Tensor/Pipeline/Hybrid Parallelism)和混合精度训练研发经验者优先;

有NCCL、Megatron、DeepSpeed研发经验者优先;

有GR模型(HSTU、OneTrans等)分布式训练和优化经验者优先;

具备较强团队合作精神,有较强的问题定位与性能优化能力,对系统稳定性和工程质量有执着追求;

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →