锦鲤求职

Shopee

【S&R&A】机器学习平台研发专家

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

关于团队

EGO团队致力于打造一个业界领先的机器学习平台,来有效地支撑公司推荐、搜索、广告等众多业务下的算法落地,针对GR(Generative Recommendation)模型和传统大规模稀疏参数模型的训练和预估进行极致的优化,使其在电商场景下发挥最大的效能,为公司带来更大的收益。

EGO平台涵盖深度机器学习的整套流程,从样本的组织和摄入、训练,到模型build和发布,再到线上加载模型和提供预估服务,并配有完备的Web Portal和灵活易用的Restful API接口,为用户提供端到端的一站式机器学习平台。

职位描述

负责研发搜广推稀疏大模型训练平台和推理平台的分布式参数服务器(Parameter Server,PS)系统,支持高吞吐的参数读写和更新服务,支持千亿特征,TB级别稀疏模型,同时支持在线实时学习、以及特征准入和过期淘汰等算法需求;

参与一站式机器学习平台研发,负责把PS系统集成到机器学习平台中,提供易用、稳定、高性能、平台化的分布式参数服务系统,提升平台的效率和易用性,加速算法同学的模型迭代效率;

参与构建高性能、可扩展的训练平台,持续深入进行模型CPU/GPU训练相关的优化,不断降低模型训练的成本;

探索LLM与搜广推模型相结合的训练方式,支持模型并行(单机多卡、多机多卡),加速GR模型从试验到生产的落地过程;

职位要求

本科及以上学历,计算机/电子/自动化/软件等相关专业,至少2年工作经验;

精通Python和C++编程,底层技术功底扎实,熟练掌握多线程编程,锁优化,内存池,线程池,模版编程,GDB调试,程序性能调优,RPC框架等技术;

有对分布式PS系统,分布式系统后台优化,高性能内存KV系统,基于NVMe-SSD的KV存储系统,高性能CS架构系统熟悉者优先;

熟悉大规模推荐系统训练特点,对Embedding参数规模扩展、Embedding多级存储(HBM / CPU Memory / SSD)、参数服务器架构或分布式Embedding有深入的理解和实践者优先;

熟悉深度学习训练框架(如PyTorch、TensorFlow等),具备单机多卡、多机多卡训练系统设计与优化经验,对卡间、机间通信(例如NCCL、RDMA)能够进行深度的分析和优化者优先;

有NCCL、Megatron、DeepSpeed、混合精度训练、模型量化等经验者优先;

有GR模型(HSTU、OneTrans等)分布式训练和优化经验者优先;

对计算机技术有极高的热情,能够积极主动的学习,有深度钻研和实践精神,对交付的code高标准、严要求,做事严谨细致;

具备较强团队合作精神,具有较强的持续学习能力;

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →