岗位描述
职位描述
1. 负责设计和建设公司的大模型推理系统,推动大模型相关算法、模型的落地,打造高吞吐、低延时的推理系统。
2. 设计和开发面向公司的大模型推理服务框架和引擎。
3. 持续优化大模型推理服务性能,提升吞吐、降低延迟并优化整体成本。
4. 跟进和探索前沿的大模型推理技术,不断追求业务突破 。
职位要求
1. 熟练掌握 C++、Python 语言,熟悉 CPU/GPU 异构系统性能调优,有丰富的 AI 工程实践和落地经验。
2. 熟悉常见的 LLM 推理优化方案,包括但不限于 Batching、分布式推理、模型压缩(量化、稀疏化)、PD 分离、投机采样等相关技术。
3. 熟悉 GPU 体系结构及相关高性能计算加速技术,了解常用的 CUDA 优化方法。
4. 有 vLLM/TensorRT-LLM/SGlang/TensorRT 等大模型推理框架的实际使用经验。
5. 了解常见的分布式并行策略,比如张量并行、专家并行、流水线并行和序列并行等。
6. 具有良好的团队合作精神和沟通能力,能够与跨部门的团队紧密合作,共同推动项目的成功。
7. 具备较强的学习能力和责任心,能和团队一起探索新技术,对业务产生价值。
加分项
1. 熟悉 CUTLASS、DeepGEMM 等算子库,熟悉 PTX ISA 并深入理解 Memory Model 和 GPU硬件体系结构。
2. 熟悉主流分布式通信库(如 NCCL、NVSHMEM 和 DeepEP 等)的底层实现原理,具备性能调优与故障排查经验。
3. 具备 DSL 系统的开发经验,熟悉 CuteDSL/TileRT/Triton 等任一编译栈或高性能算子 DSL,或者有通算融合以及MegaKernel开发经验。
4. 在大型开源软件(如 vLLM、SGLang 等)中有深度贡献,或维护过其他个人开源软件。
团队介绍
AI 平台团队致力于打造 Shopee 人工智能研发的基础平台,专注于引入和发展前沿的人工智能工程技术,为客户创造价值。我们的目标是让 Shopee 的 AI 研究员与工程师在处理复杂的数据、算法和算力问题时,能够轻松且高效地开展工作。团队成员在人工智能领域拥有多年经验,曾建设过业界一流的深度学习工具与平台。加入我们,你将有机会:
- 参与建设新一代超大规模、云原生、弹性可伸缩的 AI 平台,实现数据管理、模型训练到算法上线的全流程一站式标准化操作,助力团队在 LLM(Large Language Model,大语言模型)时代高效开发和部署模型。
- 面向现代高性能计算、网络和存储设备,设计并构建全新的基础设施方案,深度挖掘硬件潜能,为 LLM 的高效运行提供强大支持。
- 探索千亿参数级别大规模深度学习的高效训练方法,优化 LLM 训练流程,提升模型性能和效率。
- 研发完整的便捷模型工具链,通过量化、压缩、剪枝、蒸馏等方式,将深度学习模型转化为高效可用的算法服务,特别关注 LLM 的优化和部署。
- 构建一套可复用的高质量基础深度学习算法模型库,助力算法研究员与工程师快速应用业界最新研究成果解决业务问题,为 LLM 的开发和应用提供丰富的基础模型支持。
- 根据需求持续改进和增强常用深度学习框架,形成最佳实践,以更好地适配 LLM 的开发需求。
- 应用 AI 能力提升大规模系统的自动化水平,为用户和管理者提供卓越的智能体验,特别是在 LLM 驱动的智能服务领域。
我们是一个充满活力、锐意进取的团队,期待你的加入,与我们一同探索人工智能的无限可能,为人类创造更多价值。