岗位描述
岗位职责
1. 负责大模型推理关键组件的研发、适配与性能优化,包括但不限于 LMCache、Mooncake、Mori等通信库,以及 KV Cache 传输、分层缓存、PD 分离、专家并行通信等相关模块;
2. 面向自研 GPU/AI 芯片,完成推理组件在单机多卡、跨节点及超节点环境下的功能适配、稳定性建设和性能调优,解决计算、通信、内存与调度瓶颈;
3. 建立大模型端到端性能模型,结合模型结构、并行策略、硬件规格和业务负载,对 TTFT、TPOT、吞吐、并发能力、显存占用及扩展效率进行预估;
4. 建立算子性能预估与分析方法,覆盖 GEMM、Attention、MoE、通信及数据搬运等核心算子,分析计算量、访存量、通信量和硬件利用率;
5. 参与推理系统性能分析工具、自动化 Benchmark 和性能数据库建设,形成可复用的性能评估、瓶颈定位和优化闭环;
6. 跟踪并参与相关开源社区和前沿技术演进,推动优秀方案在自研芯片平台落地,并支撑客户场景的性能评估与技术方案设计。
岗位要求
1. 计算机、电子、通信、数学等相关专业本科及以上学历,具备扎实的计算机体系结构、操作系统、数据结构与算法基础;3年及以上相关工作经验。
2. 熟练掌握 C/C++ 和 Python,具备良好的工程实现、代码阅读、问题定位和性能调试能力;
3. 熟悉 GPU/AI 加速器编程及其软硬件体系,了解 CUDA、HIP、ROCm、NCCL/RCCL、RDMA、NVLink/XGMI 等一种或多种技术;
4. 熟悉主流大模型推理框架及其核心机制,如 vLLM、SGLang、TensorRT-LLM 等,了解连续批处理、Paged Attention、Prefix Cache、PD 分离、张量并行、数据并行、流水线并行和专家并行;
5. 具备以下至少一个方向的深入经验:
• 推理组件方向:熟悉 LMCache、Mooncake、DeepEP、NIXL、Mori 等组件之一,理解 KV Cache 管理与传输、RDMA/GPU P2P、MoE Dispatch/Combine 等实现;
• 端到端建模方向:能够基于模型配置、请求长度、并发度、并行策略和硬件规格建立吞吐、时延、显存和扩展性模型;
• 算子建模方向:熟悉 Roofline、算术强度、带宽/计算上限分析,能够对 GEMM、Attention、MoE 和通信算子进行性能预估;
6. 熟悉常用性能分析与 Profiling 工具,如 Nsight Systems/Compute、rocprof、PyTorch Profiler、perf 等,具备系统级性能瓶颈定位经验;
7. 具备较强的数据分析、抽象建模、文档表达和跨团队协作能力,能够将分析结论转化为可执行的优化方案;
8. 加分项:
• 有大模型推理组件、分布式通信库或推理框架开源贡献经验;
• 有多机多卡、超大模型、MoE 模型或 PD 分离系统的开发和优化经验;
• 有 GPU 微架构、算子库、编译器、性能模拟器或芯片性能评估经验;
• 有客户侧容量规划、TCO 分析或端到端性能预测项目经验。