岗位描述
岗位职责
1. 推理引擎性能优化:负责大模型推理引擎的性能优化,基于vLLM/SGLang等开源框架进行二次开发,提升推理吞吐量与降低延迟;
2. PagedAttention机制研发:研发并优化PagedAttention(分页注意力)机制,实现KV Cache的高效管理与显存利用率提升;
3. Continuous Batching落地:推进Continuous Batching(连续批处理)技术落地,实现请求级动态批处理,提升GPU利用率与系统吞吐;
4. Speculative Decoding研发:研发Speculative Decoding(投机解码)等推理加速技术,在保证输出质量的前提下显著降低推理延迟;
5. 分布式推理策略落地:推进TP/PP/CP/EP/DP等分布式推理策略落地,支持百亿/千亿参数大模型的多卡分布式推理部署;
6. 全链路性能调优:参与推理服务的全链路性能调优,包括网络通信、显存管理、算子优化等。
岗位要求
1、硕士及以上学历,计算机、电子工程相关专业;
2、熟悉PyTorch等深度学习框架,了解Transformer架构与大模型推理原理,掌握Python编程语言,了解C++/CUDA编程基础,了解模型量化、蒸馏、剪枝等模型压缩技术;
3、具备良好的算法理解与工程实现能力,对系统性能优化有极致追求;
4、具备良好的学习能力与问题排查能力;
5、有vLLM/SGLang/TensorRT-LLM使用或二次开发经验者优先,掌握CUDA编程与GPU性能优化技术(Kernel Fusion、Tensor Core等)者优先,有大模型分布式推理或训练经验者优先。