锦鲤求职

北电数智

推理优化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 推理引擎性能优化:负责大模型推理引擎的性能优化,基于vLLM/SGLang等开源框架进行二次开发,提升推理吞吐量与降低延迟;
2. PagedAttention机制研发:研发并优化PagedAttention(分页注意力)机制,实现KV Cache的高效管理与显存利用率提升;
3. Continuous Batching落地:推进Continuous Batching(连续批处理)技术落地,实现请求级动态批处理,提升GPU利用率与系统吞吐;
4. Speculative Decoding研发:研发Speculative Decoding(投机解码)等推理加速技术,在保证输出质量的前提下显著降低推理延迟;
5. 分布式推理策略落地:推进TP/PP/CP/EP/DP等分布式推理策略落地,支持百亿/千亿参数大模型的多卡分布式推理部署;
6. 全链路性能调优:参与推理服务的全链路性能调优,包括网络通信、显存管理、算子优化等。

岗位要求
1、硕士及以上学历,计算机、电子工程相关专业;
2、熟悉PyTorch等深度学习框架,了解Transformer架构与大模型推理原理,掌握Python编程语言,了解C++/CUDA编程基础,了解模型量化、蒸馏、剪枝等模型压缩技术;
3、具备良好的算法理解与工程实现能力,对系统性能优化有极致追求;
4、具备良好的学习能力与问题排查能力;
5、有vLLM/SGLang/TensorRT-LLM使用或二次开发经验者优先,掌握CUDA编程与GPU性能优化技术(Kernel Fusion、Tensor Core等)者优先,有大模型分布式推理或训练经验者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →