岗位描述
岗位职责
职位描述
我们正在构建面向前沿大模型的高性能推理引擎,围绕 GPU 与异构加速器上的计算、通信、存储和调度,优化真实业务中的吞吐、首 Token 延迟、逐 Token 延迟与服务成本。
实习期间,你将结合兴趣与技术积累,深入参与以下一个或多个核心方向:
1.投机解码与算法–系统协同优化:研究与实现 MTP、EAGLE 等投机解码方案,优化草稿生成、并行验证与执行调度;分析接受率、额外计算开销和实际加速收益,解决不同请求长度与并发负载下的性能问题。
2.分布式 KV Cache 与多级存储:参与 GPU 显存、主机内存及 SSD 上的多级 KV Cache 系统设计,优化缓存复用、淘汰、预取与跨节点传输;结合 RDMA、异步 I/O 等技术,降低长上下文和多轮对话场景的重复计算与数据搬运开销。
3.分布式推理架构与调度:参与 Prefill/Decode 分离、张量并行、专家并行及多副本调度优化,研究缓存感知路由、负载均衡与计算通信重叠,解决排队、通信和跨节点 KV 传输瓶颈。
4.GPU 算子与执行优化:围绕 Attention、MoE、低精度计算等关键路径,开展 CUDA / Triton kernel、算子融合、CUDA Graph 和访存优化,提升不同模型结构与负载下的执行效率。
5.性能分析与工程落地:深入 vLLM、SGLang 等推理框架源码,建立可复现的性能评测与正确性验证,将优化落实到真实请求的延迟、吞吐和资源成本,并参与开源贡献。
岗位要求
1.计算机、软件工程、人工智能、电子工程、数学等相关专业在校学生,每周可到岗 4 天及以上,实习时长不少于 4 个月。
2.熟练掌握 C++ 或 Python 中至少一门,具备扎实的操作系统、计算机体系结构、数据结构与算法基础。
3.理解 Transformer 的主要计算过程,以及 LLM 推理 Prefill / Decode 两阶段的计算、访存与 KV Cache 特性;使用过 vLLM、SGLang、TensorRT-LLM 中至少一个推理框架。
4.在以下至少一个方向有深入学习或实践:投机解码、分布式 KV Cache / 存储、分布式推理与调度、GPU 算子优化、高性能通信。能够结合源码、实验或项目,讲清楚核心机制、性能瓶颈与设计取舍。
5.具备独立定位问题和验证假设的能力,能够通过日志、Profiler 或对照实验分析性能问题,并清晰说明优化结果及其适用条件。
加分项
1.实现或优化过 MTP、EAGLE 等投机解码方案,分析过接受率、验证开销与端到端加速之间的关系。
2.参与过 KV Cache 管理、前缀缓存、多级缓存或分布式存储项目,理解缓存命中、数据传输与计算节省之间的权衡。
3.写过 CUDA / Triton kernel,熟悉 tiling、warp-level primitive、异步 copy 等优化手段,能使用 Nsight 定位计算、访存或执行调度瓶颈。
4.了解 NCCL / HCCL 通信机制,或有 RDMA、libibverbs、GPUDirect RDMA 等开发经验。
5.深入阅读或修改过 vLLM、SGLang、TensorRT-LLM、FlashAttention、Mooncake、CUTLASS、Triton 等项目,或提交过有实质内容的 PR / Issue。
6.有能够体现技术深度的项目、论文、技术博客或性能分析工具;能够提供可复现的实验与结果。
7.能连续实习 6 个月以上。
简历建议
请重点展开你最深入的一项相关工作:解决了什么问题、你具体实现了什么、如何定位瓶颈,以及在什么模型、硬件和负载下取得了什么结果。课程项目、个人实验和开源贡献均可,不要求覆盖所有技术方向。