岗位描述
【工作职责】
1.针对 Transformer、MoE 及多模态模型,分析 Prefill、Decode
阶段的计算、访存和数据流特征,建立真实推理负载的性能模型。
2.在不改变模型语义的前提下,重构推理计算流程,减少冗余计算、数据搬运和同步开销,提升端到端执行效率。
3.研究并落地投机解码、KV Cache 复用与管理、长序列推理等优化方案,并与推理引擎团队共同完成系统实现。
4.开展 FP8、FP4、INT8、INT4 等低精度推理研究,负责量化策略、误差分析、混合精度及硬件适配。
5.基于模型结构和真实推理负载,与系统及芯片架构团队开展软硬件协同设计,提炼计算、存储、互联和数值精度需求,参与下一代 AI芯片的架构定义与验证。
【核心要求】
1.熟悉 Python、C/C++和 PyTorch,具备良好的算法实现及系统开发能力。
2.深入理解 Transformer、Attention、KV Cache、MoE、采样以及 Prefill、Decode 等推理机制。
3.具备投机解码、KV Cache 优化、计算图变换或低精度推理中至少一个方向的实际落地经验。
4.熟悉至少一种主流大模型推理框架,能够完成优化方案的实现、集成和性能验证。
5.理解 GPU、NPU 等 AI 加速器的计算与存储特征,能够分析计算、访存、调度及数据传输瓶颈。
6.具备良好的实验设计、性能分析和跨团队协作能力,能够从模型负载中提炼软硬件优化需求。
【加分项】(不强制要求)
CUDA/Triton、vLLM、SGLang、模型量化、长序列推理、分布式推理、AI 编译器、性能建模、GPU/NPU
架构、芯片软硬件协同、开源项目经验。