锦鲤求职

思特威

AI算法工程师-大模型推理

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

【工作职责】

1.针对 Transformer、MoE 及多模态模型,分析 Prefill、Decode

阶段的计算、访存和数据流特征,建立真实推理负载的性能模型。

2.在不改变模型语义的前提下,重构推理计算流程,减少冗余计算、数据搬运和同步开销,提升端到端执行效率。

3.研究并落地投机解码、KV Cache 复用与管理、长序列推理等优化方案,并与推理引擎团队共同完成系统实现。

4.开展 FP8、FP4、INT8、INT4 等低精度推理研究,负责量化策略、误差分析、混合精度及硬件适配。

5.基于模型结构和真实推理负载,与系统及芯片架构团队开展软硬件协同设计,提炼计算、存储、互联和数值精度需求,参与下一代 AI芯片的架构定义与验证。

【核心要求】

1.熟悉 Python、C/C++和 PyTorch,具备良好的算法实现及系统开发能力。

2.深入理解 Transformer、Attention、KV Cache、MoE、采样以及 Prefill、Decode 等推理机制。

3.具备投机解码、KV Cache 优化、计算图变换或低精度推理中至少一个方向的实际落地经验。

4.熟悉至少一种主流大模型推理框架,能够完成优化方案的实现、集成和性能验证。

5.理解 GPU、NPU 等 AI 加速器的计算与存储特征,能够分析计算、访存、调度及数据传输瓶颈。

6.具备良好的实验设计、性能分析和跨团队协作能力,能够从模型负载中提炼软硬件优化需求。

【加分项】(不强制要求)

CUDA/Triton、vLLM、SGLang、模型量化、长序列推理、分布式推理、AI 编译器、性能建模、GPU/NPU

架构、芯片软硬件协同、开源项目经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →