岗位描述
岗位职责
1. 分析端侧小模型和大模型推理中的典型模型结构、算子组成、计算模式和访存特征;
2. 识别模型部署中的关键性能瓶颈,包括算子性能、访存开销、数据搬运、精度损失、模型转换和端到端调度问题;
3. 参与 AI 芯片关键算子支持边界定义,评估哪些算子需要硬件增强、软件优化或模型侧改写;
4. 负责模型优化和算子优化方案设计,包括量化、算子融合、图优化、模型裁剪、低比特推理、KV Cache 优化等方向;
5. 支持端侧小模型和大模型 Benchmark 建设,定义典型模型、典型算子和典型输入规模,评估芯片真实场景性能;
6. 与硬件架构、软件系统、编译器、Runtime、算子库和性能建模团队协同,推动模型、算子和芯片架构的协同优化;
7. 跟踪业界主流模型和推理优化技术,持续分析其对 AI 芯片架构和软件栈的影响。
任职要求
1. 熟悉深度学习模型结构,理解 CNN、Transformer、Diffusion、端侧视觉模型、多模态模型或大模型推理中的一种或多种方向;
2. 熟悉典型 AI 算子特征,如 GEMM、Conv、Attention、LayerNorm、Softmax、Embedding、RoPE、KV Cache 等;
3. 理解 AI 芯片或异构计算平台上的性能瓶颈,能够从模型、算子、内存、带宽和硬件资源之间分析问题;
4. 具备良好的分析和文档能力,能够输出模型分析报告、算子分析报告、优化建议和 Benchmark 设计方案;
5. 具备跨团队沟通能力,能够与算法、架构、软件、算子、编译器和应用团队协同工作。
加分项
1. 有端侧 AI 模型部署经验,如视觉检测、分类、分割、OCR、语音、多模态、小模型推理等;
2. 有大模型推理优化经验,如 Transformer、MoE、KV Cache、Attention 优化、长上下文推理、多 batch / 多并发推理等;
3. 有 NPU、GPU、AI 加速器或端侧 AI SoC 上的模型适配和性能优化经验;
4. 有算子库开发、算子性能调优、Benchmark 建设或客户模型适配经验;
5. 有软硬件协同优化经验,能从模型和算子角度反向影响芯片架构设计。