岗位描述
【工作职责】
1.针对大模型推理中的 GEMM、Attention、MoE 等核心计算,使用 CUDA、CUTLASS、Triton或 TileLang
进行实现和优化。
2.结合 CUDA Core、Tensor Core 和 GPU 内存层级,改写算子融合、数据布局、任务切分及流水执行方式,减少访存、同步和
Kernel Launch 开销。
3.针对 Prefill、Decode 等不同负载,优化 Kernel 选择、CUDA Graph 及任务调度策略,提升吞吐、时延和计算资源利用率。
4.紧贴模型结构和推理算法演进,与框架及芯片团队共同设计硬件友好的计算流程,并对真实推理负载持续进行性能分析。
【核心要求】
1.熟悉 C/C++和 CUDA,具备 GPU Kernel 开发及性能优化经验。
2.深入理解 GPU 体系结构,熟悉 CUDA Core、Tensor Core、Warp 执行模型、内存层级及指令流水。
3.熟悉 Transformer 推理流程,理解 GEMM、Attention、KV Cache 和 MoE 等核心计算。
4.熟悉 CUTLASS、Triton、TileLang 等至少一种算子开发工具,具备计算融合、数据布局或并行切分经验。
5.熟悉 FlashAttention、DeepGEMM 等高性能算子的实现思路,能够结合性能分析结果完成端到端优化。
【加分项】(不强制要求)
模型量化、PTX/SASS、AI 编译器、分布式推理、NPU 算子开发、高性能计算开源项目。