岗位描述
岗位职责:
1. 负责AI算子库在大模型推理背景MOE Layer的核心数学库算子(Fused Moe/Masked Group Gemm/Contiguous Group Gemm/Mega Moe)的多种数据类型实现(bf16/int8/int4/fp8/mxfp4)在沐曦GPU上的功能实现和性能优化;
2. 负责支持热门大模型推理(DeepSeek、GLM、Qwen、MiniMax、Kimi等)中MOE layer在沐曦GPU上的性能优化;
3. 支持流行的大模型推理框架及上层调用,如SGLang/vLLM/DeepGemm等;
岗位要求:
1. 至少3年C++编程经验,具备良好的编程能力和工程经验;
2.了解vLLM/SGLang/DeepGemm;
3. 具有CUDA, ROCM, OpenCL相关开发经验者优先;
4. 具有cutlass相关开发经验者优先
5. 优先加分项:具有AI算子开发和优化经验;