岗位描述
岗位职责
1、负责 DeepSeek、GLM、Qwen、Kimi、MiniMax 等大模型的推理部署和性能优化。
2、负责 SGLang、vLLM 等推理引擎的参数配置、问题修复和代码优化。
3、负责 TP、DP、EP、MTP、投机解码、Prefill/Decode 分离等推理策略。
4、负责 DeepEP、DeepGEMM、FlashInfer 等算子、通信和内核优化。
5、负责 HiCache、Mooncake、LMCache 等 KV Cache 方案的设计、验证和调优。
6、优化 TTFT、TPOT、吞吐、并发、显存、缓存命中率和 GPU 利用率。
7、分析 NCCL、NVLink、IB/RoCE、GPU Kernel 和显存相关性能问题。
8、 跟踪模型和推理框架版本变化,维护生产环境部署配置。
9、完成领导安排的相关工作。
岗位要求
1、 2 年以上大模型推理、GPU Kernel、推理框架或高性能计算经验。
2、熟悉 SGLang、vLLM、TensorRT-LLM 至少一项,熟悉其中两项以上优先。
3、熟悉 TP、PP、DP、EP、MoE、KV Cache、Continuous Batching。
4、熟悉 Python、C++、CUDA 至少两种。
5、熟悉 DeepEP、DeepGEMM、FlashInfer、Triton、NCCL 中至少一项。
6、能使用 Nsight Systems、Nsight Compute、DCGM 等工具定位性能问题。
7、加分项:
有 DeepSeek、GLM、Qwen、Kimi、MiniMax 等模型部署经验。
有 FP8、FP4、NVFP4、W4A16、MTP 或 EAGLE 经验。
有 H100、H200、B200、B300等千卡以上规模推理集群项目经验。
有 HiCache、Mooncake、LMCache 或 PD 分离经验。