锦鲤求职

南威软件

推理引擎研发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、负责 DeepSeek、GLM、Qwen、Kimi、MiniMax 等大模型的推理部署和性能优化。
2、负责 SGLang、vLLM 等推理引擎的参数配置、问题修复和代码优化。
3、负责 TP、DP、EP、MTP、投机解码、Prefill/Decode 分离等推理策略。
4、负责 DeepEP、DeepGEMM、FlashInfer 等算子、通信和内核优化。
5、负责 HiCache、Mooncake、LMCache 等 KV Cache 方案的设计、验证和调优。
6、优化 TTFT、TPOT、吞吐、并发、显存、缓存命中率和 GPU 利用率。
7、分析 NCCL、NVLink、IB/RoCE、GPU Kernel 和显存相关性能问题。
8、 跟踪模型和推理框架版本变化,维护生产环境部署配置。
9、完成领导安排的相关工作。

岗位要求
1、 2 年以上大模型推理、GPU Kernel、推理框架或高性能计算经验。
2、熟悉 SGLang、vLLM、TensorRT-LLM 至少一项,熟悉其中两项以上优先。
3、熟悉 TP、PP、DP、EP、MoE、KV Cache、Continuous Batching。
4、熟悉 Python、C++、CUDA 至少两种。
5、熟悉 DeepEP、DeepGEMM、FlashInfer、Triton、NCCL 中至少一项。
6、能使用 Nsight Systems、Nsight Compute、DCGM 等工具定位性能问题。
7、加分项:
有 DeepSeek、GLM、Qwen、Kimi、MiniMax 等模型部署经验。
有 FP8、FP4、NVFP4、W4A16、MTP 或 EAGLE 经验。
有 H100、H200、B200、B300等千卡以上规模推理集群项目经验。
有 HiCache、Mooncake、LMCache 或 PD 分离经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →