岗位描述
岗位职责
1. 负责大模型(LLM/多模态生成/视觉理解等)推理引擎的性能优化与自研,包括调度策略、显存管理、算子融合、量化压缩等核心技术攻坚;
2. 深入 GPU/CPU 底层架构,通过 CUDA/Triton 自定义 Kernel 开发、软硬协同优化,提升 AI 模型在服务端和客户端的推理性能,降低计算成本与功耗;
3. 结合音视频/图像处理业务场景(编解码、画质增强、AI 视频分析等),推动 AI 高性能计算能力在多媒体算法中的工程落地与规模化应用;
4. 跟踪 AI 推理领域前沿技术(投机解码、KV Cache 优化、分布式并行、异构硬件适配等),持续输出可复用的性能优化方案。
岗位要求
1. 精通 C/C++ 编程,熟悉 Python 编程,具备 Linux/Android/iOS 中至少一种系统平台的开发经验;
2. 熟悉 GPU 高性能计算,熟练掌握 CUDA/Triton 编程,具备 Kernel 级性能调优经验(如算子融合、内存访问优化、CUDA Graph 应用等);
3. 具备大模型推理引擎优化经验,熟悉 vLLM/SGLang/TensorRT-LLM 等主流推理框架的架构设计(调度策略、PagedAttention/RadixAttention、Continuous Batching 等),有推理框架自研或深度二次开发经验者优先;
4. 熟悉模型量化/压缩/混合精度等优化手段(INT8/FP8/GPTQ/AWQ 等),了解投机解码(Speculative Decoding)、MoE 专家并行等前沿加速技术者优先;
5. 熟悉主流深度学习框架(PyTorch/TensorFlow),具备大模型/多模态生成模型(LLM、Diffusion 等)的推理性能分析与优化经验;
6. 熟悉音视频处理流程(转码、合流、渲染、播放),熟悉 FFmpeg/GStreamer/OpenCV 等开源媒体处理框架者优先;