岗位描述
岗位职责:
1、负责视觉语言大模型(VLM)在消费级显卡(RTX 30x0/40x0)及服务器端的高性能推理服务开发,将Python算法原型转化为稳定的C++生产级服务;
2、主导模型压缩与加速工作,包括量化(INT8/FP16/W8A8)、剪枝、蒸馏,确保百亿级参数模型在≤24GB显存下高效运行;
3、基于TensorRT、vLLM、llama.cpp等框架进行深度定制,完成模型转换、推理引擎调优及精度对齐;
4、针对Transformer架构及多模态融合层(如CLIP、Q-Former)进行源码级性能分析,优化FlashAttention、PagedAttention及KV Cache机制;
5、设计高复用、低耦合的推理服务架构,支持多模型热加载与动态分辨率输入,保障系统的长期可维护性。
任职要求:
1、学历专业: 计算机、电子、自动化、人工智能等相关专业,硕士及以上学历(优秀本科可放宽);
2、工作经验: 有模型推理优化或高性能C++开发经验,有至少1个VLM或大模型在消费级显卡上的完整落地项目;
3、硬性技能:
- 语言: 精通Python与C++(现代C++17/20),两者缺一不可;
- 框架: 熟练使用TensorRT、vLLM、llama.cpp,能独立完成ONNX导出及引擎调优;
- CUDA: 具备手写高性能Kernel能力,熟练使用Nsight等工具进行显存与延迟瓶颈分析;
- 架构: 具备中型项目架构设计经验,擅长模块解耦、接口抽象,代码严格遵循RAII与智能指针规范。
加分项:
有vLLM、TensorRT-LLM或llama.cpp等开源框架的核心代码贡献者身份。
熟悉ONNX Runtime或自定义CUDA算子开发。