锦鲤求职

阿丘科技

高性能计算工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:

1、负责视觉语言大模型(VLM)在消费级显卡(RTX 30x0/40x0)及服务器端的高性能推理服务开发,将Python算法原型转化为稳定的C++生产级服务;

2、主导模型压缩与加速工作,包括量化(INT8/FP16/W8A8)、剪枝、蒸馏,确保百亿级参数模型在≤24GB显存下高效运行;

3、基于TensorRT、vLLM、llama.cpp等框架进行深度定制,完成模型转换、推理引擎调优及精度对齐;

4、针对Transformer架构及多模态融合层(如CLIP、Q-Former)进行源码级性能分析,优化FlashAttention、PagedAttention及KV Cache机制;

5、设计高复用、低耦合的推理服务架构,支持多模型热加载与动态分辨率输入,保障系统的长期可维护性。

任职要求:

1、学历专业: 计算机、电子、自动化、人工智能等相关专业,硕士及以上学历(优秀本科可放宽);

2、工作经验: 有模型推理优化或高性能C++开发经验,有至少1个VLM或大模型在消费级显卡上的完整落地项目;

3、硬性技能:

- 语言: 精通Python与C++(现代C++17/20),两者缺一不可;

- 框架: 熟练使用TensorRT、vLLM、llama.cpp,能独立完成ONNX导出及引擎调优;

- CUDA: 具备手写高性能Kernel能力,熟练使用Nsight等工具进行显存与延迟瓶颈分析;

- 架构: 具备中型项目架构设计经验,擅长模块解耦、接口抽象,代码严格遵循RAII与智能指针规范。

加分项:

有vLLM、TensorRT-LLM或llama.cpp等开源框架的核心代码贡献者身份。

熟悉ONNX Runtime或自定义CUDA算子开发。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →