岗位描述
岗位职责
1. 多平台模型适配与迁移 (Model Porting):
负责将 GLM-4、Qwen、DeepSeek 等主流开源 Coding 模型,快速适配到公司现有的国产算力环境(如华为昇腾、海光等)以及 NVIDIA 环境中。
解决模型在国产硬件上运行时出现的算子不支持、精度对齐、依赖冲突等兼容性问题,确保模型能跑通且结果正确。
2. 推理性能极致优化 (Performance Tuning):
通过算子融合、KV Cache 优化、Continuous Batching 等技术手段,在给定硬件上最大化模型的推理吞吐量(Throughput)并降低延迟。
熟练运用量化技术(Int8/Int4/GPTQ/AWQ),在保证代码生成质量的前提下,压缩显存占用,提升单卡并发能力。
3. 稳定服务构建 (Reliable Serving):
基于 vLLM、MindIE (华为)、TGI 等推理框架,构建高可用的本地推理服务。
封装标准的 OpenAI 接口供 Coding Agent 调用,并负责处理长上下文(Long Context)下的显存管理,防止 OOM(显存溢出)导致服务崩溃。
岗位要求
1. 硬性技能(核心):
双栈开发经验: 既熟悉 NVIDIA CUDA 生态,又具备 国产算力卡(华为 Ascend/CANN、海光 DTK 或 摩尔线程 MUSA 其中之一)的实际模型部署经验。
推理框架专家: 精通 vLLM 或 HuggingFace TGI 的部署与参数调优;针对国产卡,熟悉厂商专用的推理工具(如华为 MindIE / MindSpore Lite)者优先。
2. 模型工程能力:
熟悉 Transformer 结构,能够处理模型格式转换(HuggingFace -> GGUF/ONNX/MindIR)。
有大模型量化部署经验,理解不同量化方式对精度的影响。
Coding 能力:
熟练掌握 Python 和 C++,具备阅读和修改底层推理代码的能力(不仅仅是调包)。
熟悉 Linux 系统调优。
3. 加分项 (Plus)
有 GLM (智谱) 或 Qwen (通义千问) 系列模型在国产卡上的专项落地经验。
了解代码生成场景的特殊优化(如 Fill-In-the-Middle 模式支持)。