锦鲤求职

大疆

大模型推理部署算法工程师(上海)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

职位简介:

大疆正在把云端训练好的大模型,一路压到手机、平板与自研芯片端侧,让"在 GPU 上跑得起"的 SOTA 模型变成"在低功耗设备上跑得稳"的产品能力,这一层同时服务各产品线。从模型量化、剪枝、蒸馏、稀疏化,到高性能算子开发、推理图优化、多硬件后端适配,再到推理服务治理与模型-芯片垂直整合,我们具备完整技术栈。我们寻找相信"端-边-云三层架构能否落地,取决于这一层"的同路人,与我们一起,把大模型从云上的奇迹,带到端侧的日常。

工作职责:

1. 负责大模型量化、剪枝、蒸馏、稀疏化等模型压缩算法在端-边-云多端的落地;

2. 负责高性能算子开发、推理图优化与多硬件后端适配;

3. 负责推理服务治理,包括动态批处理、多模型调度、显存/算力复用等关键能力;

4. 牵引模型与自研芯片的垂直整合,参与下一代芯片的算法侧需求定义。

任职要求:

基本要求

1. 计算机、电子、自动化等相关专业,硕士及以上学历;

2. 扎实的 C++/CUDA/Python 工程能力,熟悉至少一种主流推理框架(TensorRT/TensorRT-LLM/vLLM/TVM/MNN/NCNN/llama.cpp);

3. 在模型量化(INT8/INT4/FP8)、剪枝、蒸馏、稀疏化任一方向有实战经验;

4. 理解 Transformer、Diffusion、VLM 模型结构与典型推理瓶颈。

加分项

1. MLSys/OSDI/ASPLOS/SC/CVPR/NeurIPS 等顶会一作论文,或主流推理框架核心贡献者;

2. 在手机、平板、端侧 NPU 或自研芯片上完成过大模型量产部署;

3. 熟悉 PagedAttention/FlashAttention/Speculative Decoding/KV-Cache 优化等 LLM 推理前沿;

4. 有自定义 GPU/NPU 算子开发或编译器(TVM/Triton/MLIR)二次开发经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →