岗位描述
职位简介:
大疆正在把云端训练好的大模型,一路压到手机、平板与自研芯片端侧,让"在 GPU 上跑得起"的 SOTA 模型变成"在低功耗设备上跑得稳"的产品能力,这一层同时服务各产品线。从模型量化、剪枝、蒸馏、稀疏化,到高性能算子开发、推理图优化、多硬件后端适配,再到推理服务治理与模型-芯片垂直整合,我们具备完整技术栈。我们寻找相信"端-边-云三层架构能否落地,取决于这一层"的同路人,与我们一起,把大模型从云上的奇迹,带到端侧的日常。
工作职责:
1. 负责大模型量化、剪枝、蒸馏、稀疏化等模型压缩算法在端-边-云多端的落地;
2. 负责高性能算子开发、推理图优化与多硬件后端适配;
3. 负责推理服务治理,包括动态批处理、多模型调度、显存/算力复用等关键能力;
4. 牵引模型与自研芯片的垂直整合,参与下一代芯片的算法侧需求定义。
任职要求:
基本要求
1. 计算机、电子、自动化等相关专业,硕士及以上学历;
2. 扎实的 C++/CUDA/Python 工程能力,熟悉至少一种主流推理框架(TensorRT/TensorRT-LLM/vLLM/TVM/MNN/NCNN/llama.cpp);
3. 在模型量化(INT8/INT4/FP8)、剪枝、蒸馏、稀疏化任一方向有实战经验;
4. 理解 Transformer、Diffusion、VLM 模型结构与典型推理瓶颈。
加分项
1. MLSys/OSDI/ASPLOS/SC/CVPR/NeurIPS 等顶会一作论文,或主流推理框架核心贡献者;
2. 在手机、平板、端侧 NPU 或自研芯片上完成过大模型量产部署;
3. 熟悉 PagedAttention/FlashAttention/Speculative Decoding/KV-Cache 优化等 LLM 推理前沿;
4. 有自定义 GPU/NPU 算子开发或编译器(TVM/Triton/MLIR)二次开发经验。