岗位描述
职位简介:
大疆正在重塑亿级消费者与智能硬件的交互方式——从遥控器与复杂菜单,全面转向自然语言下任务的多模态大模型范式。从模型选型、后训练、轻量化,到边侧高性能推理、端云协同协议,再到下一代消费交互范式定义,我们具备完整技术栈。我们寻找相信"边端是消费场景的关键一层"的同路人,与我们一起,让每一次人机对话,都成为一次大疆智能体验的起点。
工作职责:
1. 负责多模态大模型在边侧(手机/平板)的算法选型、后训练与轻量化研发;
2. 负责语音/文本/图像多模态意图理解,将自然语言任务转化为端侧可执行信号;
3. 负责边侧推理性能优化,包括算子加速、并行调度、内存压缩等关键技术;
4. 与端侧、云端团队拉通边-端、边-云协同链路,参与下一代多模态交互范式定义。
任职要求:
基本要求
1. 计算机、电子、通信、自动化等相关专业,硕士及以上学历;
2. 熟悉主流多模态大模型架构(LLaVA/Qwen-VL/InternVL/GPT-4V 类,视觉/语音 encoder + LLM 范式),熟练 PyTorch;
3. 在大模型后训练(SFT/DPO/RLHF)或推理优化(量化/蒸馏/算子加速)任一方向有实战经验;
4. 良好的代码与工程能力,能独立完成边侧(手机/平板/嵌入式 SoC)部署链路至少一个环节。
加分项
1. ACL/EMNLP/CVPR/NeurIPS/ICLR 等顶会一作论文,或开源大模型项目核心贡献者;
2. 在手机/平板/端侧 NPU/GPU 上落地过 LLM 或 VLM 推理优化的实战经历;
3. 熟悉 llama.cpp/MLC-LLM/TensorRT-LLM/MNN/NCNN 等推理框架及自定义算子开发;
4. 对消费场景下的人机交互范式、语音/视觉多模态 UX 有自己的思考与作品。