岗位描述
岗位职责
1. 负责多模态智能体规划算法的研发,融合语音、视觉、车内环境感知等多模态信息,提升复杂任务的理解与决策能力;
2. 参与多模态Agent系统的搭建,实现跨模态信息对齐、多模态推理与规划、工具调用等核心模块;
3. 探索多模态大模型在车载场景下的应用,如视觉问答、语音指令理解、环境感知驱动的任务规划等;
4. 跟踪前沿多模态Agent规划范式(如多模态ReAct、Visual Planning等),推动算法在业务中的落地与迭代。
岗位要求
1. 学历要求:2027 届计算机、AI、CV、NLP 等相关专业硕士及以上学历;
2. 基础能力:扎实的机器学习/深度学习基础,熟悉 Transformer 及主流多模态大模型架构,熟练使用 Python 与 PyTorch;
3. 多模态专业能力:熟悉视觉语言模型(VL Model)、语音识别/合成、多模态融合等方向中的至少一项,了解主流多模态模型(如Qwen-VL 系列)的原理与训练方法;
4. 端侧部署认知:了解模型量化、推理优化、端侧部署等工程化技术,有高通/MTK 等移动端芯片上模型部署经验者优先;
5. 综合素质:学习能力强,善于跨模态技术探索,具备良好的沟通与团队协作能力;对车载多模态交互场景有热情,愿意长期投入。