岗位描述
岗位职责
1.负责 多模态大模型的预训练、微调与推理优化(Vision-Language、Speech-Language、Video-Language)。
研究多模态对齐方法(CLIP、BLIP、ALIGN、LLaVA 等)。
设计并优化 跨模态对比学习、注意力融合、prompt tuning、RAG 等方法。
开发适用于 多模态搜索、问答、生成(文本生成图像/视频、语音对话等) 的算法与模型。
跟踪前沿研究,推动模型在 农业、医疗、教育、工业、金融、AR/VR 等行业落地。
任职要求
精通 C++/Python,有深度学习多模态开发经验,视觉文本语音处理的相关经验;
在学校有做过农业、医疗等相关AI项目经验。