岗位描述
工作职责:
1. 构建多模态视频理解模型的数据飞轮,对语音/图片/视频 等原始语料进行结构化分析理解,参与多模态大模型的数据准备、数据清洗、数据实验等工作,构建高质量的多模态数据集。
2. 针对文生视频,图生视频等不同任务,设计提示词工程,构建高质量多模态数据产出的Pipeline,提升模型对主体、动作、场景、运镜等信息的理解能力。
3. 配合理解大模型SFT专项进行模型训练、评测结果分析,根据实验结果定位数据中可能存在的问题。
工作要求:
1.计算机/软件工程等相关专业本科以上学历;
2. 沟通主动、细心、负责、稳定性好,能够耐心处理一定量的数据筛选、质检等工作。
3. 熟悉计算机视觉、多模态领域的相关研究工作和算法,有大模型相关数据处理工作经验者优先
4. 学习能力强、对于大模型拥有热情;有vllm、多模态数据、算法模块经验者优先
5. 可以尽快到岗,稳定实习六个月的同学优先。