岗位描述
岗位描述
1.研究并搭建面向下一代多模态基础模型的音视频理解生成能力;
2.研发大规模 / 超大规模音视频融合的多模态理解生成基础模型,开展深度系统优化;负责数据体系搭建、指令微调、偏好对齐与模型迭代优化;
3.提升数据合成、可扩展监督(Scalable oversight)、模型推理、智能规划能力,搭建完备、客观、精准的评测体系,持续探索多模态大模型性能提升方案;
4.参与音视频生成基础模型全链路研发,基于视频生成技术探索创新应用与产品落地。
岗位要求
1.计算机、人工智能、自动化、数学等理工科相关专业优先;
2.心怀技术理想,希望以科技创新创造价值,立志深耕机器学习、大模型、多模态生成与理解领域;
3.拥有计算机视觉、语音合成 / 识别、音视频生成理解相关研发经历优先;
4.拥有 CVPR/ICCV/ECCV/NeurIPS/ICML/ICLR/ICASSP/Interspeech/ACL 等顶会论文成果者优先;
5.具备扎实算法基础与工程编码能力,精通 Python/C/C++ 其一;具备 ACM、Kaggle、信息学奥赛等竞赛获奖经历加分;
6.有音视频生成理解基础模型、大规模强化学习相关方向项目主导经验。