岗位描述
岗位描述
1. 负责超长视频内容的前沿算法研究、实现与优化,重点攻克高效的长视频处理机制,如关键帧选择、特征压缩和记忆机制。
2. 参与构建和清洗大规模多模态数据集,优化长视频理解在视频问答、内容摘要等任务上的准确率,优化视频场景下模型的推理能力。
3. 具备技术前瞻性与创新能力,跟踪国际最新技术动态,探索如多模态理解创新架构、音视频理解等新方向,并提出创新算法或方案,推动学术前沿发展。
岗位要求
必备条件:
1. 硕士及以上学历,计算机、人工智能、电子、机器人等相关专业。
2. 在计算机视觉、多模态、机器学习等一个或多个领域有深入的研究者。
3. 深入理解深度学习、计算机视觉和自然语言处理基础知识,对VLM/MLLM模型原理有清晰认识。
4. 具备良好的团队合作精神和沟通能力,对解决富有挑战性的技术问题有浓厚兴趣。
加分项:
1. 拥有在ICLR、CVPR、ICCV、ECCV、NeurIPS、ICML等顶级会议或期刊上发表论文的经历。
2. 具备优秀代码能力,有ACM、NOI/IOI等比赛获奖者。
3. 在多模态大模型、大语言模型、强化学习等领域主导或参与过重大影响力项目者。