岗位描述
岗位职责
1. 围绕多模态视频理解开展前沿研究,融合视觉、语音与文本信息,提升模型对视频内容、时序关系及事件的理解与推理能力。
2. 面向视频检索、内容摘要、事件定位及长视频问答等场景,研究跨模态对齐、长时序建模与关键信息提取,提升实际任务效果。
3. 研究文本生成视频、图像生成视频及视频编辑技术,提升生成内容的画面质量、时序一致性、运动自然度与指令遵循能力。
4. 结合业务场景开展多模态模型后训练与微调,探索模型压缩、推理加速及本地部署,兼顾效果与资源开销。
5. 建立视频理解与生成评测体系,跟踪前沿技术,推动研究成果在实际产品中落地。
岗位要求
1. 计算机视觉、人工智能、计算机等相关方向的应届博士毕业生,具备扎实的机器学习、深度学习及计算机视觉理论基础。
2. 在多模态学习、视频理解、视频生成等一个或多个方向有深入研究,具备独立开展科研、设计实验和分析问题的能力。
3. 熟悉视觉语言模型、时序建模、扩散模型等相关技术,具备多模态数据处理、模型训练、微调与评测经验。
4. 熟练掌握 Python、PyTorch 等开发工具,具备良好的工程实践与沟通协作能力,能够结合业务需求推动算法落地。
5. 有长视频理解、音视频联合建模、可控视频生成或生成模型加速经验者优先;在 CVPR、ICCV、ECCV、ACM MM、NeurIPS、ICML、ICLR 等会议发表相关成果,或有高质量开源贡献者优先