岗位描述
岗位职责
1. 参与下一代多模态大模型的研发,包括视觉、视频、语言的联合建模。
2. 负责视频表征学习、时序建模、跨模态对齐、任务特化等核心模块的设计与实现。
3. 设计高效视频token化与压缩策略,优化大模型在长视频场景下的推理效率。
4. 负责模型训练pipeline的搭建、调参、评测,推动模型在多个下游任务中落地。
岗位要求
1. 熟练掌握Transformer / LLM / 多模态建模基本原理。
2. 熟悉视频方向技术包括但不限于:VideoMAE、InternVideo、TimeSformer、LLaVA-Video、Qwen-VL 。
3. 有端到端训练经验:多GPU、分布式训练、数据并行/模型并行。