岗位描述
岗位职责
参与视觉语言大模型的研发工作,主要负责:
1、VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建;
2、VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式;
3、VLM Post train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法;
4、生成理解统一:探索生成理解统一架构,同时提升理解和生成能力。
岗位要求
1、本科及以上学历,计算机等相关专业方向优先;
2、熟练掌握代码的阅读和编写技术能力,善于利用AI编程,在python和pytorch技术栈上有深入实践;
3、在视觉领域有深入的实践和理解,有一定深度的专业认知和见解;
4、具备良好的科学研发习惯、问题定义能力和对细节的敏锐度。