岗位描述
工作内容
1. 开展视觉基础模型、多模态大模型及视觉语言模型在工业领域的前沿研究;针对复杂工业场景,攻克目标检测、图像分割、异常检测、细粒度识别、开放集识别及零样本学习等核心算法;
2. 负责视觉与多模态大模型的预训练、微调、评测、压缩及推理优化研究,解决工业领域落地中的技术难题,推动模型在实际业务中的部署、迭代与规模化应用;
3. 探索多模态大模型与智能体技术的融合,研究面向复杂工业任务的感知、推理、分析与决策方法,提升系统在动态场景下的自主作业能力;
4. 推动多模态世界基础模型在工业场景中的研发落地,涵盖数据预处理、模型架构设计、训练及工程化优化,确保可复用性;持续跟踪前沿进展,探索其工程化适配方案;
5. 参与工业多模态数据集的构建、清洗、标注及增强实操,优化数据生产流程,提升模型的鲁棒性与泛化能力,确保数据资源贴合实际业务需求。
任职条件
1. 熟悉目标检测、图像分割、异常检测、视觉语言模型、大语言模型等相关技术中的一种或多种,在计算机视觉、深度学习、大模型或多模态学习等方向具有扎实的理论基础和研究经验;
2. 熟悉Transformer、扩散模型、对比学习等前沿方法,具备数据处理、模型搭建、训练到评估的实操能力,能够完成图像、文本、语音等多模态数据处理与融合建模、跨模态表示学习、理解与生成的工程实现,具备多模态预训练或大模型相关项目工程落地经验;
3. 熟悉大规模数据集构建与清洗的实操流程,具备数据增强、多模态对齐、标注规范落地等相关经验;
4. 熟练使用常见深度学习框架(如PyTorch、TensorFlow等),具备良好的工程实现、调试与问题解决能力;有分布式训练、模型并行/数据并行、性能优化经验者优先;
5. 具有较强的科研创新能力和良好的团队协作能力;
6. 在计算机视觉、人工智能或机器学习领域高水平会议和期刊发表论文者优先;
7. 具有多模态大模型、视觉基础模型、智能体或行业智能化应用研究经验者优先。