岗位描述
关于我们:阿丘科技正在将最前沿的多模态大模型(VLM)技术引入工业视觉的核心场景。我们坚信,多模态理解是突破当前工业AI检测天花板的关键。在这里,你不再只是训练单一的视觉模型,而是直接参与构建能够“看懂”图像、“理解”指令、“推理”缺陷的下一代工业智能体,探索AI在工业领域的终极应用形态。
一、在这里,你要做的核心工作你将是前沿技术与工业场景的“连接者”,负责验证多模态大模型在复杂工业环境中的巨大潜力。
1、前沿技术的验证先锋:你将直接参与多模态大模型在工业检测场景中的可行性研究与落地验证。你的工作不是简单的调参,而是探索如何利用VLM的强大能力解决传统视觉算法难以应对的复杂问题(如缺陷描述、根源推理、少样本学习等);
2、从数据到价值的闭环构建者:你需要根据具体的工业需求(如面板检测、零件质检),进行数据搭建、模型微调、提示工程以及效果评估,快速迭代并论证技术方案的价值;
3、工业AI未来的塑造者:你的验证成果将直接为公司的技术决策提供关键输入,帮助定义下一代AI产品的形态,推动工业检测走向“零样本”或“对话式”的智能新时代。
二、我们希望你具备的能力我们寻找的是一位对视觉与多模态技术充满强烈好奇心,并渴望将其应用于真实世界的伙伴。
1、扎实的技术基础:
- 计算机、电子工程、人工智能等相关专业;
- 熟悉Python和PyTorch/TensorFlow框架,具备扎实的代码实现能力;
- 对计算机视觉(如图像分类、目标检测、分割)有深入理解或项目经验。
2、强烈的探索精神:
- 对大模型(LLM)和多模态技术(VLM);有浓厚的兴趣和基本的认知,并渴望在此方向进行深入实践;
- 具备出色的学习能力和创新能力,能快速吸收新知识,并乐于解决开放性的技术难题。
3、加分项(具备其一即可):
- 有使用过Hugging Face Transformers、LLaMA、CLIP等相关模型的经验;
- 在CV/NLP相关领域的顶级会议或竞赛中有产出或名次;
- 具备良好的英语阅读能力,能快速跟进最新的学术论文。