锦鲤求职

光轮智能

VLM算法实习(校招)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
①跟踪 Vision-Language Model、多模态大模型及相关视觉智能技术的发展,开展论文调研和技术验证2复现和分析主流视觉语言模型,完成模型部署、实验设计和效果评估
针对机器人应用场景进行模型适配和优化

岗位定位
负责具身智能领域视觉语言模型(Vision-Language Model, VLM)相关技术研究与应用探索,提升机器人系统对复杂环境的视觉理解和语义认知能力。
你将负责跟踪前沿多模态模型技术,完成模型调研、论文复现、算法验证和模型优化,探索视觉语言能力在机器人场景中的应用。
跟踪 Vision-Language Model、多模态大模型及相关视觉智能技术的发展,开展论文调研和技术验证
复现和分析主流视觉语言模型,完成模型部署、实验设计和效果评估
针对机器人应用场景进行模型适配和优化,包括:
训练策略设计
模型微调
Prompt Engineering
效果分析与优化
探索多模态模型在机器人视觉理解、环境认知、目标理解等任务中的应用
建立模型评估体系,分析模型能力边界并持续优化
与算法、数据团队协作,推动视觉智能能力在机器人系统中的落地

工作职责
1.负责医疗多模态大模型的研发,包括CPT、SFT、RL等阶段;
2.研发针对医疗任务的算法:影像分类、分割、检测、报告生成、多模态理解与推理等;
3.优化模型对多图输入、超高分辨率及长文本病历的处理能力,解决医疗场景下的Long-Context痛点;3.追踪前沿多模态工作,结合医疗数据特点(如 High-Resolution、3D Volumetric Data)进 行算法改进与创新;4.设计高效的微调与对齐策略(如LoRA/Adapter、指令微调、偏好对齐等),提升在真实 临床任务中的表现;6.构建训练评估体系,包括指标设计、数据拆分策略、错误分析与持续迭代。

岗位要求
任职要求
1.计算机、人工智能等相关专业,
硕士及以上学历,3年以上相关工作经验。
2.精通PyTorch,有大模型或多模态模型训练经验。
3. 熟悉主流多模态架构(如LLaVA、Qwen-VL等)。
4.熟悉医疗影像模型训练流程,具备实际影像任务(分割/检测/分类)的开发经验优先。
5.熟练掌握加速框架,如DeepSpeed、Megatron-LM、FSDP、Ray Train 等。
6. 具备强工程能力,能独立推进端到端模型研发。

负责VLM的SFT、RU/Preference Optimization、Prompt/inference Optimization等训练与优化工作,持续提升模型在真实业务场景中的准确性、泛化性和鲁棒性。
构建多模态数据体系,包括数据采集、清洗、标注、难例挖掘、合成数据及自动化评测体系,并针对模型Bad Cas e持续迭代。
负责VLM在真实终端场景中的部署与优化,关注模型 精度、推理延迟、显存/内存、功耗 等指标,推动算法从实验室走向产品量产。
跟踪 VLM、Multimodal Agent、Vision Agent、Reasoning等前沿技术,结合业务场景进行技术预研和落地。任职要求
计算机、人工智能、电子信息、自动化等相关专业,硕士及以上学历。
具备扎实的深度学习和计算机视觉基础,熟悉 Transformer、ViT、LLM/VLM 等主流模型架构。
熟悉VLM/多模态模型训练与微调方法,有SFT、RLHF、DPO、GRPO等实际经验者优先。
对视觉理解、图像/视频理解、空间关系、场景理解等方向有较深入研究,具备较强的问题抽象和算法设计能力。
熟悉 PyTorch,具备大模型训练、推理及工程优化能力,有多卡训练经验。
有Agent、Tool Calling、Function Calling、Reasoning、Memory、Planning等相关研发经验者优先。
有端侧大模型、手机影像、Camera、ISP、NPU/AI Engine等实际落地经验者优先。
有较强的论文阅读和技术创新能力,能够快速跟进并复现前沿工作。

加分项
有优秀的VLM/MLLM/Agent相关论文、开源项目或竞赛成果;
有Qwen-VL、InternVL、LLaVA、Gemini、GPT-4o等多模态模型训练或应用经验;
有图像/视频理解 Benchmark构建及模型评测经验;
时子M
有AI摄影、智能相机、视觉Agent、机器人视觉等项目经验;
有从数据训练→评测→部署→产品完整闭环经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →