锦鲤求职

面壁智能

多模态大模型算法工程师(OCR/文字理解方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、OCR能力专项攻坚:负责多模态大模型OCR相关能力的建设与优化,包括但不限于复杂场景文字识别、文档解析、表格理解、版面分析、多语种OCR等方向的模型训练与效果提升。
2、数据体系建设:构建OCR/文档场景的大规模训练数据Pipeline,涵盖预训练数据清洗、SFT数据标注、评测集构建等环节,确保数据的质量、多样性和规模。
3、评测与闭环优化:建立OCR/文档场景的多维度评测体系,通过Badcase分析驱动模型迭代,形成“数据→训练→评测→优化”的正向循环。
4、前沿技术跟踪:持续追踪OCR/文档智能领域的前沿工作(如多模态文档理解、视觉富文本识别等),将新技术快速落地到模型迭代中。
5、协作与推进:与多模态理解、预训练、后训练等方向的同事紧密协作,推动模型整体能力的提升。

岗位要求
1、2年以上多模态大模型(VLM)或多模态OCR/文档理解相关研发经验
2、熟悉Transformer架构及主流多模态模型(如Qwen-VL、InternVL、LLaVA等),有实际的SFT/RL训练经验
3、熟悉OCR/文档理解领域的关键技术(如版面分析、表格识别、Text-rich VQA等),了解该领域的技术演进路线
4、具备大规模多模态数据处理经验,熟悉数据清洗、标注、质量评估等数据工程建设方法
5、具备良好的沟通协作能力,能与算法、工程、数据团队高效配合

加分项
1、有多模态OCR相关论文发表(如CVPR、ICCV、ACL、NeurIPS等顶会)
2、有OCRBench、DocVQA、TextVQA等评测榜单的上榜经验或专项优化经验
3、有大规模多模态OCR数据集的构建经验
熟悉文档智能相关的模型架构(如Donut、LayoutLM、UDOP、GOT等)

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →