锦鲤求职

阶跃星辰

多模态大模型数据算法实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责

高质量训练数据合成方案研究

调研并分析前沿的多模态大模型训练数据合成方法及最佳实践(例如CoSyn,MathCoderVL等)

多模态合成数据质量评估与迭代优化

建立合成数据的质量评估体系(如图像合理性,图像-文本匹配度等),设计自动化拒绝采样策略

基于下游任务的反馈,持续迭代优化数据合成 prompt、渲染代码与生成参数

数据合成工具链开发与平台工程化

根据研究成果,设计并开发基于代码渲染(例如LaTeX/Matplotlib/pyblender 等)的各类多模态数据合成工具链

构建并调优数据合成管线的核心模块,包括 prompt 模板库、渲染引擎调度、LLM/VLM 调用等模块

职位要求:

教育背景: 研究生在读,计算机/人工智能相关专业优先

技术能力: 熟悉Python编程语言,了解图像数据处理和分析的基本方法和工具。

多模态大模型原理理解: 对大模型基础原理,大模型训练数据(文本&图像)有一定的理解。

多模态数据合成经验:

具备基于代码生成合成图像的实践经验,熟悉至少一种渲染工具(例如Matplotlib、HTML/CSS、LaTeX、SVG等)

有使用 LLM/VLM API(GPT、Claude、Gemini 等)进行自动化数据生成的经验

了解合成数据质量评估方法,知晓不同domain的合成数据该用何种标准进行质量评估

学习能力: 具备利用大模型相关工具,快速学习和适应新知识、新技能的能力。

团队合作: 良好的沟通能力和团队合作精神,能够与团队成员密切合作。

实习时间: 持续3个月,可以6个月以上者优先

工作地点: 北京市海淀区苏州街大恒科技大厦 线下办公

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →