锦鲤求职

阿里巴巴

智多星-大模型评测(通用方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
"大模型评测实习生(通用方向)
基础信息
● 每周到岗4~5天,6个月以上优先
● Base地:北京/杭州
职位描述
1. 跟踪业界SOTA模型动态,研发大模型Benchmark,并发表相关顶会论文,模态覆盖文本、图像、音频、视频等。运用专业知识对评测题目、参考答案及评分标准进行数据质检与审题,保障评测数据的科学性、准确性和区分度
2. 学习前沿论文与资讯,构建和维护多模态评测集、训练数据集与评测 SOP。实现多种模态评测落地与自动化评测,包括题目分类、答案校验、模型回复评价、错误归因及标签规范整理,为模型能力评估提供高质量数据。
3. 通过专业工具与技能,分析大模型在相关知识与技能、通用推理及问题解决方面的薄弱环节,沉淀典型案例和改进建议,与算法、产品、数据团队协作,形成评测、数据与模型优化闭环,持续提升模型在通用方向的准确性、可靠性与专业表现。
4. 在Mentor带教下,协助评测项目管理与交付,支持任务拆解、进度跟踪、质量抽检、问题记录及跨团队协作,确保数据生产和评测工作高质量完成。

岗位要求
职位要求
1. 学历要求:相关专业硕士及以上在读。
2. 学科背景:专业不限(CS类专业,文科专业,STEM等学科皆可)
3. 行业经验:有AI相关实习经历。具备扎实的通用模型研究或实践经验,能够运用数理建模、机器学习等方法解决相关领域问题。对多模态模型有基本理解,熟悉常见评测方法与指标;
4. 综合素质:具备快速学习能力,具备较强的科研逻辑、问题拆解和跨学科协作能力,以及良好的英文读写能力。具备良好的语言表达、沟通协作能力;具有良好的自驱力与抗压能力;具有多线程任务处理能力;
5. 兴趣动机:对多模态大模型有强烈兴趣,并将来有志于从事AI行业。
加分项
● 深度使用过 GPT、Gemini、Claude 、Qwen、DeepSeek等模型,并有评测/对比经验;
● 有评测集构建、数据生产、统计分析经验;
● 熟悉文本/图像/音频/视频处理工具,或了解语音识别/合成、视频生成基础;
● 具备英文论文阅读/写作能力,有相关论文、开源项目或竞赛经历。
● 熟练使用 Python 或通用桌面智能体进行数据处理、脚本编写和简单自动化评测,能够独立完成数据处理、模型构建、结果解释和可视化。
你将获得
● 深度参与SOTA 模型评测标准制定经验,顶会论文发表机会,接触第一手多模态能力数据;
● 与算法、产品团队紧密协作,快速积累大模型评测实战经验,全方位的工作素质与能力,以及AI行业顶尖团队人脉关系;
● 业界领先的大模型评测集研发及数据合成技术与能力;
● 有竞争力的实习薪资、实习证明与转正,或其他AI核心团队工作机会。"

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →