锦鲤求职

面壁智能

大模型评测算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 跟踪大模型及 AIGC 前沿进展,深入理解从数据构建、模型训练与能力对齐,到推理部署和应用迭代的完整研发链路,识别不同阶段的关键评测问题与质量目标。
2. 围绕模型能力和真实业务需求,建立基础模型、多模态、语音、Agent 等方向的能力评测框架,明确评测维度、质量标准和决策指标,覆盖效果、稳定性、鲁棒性、安全性及用户体验等方面。
3. 针对不同研发阶段、应用场景和评测目标,设计科学、有效、可复现的评测方案,建设评测集、任务环境和评测流程;结合公开 Benchmark、真实任务、人工评测与自动化评测,全面衡量模型能力及其变化。
4. 结合模型训练与迭代过程,分析不同版本及实验方案的评测结果,识别模型能力变化、典型失败模式和潜在风险,为数据构建、训练策略、能力对齐和推理优化提供评测依据。
5. 基于评测结果提出有针对性的模型改进建议,推动相关团队完成优化,并通过评测验证改进效果,形成“发现问题—分析原因—推动改进—效果验证”的闭环。
6. 探索 LLM-as-a-Judge、自动化红队、对抗评测、合成数据、Agent 任务环境等前沿方法,推动评测平台、数据体系和分析工具的自动化、标准化与规模化。

岗位要求
1.计算机、人工智能、数学、统计学等相关专业本科及以上学历,具备机器学习、自然语言处理、计算机视觉、语音、多模态或 Agent 等至少一个方向的实践经验;
2.理解大模型从数据构建、模型训练、能力对齐、推理部署到应用迭代的完整流程,能够从模型研发视角理解评测问题;
3.具备独立设计评测方案、分析实验结果、定位模型问题并提出改进建议的能力;熟练掌握 Python,熟悉主流深度学习框架和模型评测框架;
4.具备良好的数据分析、工程实现和跨团队协作能力,有 Owner 意识,能够推动评测结论转化为模型或产品改进。
加分项
1.有大模型训练、模型应用落地或性能优化相关经历;
2.有评测集建设、人工评测、LLM-as-a-Judge、自动化 Grader、红队测试或模型安全评测经验;
3.有大规模评测平台、持续评测、回归检测或模型质量体系建设经验;
4.有高水平论文、开源项目或算法竞赛成果,或具备将评测问题抽象为研究课题并形成可复用方法和工具的能力。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →