锦鲤求职

快手

多模态训练数据质量专家-音视频方向

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
负责大模型(LLM/VLM)及 AIGC 生成内容(文生视频、文生图等)的质量评测体系设计、评测工具开发与效果评估闭环,为模型迭代和上线决策提供量化依据。核心产出不是"跑分报告",而是可复现、可对比、可驱动迭代的评测系统。具体职责:
1、评测体系设计:设计生成/增强内容(视频、图像)的多维度主观/客观质量评价框架,涵盖技术质量、语义一致性、运动合理性、安全性等维度;制定评测指标体系(PLCC/SRCC/KROCC、BLEU/ROUGE、人工评分维度与量表等),建立可横向对比的基准线;参与主观评测实验流程设计(评测员招募与培训、维度解释与对齐、过程质控、数据清洗),确保主观数据的可靠性;
2、评测数据与工具链建设:协助构建和维护标准化评测数据集,覆盖多场景、多模型、多维度的标注样本;参与开发自动化客观评测模型(基于多模态特征编码 + LLM 评分的评测算法),实现模型输出的规模化评估;参与搭建评测平台(批量推理 → 自动评分 → 结果聚合 → 可视化看板),支撑日常评测和版本对比;
3、模型效果评估与迭代驱动:对内部/外部大模型进行系统性质量评测,输出结构化评测报告与模型对比结论;建立"评测 → 归因 → 反馈 → 迭代"闭环,将评测结论转化为可执行的模型优化建议;
4、安全性与合规评测:参与设计生成式模型的安全评测方案,覆盖内容安全、幻觉检测、对抗性输入等维度;参与大模型备案/合规评测相关数据准备与报告输出;
5、前沿评测方法研究:跟踪 AIGV/AIGC 质量评价、大模型评测领域的最新学术进展与开源工具;探索基于 LLM-as-Judge、主动学习、成对比较等新范式的高效评测方法,降低人工标注成本。

岗位要求
1、学历:本科及以上学历,计算机、电子信息、人工智能、信号处理、通信工程等相关专业;
2、基础知识与技能:深度学习框架:了解 PyTorch,能完成模型训练、微调(LoRA/SFT)与推理的基本流程;
3、评测方法论:了解视频质量评价(VQA)、AIGC 内容质量评估的主观/客观方法体系,了解 ITU-R BT.500 等主观实验标准者加分;
4、多模态理解:了解视觉-语言模型(VLM)的基本原理与评测方法,对多模态特征编码(CLIP/BLIP 等)有认知;
5、工程化能力:了解 Docker容器化部署、vLLM 推理加速,能基于 FastAPI/Flask 搭建简单服务者优先;

加分项:
1、在 VQA/AIGC 质量评价领域有学术论文发表(CVPR/ICME/ACM MM/Displays 等);
2、有 AIGC 模型评测竞赛获奖经历(如 NTIRE、CVPR Workshop 等);
3、熟悉 RAG 评测框架(Ragas、LangSmith)或 Agent 效果评估方法;
4、有大规模主观评测实验(评测员组织、数据采集与清洗)的参与经验;
5、了解大模型安全评测与合规备案基本流程;
6、有相关实习经历或国家级重点研发项目参与经验。

测试方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →