岗位描述
岗位职责
1、建设端到端模型评测体系。 面向预训练、多模态、Agent、Coding 及应用与模型行为等方向,设计能力分层、任务协议、数据规范、指标体系与评测流程;建设统一、可扩展的评测框架,支持不同模型、任务和评测方法的接入与横向比较。
2、研究自动评分与验证算法。 研发基于规则、可执行验证器(Verifier)、模型裁判(LLM-as-a-Judge)及学习式评估器的评分方法,结合结果正确性、过程质量和任务约束进行多维度评价;通过人工校准、偏差分析和一致性检验,提高评分可靠性。
3、研究高区分度与泛化能力评测。 与能力评测师及各方向算法团队协作,开展任务生成、样本筛选、难度分层、数据去重及污染检测,建设独立测试集与持续回归集,研究评测覆盖度、区分度和跨场景泛化能力。
4、研发能力诊断与统计分析方法。 基于分层评测、置信区间、显著性检验、消融实验及轨迹分析,识别模型收益与回退,区分模型能力、采样策略、工具链和环境异常等因素的影响,形成可验证的归因结论。
5、打通评测与训练迭代链路。 对接训练实验与模型版本管理,建设自动评测、版本对比、回归检测和诊断报告流程;将评测发现转化为数据构建与训练优化建议,并持续验证离线指标与真实任务表现的一致性。
6、推动评测方法落地与执行链路完善。 与工程及基础设施团队协作,将多轮交互、工具调用、代码执行和长程 Agent 的评测需求转化为环境与执行规范,推动轨迹采集、实验复现及自动化评测能力建设,保障评测方案稳定运行。
岗位要求
1、具备扎实的机器学习、深度学习与概率统计基础,理解大语言模型或多模态模型的训练、推理及后训练方法,能够结合模型机制设计评测方案。
2、熟练使用 Python,具备良好的软件设计与工程实现能力,能够独立开发评测框架、数据流水线或实验分析工具;熟悉 Linux、并行或异步任务处理及常见模型推理接口。
3、具备大模型评测、模型训练、Agent、Coding、多模态或相关算法研发经验,能够独立完成问题定义、技术方案、实验验证及系统落地。
4、理解自动评分、模型裁判或可执行验证的基本方法,能够分析评分偏差、数据污染、评估噪声与指标失真等问题。
5、熟悉实验设计与统计分析,能够使用合理的采样、对照和显著性分析方法,判断模型变化是否真实、稳定且可泛化。
6、具备较强的技术研究与跨团队协作能力,能深入分析模型输出和执行轨迹,并与训练、基础设施及能力评测团队共同推进问题解决。