锦鲤求职

小红书

【Ace顶尖实习生】Dots-大模型评测算法研究员

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、设计并迭代 dots 模型的多维度能力评测体系,覆盖通用能力(推理、数学、代码、语言理解)、指令遵循、长上下文、多模态、安全性、人类偏好等维度
2、跟踪主流公开 benchmark(MMLU、MATH、GSM8K、HumanEval、MBPP、ARC、HellaSwag、GPQA、Arena ELO 等),建立内外部对齐机制,输出可比的竞争力报告
3、构建评测数据集生产 pipeline:从采集、清洗、标注、质检到版本化管理,保证数据集的质量与时效性
4、开发自动化评测平台:统一的评测入口、任务调度、结果可视化、版本对比、diff 分析
5、与后训练团队(RLHF/对齐)合作,定义 reward model 和 preference 数据的评测标准
6、设计"抗污染"策略,防止评测数据集泄露到训练集
7、参与模型发布的质量卡点(gate),为版本上线提供数据支撑
8、跟踪前沿评测研究(LLM-as-judge、multi-turn eval、agent 评测、长程任务评测等),推动评测能力持续进化

岗位要求
1、对大语言模型能力边界有清晰认知,知道"什么是好模型"、"好在哪"
2、熟悉主流 benchmark 的设计哲学和局限,不只是会跑分,而是能看出分数的含义
3、有数据处理与工程能力(Python 熟练,熟悉数据 pipeline 工具,能搭自动化流程)
4、扎实的统计与分析能力,能从噪声数据里看出信号
5、优秀的书面表达

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →