岗位描述
岗位职责
1.参与小红书自研基模后训练,评测集与数据体系构建:围绕webdev场景,设计评测任务、搭建数据筛选链路和评测体系,以确保评测集的覆盖度和区分度。
2.评测对齐:制定并迭代评分 Rubric,确保评测结果的置信度,组织并参与人工评测,做一致性分析,定位标准歧义并修正。推动机评与人评的对齐。
3.自动化评测开发:自动化评测链路开发,维护评测执行环境,保证结果可复现。输出评测报告,分析模型在真实 Web 场景中的表现与失败模式。
岗位要求
1.专业背景:计算机 / 软件工程、计算语言学、语言学、认知科学、人机交互、数字媒体、数据科学、统计等交叉学科;本科及以上。
2.有一定代码基础:有 Python 基础。如果有前端/后端经验优先。
3.熟练使用 Claude Code / Codex / Cursor 等 AI 编程工具,有真实的 AI Coding 产出。
4.对大模型评测有基础认知:了解 benchmark、Rubric、标注一致性等概念。
5.自驱力强,对AI有好奇心和探索欲。
6.每周实习 ≥ 4 天,连续 ≥ 3 个月。