岗位描述
岗位描述
研究领域:
数据合成与标注
项目简介:
团队正在构建 In-House Data Quality Benchmark——一套面向内部 Cowork(人机协同)工作流的数据质量评估基准,覆盖 SFT 指令数据、RLHF 偏好数据、CoT 思维链数据三大场景,定义了事实准确性、逻辑连贯性、指令遵从度、表达多样性、安全合规、人机一致性等 10 个细粒度评估维度。
当前 Cowork 工作流("AI 预生成 → 人工审核/修订 → 质量校验 → 入库")在生产实践中面临四个核心问题:
1. 质量无量化标准:数据质量依赖标注员主观判断,跨标注员、跨批次波动大,缺乏客观可复现的评估基准。
2. 协作策略效果未知:工作流中 AI 预生成参数(模型、温度、n-shot)、人工修订深度、审核阈值等变量对最终数据质量的影响未经验证,配置依赖经验直觉。
3. 质量瓶颈不可见:工作流是多环节串联,当终版数据质量不达标时,无法定位质量损失发生在预生成、人工修订还是审核环节。
4. Benchmark 自身可信度未验证:benchmark 的 LLM-as-Judge 评估方法与人工判断的一致性、各维度的实际区分力、评估得分与下游模型训练效果的相关性均未经验证。
本课题以该 Benchmark 为评估基准,围绕"如何系统性评估和优化 Cowork 工作流的数据产出质量"展开研究。
岗位要求
研究领域:
-目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
-具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
-具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究
优先录用:
-对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
-在国际会议上或核心期刊发表一份或多份出版物或论文
-至少3个月的全职工作