岗位描述
岗位职责
基于SQL+Spark/Flink建设数据采集、清洗、标注、标准化与质量评估的全链路数据管道,为微调与RAG提供高质量数据集;制定并落实数据安全、脱敏、分级、权限与合规规范及数据全生命周期管理;治理测试机/分选机等业务数据与测试程序、日志、缺陷数据,建设领域数据资产、元数据与数据血缘;与算法、应用、FDE方向协同闭环"数据—效果"反馈链路,监控并优化存储与计算成本。
建设大模型应用评测体系(准确率、召回率、幻觉率、稳定性、安全性等指标)及LLM-as-Judge与人工评估流程,设计并维护AI编码、知识问答、办公/会议助手、对客产品等场景的评测集与基准;基于Pytest/JMeter/Locust搭建自动化回归与高并发压力测试,保障模型/Prompt/链路迭代不退化、推理服务满足低时延要求;度量场景提效效果,支撑"人/年"生产力收益量化复盘,推动质量问题闭环并输出质量报告。
岗位要求
熟练数据管道(ETL)与大数据处理工具(Spark/Flink),熟悉数据质量管理与数据安全合规,具备面向AI/大模型场景的数据集构建经验;
熟悉测试自动化与质量度量方法,理解大模型评测方法(基准评测、人工评估、LLM-as-Judge等),严谨的数据分析与问题定位能力。
加分项:有面向LLM训练/RAG的数据治理经验;熟悉数据标注平台与质量评估方法;有大模型/AI产品评测或LLMOps质量保障经验;熟悉RAG/Agent复杂链路评测;有工业/半导体领域数据治理经验、效果度量与A/B实验经验。