锦鲤求职

理想汽车

Agent测试负责人

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
岗位职责:
① 构建 SalesAgent 领域 Benchmark
行业里没有现成的汽车销售 Agent 评测集,核心维度包括:
- 意图识别:判断客户处于哪个购买阶段(初探 / 有意向 / 临近成交 / 售后)
- 幻觉检出:识别捏造车型参数、金融政策、配置信息等高风险输出
- 上下文记忆:多轮对话中正确引用客户信息,拒绝"失忆式重复提问"
- 话术生成质量:跟进文案、试驾邀约、异议处理是否贴合真实销售语境
② 设计模型迭代的测试闭环
- 搭建上线前的 Quality Gate:关键场景设定合格阈值,回归不通过不上线
- 构建「全场景 × 多版本」自动化回归框架,重点覆盖性能退化与边缘场景鲁棒性(方言、销售黑话、模糊表达)
- 设计 A/B 测试方案,在专家用户小范围验证模型效果(话术采纳率、专家满意度、任务完成率)
- Own 标注团队与标注规范,保证 Ground Truth 的一致性与可信度
③ 搭建线上质量监控体系
- 建立线上问题的自动分类框架:幻觉 / 知识盲区 / 上下文偏差 / 领域术语缺失
- 构建问题优先级模型:频率 × 业务风险 × 可修复性,驱动算法团队高效排期,避免"拍脑袋修 Bug"
④ 推动专家 Skill 的标准化上线
- 设计 Skill 质量评估标准与上线前的双重检核机制
- 建立 Skill 效果追踪:使用率、采纳率、相对通用模型的质量提升幅度
- 设计灰度发布与回滚机制,防止低质 Skill 污染整体系统

岗位要求
任职要求:
- 3+ 年算法评测、NLP 测试或 AI 质量保障经验
- 熟悉行业开源 benchmark(如 HELM、LM-Eval、MMLU、AgentBench、SWE-Bench 等)的构建思路与适用边界,并对业务 Agent 场景下的 benchmark 设计有自己的深刻见解
- 扎实的数据分析能力——能用数据清晰表达"模型好在哪里、差在哪里、差多少"
- 理解 RAG、Harness Engineering、Fine-tuning 的基本原理,能与算法工程师平等对话

测试方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →