锦鲤求职

软通动力

测试开发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1.负责 Agent 产品的效果评测,围绕主子 Agent、多 Agent 架构开展端到端的质量评估;
2.设计基本的评测方案,明确评测范围、场景与指标,形成可执行、可复现的评测流程;
3.构建并维护评测数据集(Benchmark),覆盖真实业务场景、边界场景与异常场景,持续扩充与迭代;
4.执行批量跑测、结果比对与回归验证,输出结构化评测报告,跟进 Agent 迭代的质量变化;
5.深入分析 Bad Case,定位问题环节(模型/Prompt/工具调用/上下文),联动开发推动优化;
6.对多模型、多版本 Prompt、多 Agent 编排方案进行横向对比评测,为模型选型与调优提供数据支撑;
7.参与评测平台的建设与落地(数据集管理、任务调度、指标看板、报告沉淀),推动评测能力工具化。

岗位要求
1.计算机相关专业优先;
2.熟悉大模型与 Agent 基本原理,了解 Function Calling、MCP、多 Agent 协作、RAG 等范式;
3.具备独立的评测方案设计与评测流程建设能力,能把评测工作标准化、流程化地跑起来;
4.具备一定编程能力,掌握 Python/Go 其中一种即可,能编写评测脚本、处理数据集、搭建自动化跑测流程;
5.对数据敏感,具备指标设计与数据分析能力,能从评测结果中提炼有效结论;
6.细致耐心,具备优秀的 Case 分析与问题拆解能力,能独立完成 Bad Case 归因;
7.AI 工具的深度使用者,熟悉主流大模型能力边界;有大模型/Agent 效果评测、Benchmark 建设、Prompt 评估相关经验者优先;
8.具备评测平台/工具建设能力者优先,能配合共建平台,或熟练借助 AI 编程工具完成平台开发;
9.良好的沟通协作能力与文档能力,能输出清晰的评测报告并推动结论落地。

测试方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →