岗位描述
岗位职责
1、发现有价值的能力问题。 从用户需求、专业工作和生活场景中识别现有模型的能力缺口,将模糊的“体验不好”拆解为可研究、可验证的具体问题。
2、设计原创复杂任务。 围绕真实约束、信息不完整、多轮沟通、多模态理解和长流程协作等情境,构建有明确目标、合理难度及能力区分度的任务,避免单纯依赖冷知识或文字陷阱。
3、建设独立黑盒评测集。 参与任务采集、研究、编写、试测和迭代,核验资料与答案依据,维护样本质量、独立性及保密边界。
4、制定可执行的评分标准。 编写任务说明、参考答案或解题要点、分维度评分细则及边界案例;对没有唯一答案的问题,明确可接受范围与关键判断依据。
5、开展专家评审与一致性校准。 深入比较模型表现,识别看似流畅但缺乏事实、推理或实际价值的回答;组织案例讨论,分析分歧,提高评价的可解释性与可复现性。
6、开展 Agent 轨迹分析与失败归因。 阅读多轮对话、任务计划、工具调用参数与返回结果、代码执行记录及环境反馈,重建任务过程,定位关键错误和传播路径;区分知识与推理不足、规划失误、工具使用不当、信息遗漏、验证缺失及环境异常,通过对照案例或任务复现验证归因,而非只按最终答案判断好坏。
7、将诊断转化为评测与改进建议。 与算法团队将典型失败沉淀为能力分类、难例、评分规则和回归任务,提出数据补充、任务设计或模型改进假设,跟踪后续版本是否真正修复问题,形成可验证的能力洞察。
岗位要求
1、具备优秀的阅读理解、研究分析和中文写作能力,能处理复杂材料、核验信息并形成结构清楚的判断。
2、在数学、物理、自然科学、计算机、工程、人文社科或其他专业领域拥有系统训练或扎实实践经验;专业不限,重视逻辑推理、研究方法与解决复杂问题的能力。
3、能设计有挑战但公平的问题,理解“难题”与“好题”的区别,能够解释一道题具体测量什么能力。
4、有较强的证据意识,能区分事实、推断与个人偏好;面对开放问题,能形成有依据的评价标准,而非仅凭直觉打分。
5、对大模型有持续兴趣和深入使用经验,愿意细致分析模型回答与任务过程,并根据试测结果反复改进任务。
6、理解 Agent 的基本工作方式,包括任务规划、工具调用、搜索、代码执行与结果验证;能够阅读结构化执行记录,将用户目标、过程行为与最终结果关联起来分析。
7、具备基本的实验与数据意识,能够通过控制变量、对照案例和重复验证区分模型错误与工具或环境问题;不要求独立训练模型,但需要能与算法团队讨论归因依据。
8、具备良好的协作与反馈能力,能与算法及产品伙伴共同推进评测项目。