岗位描述
岗位职责
搭建评测框架:构建针对RAG、Tool Calling、多步推理的自动化评测Pipeline,覆盖任务成功率与轨迹合理性。
裁判模型建设:落地LLM-as-a-Judge机制,解决打分偏差问题,实现Agent每日回归测试。
基准与数据集:维护业务评测黄金集,跟进行业Benchmark(如AgentBench),定期输出竞品对比报告。
缺陷归因:深度分析失败轨迹,区分是模型能力不足还是框架设计缺陷,推动底层优化。
岗位要求
硬核技能:精通Python,熟悉Pytest,能独立搭建自动化测试工程。
懂大模型:熟悉RAG、Function Calling原理,擅长复杂Prompt设计与调优。
工程基础:熟悉Docker及CI/CD流水线,有数据分析(Pandas/可视化)能力。
加分项:有LLM-as-a-Judge实战经验;参与过AI应用的红队测试;熟悉LangChain或Dify源码。