岗位描述
岗位职责
1、评测体系设计: 设计面向 LLM Agent 的多维度评测框架,覆盖任务规划、工具调用、记忆管理、多轮推理、长程决策等核心能力,并针对 Code / Browser / GUI / Multi-Agent 等场景定制专项方案;
2、评测集构建:主导高质量评测集的采集、标注、合成与难度分级,持续迭代以防止数据污染与过拟合;
2、 指标与方法研究:落地 LLM-as-a-Judge、Rubric-based、Process Reward、Trajectory 评测等方法,探索鲁棒性、安全性、成本等综合指标;
3、评测平台建设:搭建自动化评测流水线,支持大规模并行评测、Trace 分析与 Bad Case 归因,建立 Benchmark Leaderboard。
岗位要求
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业;
2、熟练 Python,熟悉主流 LLM 与 Agent 框架(ReAct、Plan-and-Execute、Tool Use 等);
3、体系化思考能力强,数据敏感,具备良好的 Bad Case 分析与跨团队协作能力;
4、有公开 Benchmark、顶会论文或开源项目;熟悉 RLHF / Reward Model;有垂类 Agent(Code / GUI / Web)评测经验。