岗位描述
职位描述:
1)负责智能体(Agent)的评测方法研究,设计并开发针对智能体的评测框架、基准与工具;
2)研究智能体在推理、规划、记忆、工具使用、安全对齐等多维度的能力,提出科学的评测指标与方法;
3)密切跟踪前沿技术发展,深入了解智能体及其评测技术发展趋势,持续推动智能体评测体系迭代;
4)撰写高质量学术论文或技术报告,协助团队完成智能体评测相关的项目,推动评测工具与方法的落地应用。
任职要求:
1)计算机科学、机器人、人工智能或相关专业硕士及以上学历,具备扎实的理论基础;
2)深入理解大模型原理、能力边界及典型应用场景,熟悉RAG、Function Calling、Planning、React等Agent核心概念;
3)具备较强的编程能力(Python/Java/C++等),熟悉PyTorch/TensorFlow等深度学习框架,熟悉业界主流评测基准,并具备构建评测集、设计评测指标和自动化评测流程的能力;
4)有RAG评测、LLM-as-a-Judge实战、红队对抗测试、多模态评测等经验者优先;
5)具备良好的沟通能力与团队协作精神,能够独立开展研究工作并推动项目进展。
加分项:
在顶级会议(如AAMAS、IEEE ICA、ICLR、CVPR、NeurIPS等)发表过相关论文,或参与过智能体相关项目。