岗位描述
岗位职责
【岗位职责】
安全评测体系建设:设计并自动化大模型与智能体安全评测,覆盖提示注入、越狱、多模态绕过、Agent工具滥用、敏感数据外泄等攻击面;建设评测数据集、判分标准与回归流水线。
检测能力演进:通过模型蒸馏、微调(SFT/LoRA/DPO 等)训练检测专家模型;负责安全样本的构造、清洗与标注规范设计
跟踪前沿并落地:跟踪安全护栏、红队方法、模型对齐等领域进展,对有价值的方法做快速复现验证,把结论落成可复现的评测报告与产品改进项
团队协作:与产品、研发协作,把评测发现转化为检测能力与产品特性,推动安全能力在业务侧的真实落地。
岗位要求
【任职要求】
2027 届硕士优先(计算机、人工智能、信息安全、数学等相关专业),优秀本科生亦可
熟悉 Python 与主流深度学习框架,具备大模型微调、评测或推理部署之一的实操经验
能独立完成安全样本的构造、清洗与质量评估,理解数据配比对模型效果的影响
理解 Transformer 与大模型基本机理;有 LLM 评测、RAG、Agent 或安全对抗方向的项目经历者优先。
工程习惯良好:实验可复现(有版本管理、配置固化、结果可追溯),文档写得清楚,别人能照着跑通。
具备安全工作的边界意识与合规判断力:清楚攻防研究的红线,知道什么能做、怎么做才合规。
【加分项】
安全竞赛(CTF/AWD)经历、漏洞挖掘或攻防实战背景;
有大模型安全相关论文(如越狱攻击、防御方法、安全评测基准方向);
维护过开源项目,或有公开的评测报告/技术博客沉淀。