岗位描述
岗位描述
研究领域:
人工智能安全
项目简介:
随着大模型及Agent技术的持续演进,其在内容理解、决策推理、任务执行等方面的能力显著提升。但与此同时,模型与Agent的安全性、可控性和可信度问题 也逐渐成为制约其大规模应用的关键因素。当前的防护措施主要集中在后验过滤或人工规则层面,难以适应智能体的自主性需求。本项目聚焦于轻量化、可验证的AI安全对齐机制研究,从模型行为约束、风险检测与安全提示三个维度,探索小规模可验证的技术路线,为后续大模型安全体系奠定基础。
岗位要求
职位描述:
1、大模型对抗攻击:研究大模型(llm,vlm,agent)存在的安全性(安全与幻觉)问题,研究大模型对抗攻击/越狱算法和生成式数据增强。
2、大模型对抗防御:研究大模型(llm,vlm,agent)安全防御算法机制,对大模型输入输出做识别、改写、抑制。
3、大模型训练:内生安全对齐,使用continue pretrain、MoE、RAG、AutoPrompt等方法解决大模型安全相关问题。
职位要求:
1、具有多模内容理解、大模型、AI安全相关工作经验优先;
2、计算机、电子等相关专业背景;具备扎实的机器学习基础和较强的学习能力;
3、熟悉PyTorch、Tensorflow相关深度学习算法框架,有相应的模型设计和实现经验;
4、在机器学习/CV/NLP/人工智能相关领域有顶会论文或者有算法竞赛top经验者优先。
5、有一定工程基础或者网络安全经验者有加分。
6、至少6个月的全职工作。