岗位描述
岗位描述
研究领域:
大模型
项目简介:
岗位描述
本岗位聚焦大语言模型内生安全研究,从模型架构、训练机制与推理过程层面构建本质安全能力。核心研究内容包括但不限于:
• 对齐与价值观内化:RLHF/DPO/IPO/Constitutional AI 等对齐方法的改进与鲁棒性分析
• 安全表征与可解释性:理解模型内部安全行为的可解释性表征机制
• 越狱攻防与鲁棒对齐:对抗攻击、越狱攻击的成因分析与内生防御机制设计
• 前沿安全风险分析:围绕前沿大模型安全、Agent安全等风险进行攻击面挖掘与分析
岗位要求
岗位要求
1 计算机、电子信息、网络安全、人工智能等相关专业硕士或博士在读;
2 扎实的深度学习基础,有 Transformer 模型训练或微调经验,熟悉前沿深度学习算法框架,有相应的代码实践经验或开源项目经验优先;
3 在以下方向中至少有一项研究或实践经验:
• 对齐训练与模型可解释性分析
• 对抗攻防与安全评测
4 良好的英文文献阅读与论文写作能力,实习时长 6 个月及以上
5 在机器学习、AI安全等相关领域有文章发表或人工智能、CTF等领域竞赛获奖者优先。