概念Jailbreak / 越狱攻击 / AI越狱
越狱
针对AI大语言模型安全护栏的绕过技术,通过角色扮演诱导、多轮对话渗透、语义混淆或对抗性后缀等手段使模型产生违反安全策略的输出,是AI安全领域的核心研究议题。
时间轴 (近 90 天)
7月5日
越狱手法可分为提示注入、对抗性前缀攻击、多步骤语境构建以及自动化越狱
待验证60%
针对AI大语言模型安全护栏的绕过技术,通过角色扮演诱导、多轮对话渗透、语义混淆或对抗性后缀等手段使模型产生违反安全策略的输出,是AI安全领域的核心研究议题。
越狱手法可分为提示注入、对抗性前缀攻击、多步骤语境构建以及自动化越狱