[控场AI]
概念Jailbreak / 越狱攻击 / AI越狱

越狱

针对AI大语言模型安全护栏的绕过技术,通过角色扮演诱导、多轮对话渗透、语义混淆或对抗性后缀等手段使模型产生违反安全策略的输出,是AI安全领域的核心研究议题。

时间轴 (近 90 天)

7月5日

越狱手法可分为提示注入、对抗性前缀攻击、多步骤语境构建以及自动化越狱

待验证60%

全部知识事实 (1)

来源文章