SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%
作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。
- 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
- 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
- 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。
SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。
SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。
作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。
论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。