攻击arXiv 2601.05339
多模态大语言模型的多轮越狱攻击与 FragGuard 防御
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
- arXiv
- 2601.05339
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- LLaVa-1.6 (7B)、LLaVa-1.6 (13B)、Qwen-2-7B 等 5 个
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。