攻击arXiv 2610.10742
BRANCH 方法绕过 6 套多扫描器护栏系统
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
- arXiv
- 2610.10742
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- Meta Llama Guard 3 8B、Meta Llama Guard 7B、Meta Llama Guard 3 1B 等 18 个
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。
提出自适应攻击框架,击穿越狱与提示注入防御
提出两阶段良性微调攻击,经 FaaS 用良性数据解除安全对齐