攻击arXiv 2610.10742
BRANCH 方法绕过 6 套多扫描器护栏系统
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
- arXiv
- 2610.10742
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- Meta Llama Guard 3 8B、Meta Llama Guard 7B、Meta Llama Guard 3 1B 等 18 个
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 RISE,迭代演化可复用策略对文生图模型做红队
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界
提出 UniAttack 单轮黑盒越狱框架,融合攻击特征绕过多层防御
提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本
提出 StyleBreak 风格化音频越狱,利用语音属性绕过音频语言模型对齐
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。
提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效
RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。
提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器
作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。