防御arXiv 2610.09703
研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
- arXiv
- 2610.09703
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- LLaVA-1.5-7B
摘要剪枝去掉背景 token 后注意力塌向恶意前景。
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别
提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。