研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
- arXiv
- 2610.09703
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- LLaVA-1.5-7B
摘要剪枝去掉背景 token 后注意力塌向恶意前景。
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 PALS,用潜空间平滑防御全双工语音对话的对抗扰动
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
形式化跨不可关联身份的分解攻击并评测状态化防御边界
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出 TS-Guard 与 TS-Flow,在执行前检测并引导 Agent 修正有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器