研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
- arXiv
- 2610.09703
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- LLaVA-1.5-7B
摘要剪枝去掉背景 token 后注意力塌向恶意前景。
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
另有 208 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
定位安全敏感参数并稀疏改动权重以削弱安全对齐
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
提出 PEV 攻击,在输入嵌入上加高斯噪声越狱开源模型
PEV 是对 open-weight LLM 的 embedding 噪声越狱。
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。
评测文生图模型的有害内容生成能力与审核检测缺口
提出曲率感知数据加权的激活转向方法,用于毒性抑制与概念控制
推理时的影响加权激活传输,用曲率修正的样本权重替换传输转向里的均匀类均值。要做的是概念控制,而不是再训练。作者认为类均值被无关概念、噪声和少数 token 主导,编码的是词元级而非主题。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 Prefix Steering,以短前缀激活引导控制行为并保住能力
本文用注意力层匹配连接提示词与激活干预,并把干预改成从末提示词 token 开始的短前缀。
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写
用路由梯度敏感度定位稀疏 MoE 的安全敏感专家
在五个稀疏 MoE 上,用 router 梯度而不是激活频率挑选要抑制的专家,留出恶意提示词上的拒答降得更多。。推理时让少数路由专家不被选中,就可以不重训练地改变拒答,但频率只记录使用次数。
提出 DNAlign,在不改权重的推理期用零空间约束控制信号做安全对齐
DNAlign 是一个不改 LLM 参数的安全对齐框架,用来在推理时压低有害输出,并减少对中性知识所支持的流畅、事实回答的改动。
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
比较对话与工具中介通道的拒答内部机制
作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。
提出 CAM-Steer,推理时按多类别风险引导隐藏状态以降低有害回复
构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性
QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。