防御arXiv 2609.14258
SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
- arXiv
- 2609.14258
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- LLaVA-OneVision-7B、Chameleon-7B、Qwen2-VL-7B 等 4 个
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SPARED,用对抗编辑数据训练基于推理的 AI 生成图像检测器
SPARED 是一套用于可解释 AI 生成图像检测的攻防强化学习流程,报告模型是 Qwen3.5-9B 上的第三轮防御器。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。