P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 RoguePrompt 双层编码自重构越狱,绕过 LLM 审核
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
提出 SpeechJBB,评测语码转换语音下音频语言模型的越狱稳健性
SpeechJBB 用合成语音测量 LALM 在五语、语码转换和局部伪词混淆下的安全对齐,并另设口语理解对照。
提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出四种阶段转换攻击,绕过推理模型的安全推理护栏