全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 防御arXiv 2609.37837
Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
- arXiv
- 2609.37837
- 发表
- 场景
- 模型与 API
摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 防御arXiv 2609.10613
后验重加权框架解释并缓解多模态大模型上下文越狱
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
- arXiv
- 2609.10613
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
- 防御arXiv 2609.14258
SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
- arXiv
- 2609.14258
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.38253
CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
- arXiv
- 2609.38253
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
- 攻击arXiv 2609.38899
SceneJail:利用视频场景上下文越狱多模态大模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
- arXiv
- 2609.38899
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.06094
AdvPIE:面向文生图模型隐式漏洞的自动红队框架
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
- arXiv
- 2609.06094
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 防御arXiv 2609.29287
AEGIS:用内部信号在中间层拦截大型音频语言模型越狱
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
- arXiv
- 2609.29287
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.31032
TempQ-Jail:面向文生视频越狱的查询受限候选排序方法
提出 TempQ-Jail,以查询受限候选排序越狱文生视频模型
- arXiv
- 2609.31032
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要待补读全文。
待补读全文。
- 攻击arXiv 2609.34920
RISE:用迭代策略演化对现代文生图模型做红队测试
提出 RISE,迭代演化可复用策略对文生图模型做红队
- arXiv
- 2609.34920
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒