全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2603.13847
SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
- arXiv
- 2603.13847
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2606.09084
研究者提出 Context-Fractured Decomposition 攻击
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
- arXiv
- 2606.09084
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要CFD 用无指令 artifact 把越狱拆到跨会话。
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 防御arXiv 2609.37837
Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
- arXiv
- 2609.37837
- 发表
- 场景
- 模型与 API
摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 防御arXiv 2609.10613
后验重加权框架解释并缓解多模态大模型上下文越狱
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
- arXiv
- 2609.10613
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要后验重加权解释上下文越狱的缩放,并支持风险门控的良性示例防御。
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
- 其他arXiv 2609.12413
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
综述智能体执行链路中的越狱攻击、防御与实践权衡
- arXiv
- 2609.12413
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
- 防御arXiv 2609.14258
SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
- arXiv
- 2609.14258
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 防御arXiv 2609.23586
VidMark:面向视频生成模型知识产权保护的高效水印方案
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
- arXiv
- 2609.23586
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
- 攻击arXiv 2609.38253
CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
- arXiv
- 2609.38253
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
- 攻击arXiv 2609.38899
SceneJail:利用视频场景上下文越狱多模态大模型
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
- arXiv
- 2609.38899
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒