全部论文
另有 445 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 攻击arXiv 2610.09819
FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
- arXiv
- 2610.09819
- 发表
- 场景
- 模型与 API
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
- 攻击arXiv 2610.09240
WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
- arXiv
- 2610.09240
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 攻击arXiv 2610.09027
P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
- 攻击arXiv 2610.07723
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- arXiv
- 2610.07723
- 发表
- 场景
- 模型与 API
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
- 攻击arXiv 2601.22169
In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
- arXiv
- 2601.22169
- 发表
- 场景
- 模型与 API
摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
摘要固定审计集上的 ZKP 认证可被数据伪造绕过。
这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
摘要质量筛选挡不住部分高分样本的安全削弱。
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.23596
StyleAT:用对抗训练防御人脸识别的语义攻击
提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击
- arXiv
- 2609.23596
- 发表
- 场景
- 模型与 API
摘要BoundStyle 用 StyleGAN3 有界潜编辑快速攻击 FR。
StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。