全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2607.21619
ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 攻击arXiv 2610.09240
WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
- arXiv
- 2610.09240
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 评测与基准arXiv 2610.06898
DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
- arXiv
- 2610.06898
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
- 攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
- 评测与基准arXiv 2607.19855
研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
- arXiv
- 2607.19855
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
- 评测与基准arXiv 2609.05535
Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
- arXiv
- 2609.05535
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
- 攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2608.04034
HACA:原子越狱策略解耦组合的多模态自动红队方法
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
- arXiv
- 2608.04034
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 评测与基准arXiv 2609.04859
MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准
提出抗攻击多语言视觉指令遵循基准 MM-IFEval-Pro
- arXiv
- 2609.04859
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3-VL-8B-Instruct、InternVL3.5-8B、MiniCPM-V4.5 等 5 个
摘要MM-IFEval-Pro 以规则验证评测中英指令遵循与视觉劫持,GRPO 提高两基座平均分。
MM-IFEval-Pro 是面向 VLM 的中英多模态指令遵循基准,并配有可用规则计算奖励的 GRPO 训练集。
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
- 防御arXiv 2607.13336
TC-UAP:针对图像转视频与微调定制的通用视频保护方法
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
- arXiv
- 2607.13336
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 组件视频
摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2607.14737
GeoDetect:面向视觉语言预训练模型的几何对抗检测方法
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
- arXiv
- 2607.14737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要GeoDetect 用几何分数检测 VLP 对抗样本。
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
- 防御arXiv 2610.00780
TAILOR:面向图像水印的组合方案定制框架
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
- arXiv
- 2610.00780
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.27399
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
- arXiv
- 2609.27399
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
- 攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。