全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
“Erasing the Invisible”技术报告:2024 NeurIPS 图像水印压力测试竞赛
组织水印攻击竞赛并发布基准,前五名团队平均可去除至少 89% 图像的水印且保持画质,暴露了现有水印方法的脆弱性。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。
- 会议论文NeurIPS 2025
相邻词语,分歧意图:通过任务并发越狱大语言模型
提出词级任务并发方法并构建 JAIL-CON 迭代攻击框架,将有害任务与良性任务并发,能越狱主流 LLM,且比顺序式攻击更难被护栏检测。
- 会议论文NeurIPS 2025
强化学习中扩散模型引导的对抗状态扰动
提出基于扩散模型的 SHIFT 攻击,生成语义不同但逼真的扰动状态,能突破现有 RL 防御并优于已有攻击。
- 会议论文NeurIPS 2025
跨层对抗攻击:攻破文生图模型的多层防御
提出黑盒 TAA 框架,同时绕过提示过滤、概念擦除和图像过滤,在 14 个 T2I 模型上平均攻击成功率 85.6%。
- 会议论文NeurIPS 2025
HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
提出黑盒框架,文本端用反拟合词向量替换,图像端用对比学习优化扰动,在三个基准上攻击成功率显著优于基线。
- 会议论文NeurIPS 2025
消失于无形:针对 SAM2 的跨提示通用对抗攻击
提出首个针对 SAM2 的跨提示通用对抗攻击 UAP-SAM2,通过双重语义偏移扰动,在六个数据集上大幅超越现有攻击。
- 会议论文NeurIPS 2025
通过参数与表示扰动实现共识鲁棒的迁移攻击
将迁移攻击建模为共识鲁棒优化,提出 CORTA,在单一代理模型下对 CNN 与 ViT 目标迁移成功率比最佳既有方法高 19.1 个百分点。
- 会议论文NeurIPS 2025
压缩的代价:针对 ℓ2 范数估计 Sketch 的紧二次黑盒攻击
提出通用非自适应黑盒攻击,用约 k² 次查询使任意线性 sketch 的范数估计失效,下界与已知上界匹配,并与图像分类对抗攻击相通。
- 会议论文NeurIPS 2025
通过对手偏好对齐增强基于扩散模型的无限制对抗攻击
把无限制对抗样本生成视为对手偏好对齐问题,两阶段 APA 框架在保持视觉一致性的同时显著提升黑盒攻击迁移性。
- 会议论文NeurIPS 2025
AdvPrefix:面向细腻 LLM 越狱的目标函数
提出可即插即用的前缀强制目标,按预填充攻击成功率与负对数似然选择模型相关前缀;将 GCG 默认前缀替换后,Llama-3 上细腻攻击成功率从 14% 升至 80%。
- 会议论文NeurIPS 2025
IMPACT:基于两阶段优化的不规则多补丁对抗组合
提出无梯度的对抗补丁攻击框架,联合优化补丁形状、位置、数量与内容,并生成连续不规则补丁,效果优于多种现有方法。
- 会议论文NeurIPS 2025
基于类比的多轮 LLM 越狱
先用良性任务让模型学会目标响应结构,再在最后一轮做受控语义替换,在六个模型上平均攻击成功率 93.3%。
- 会议论文NeurIPS 2025
荧光面纱:针对交通标志识别的隐蔽高效物理对抗补丁
用荧光墨水设计物理对抗补丁 FIPatch,紫外光触发后使交通标志识别出错,低光下成功率 98.31%,并绕过五种常见防御。
- 会议论文NeurIPS 2025
WMCopier:在任意图像上伪造不可见水印
提出无需目标水印算法先验的伪造攻击,用扩散模型建模水印分布并嵌入,成功欺骗包括 Amazon 在内的开源与闭源水印系统。
- 会议论文NeurIPS 2025
构建可跨模型与提示迁移的大视觉语言模型攻击器
从信息论角度,通过调节输出与对抗/良性图像模式间的互信息生成更通用的扰动,提升对黑盒 LVLM 及不同提示的迁移攻击效果。
- 会议论文NeurIPS 2025
非自适应对抗人脸生成
利用人脸识别特征空间的属性子球面结构,仅用一次含 100 张图的非自适应查询,对 AWS CompareFaces 攻击成功率超 93%。
- 会议论文NeurIPS 2025
VERA:大语言模型越狱的变分推断框架
把黑盒越狱建模为变分推断,训练小型攻击 LLM 逼近目标模型的对抗提示后验,训练后无需重新优化即可生成多样、流畅的越狱提示,对多种目标模型有效。
- 会议论文NeurIPS 2025
Jailbreak-AudioBench:大型音频语言模型越狱威胁评测
提出含工具箱、数据集和基准的音频越狱评测体系,评估多个 LALM,并支持音频编辑等更强攻击与防御研究。
- 会议论文NeurIPS 2025
T2V-OptJail:面向文生视频越狱攻击的离散提示词优化
首次将文生视频越狱形式化为离散优化问题,在 Open-Sora 及 Pika、Luma、Kling 等商用模型上,攻击成功率比现有 SoTA 提升约 10–11 个百分点。
- 会议论文NeurIPS 2025
利用 ViT 的计算冗余提升对抗迁移性
发现 ViT 的数据级与模型级冗余可放大攻击效果,设计一套技术显著提升对抗样本在多种 ViT 及视觉大模型上的迁移性。
- 会议论文NeurIPS 2025
LARGO:基于梯度优化的潜空间对抗反思越狱 LLM
在 LLM 连续潜空间优化对抗向量再解码为自然语言,生成流畅隐蔽的越狱提示,在 AdvBench 与 JailbreakBench 上攻击成功率比 AutoDAN 等高 44 点。
- 会议论文NeurIPS 2025
SilentStriker:针对大语言模型的隐蔽比特翻转攻击
提出首个隐蔽的比特翻转攻击,通过抑制关键输出 token 来设计损失,在降低任务性能的同时保持输出自然,优于现有基线。
- 会议论文NeurIPS 2025
DepthVanish:优化对抗间隔结构的立体深度隐形补丁
发现在重复纹理间引入规则间隔可显著增强物理补丁攻击,联合优化间隔结构与纹理,可攻击 RAFT-Stereo、STTR 及 Intel RealSense 实物相机。