全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NDSS 2025
Magmaw:针对机器学习无线通信系统的模态无关对抗攻击
提出可对任意多模态无线信号生成通用对抗扰动的攻击,在软件无线电平台实测,即使有强防御仍显著降低性能。
- 会议论文NDSS 2025
重新审视交通标志识别的物理世界对抗攻击:商用系统视角
首次大规模测量物理对抗攻击对商用交通标志识别系统的效果,发现攻击不易泛化,空间记忆设计是主因,并提出新的攻击成功率指标。
- 会议论文NeurIPS 2025
GASP:高效黑盒生成对抗后缀以越狱 LLM
用潜空间贝叶斯优化在黑盒设定下生成可读性强的对抗后缀,提高越狱成功率并缩短训练与推理时间,适用于 LLM 红队测试。
- 会议论文NeurIPS 2025
注意!你的视觉语言模型可能被恶意操控
提出 VMA 攻击,用动量优化和可微变换生成图像对抗扰动,精确操控 VLM 输出,可用于越狱、劫持、隐私泄露和拒绝服务,也可注入水印。
- 会议论文NeurIPS 2025
面向视觉语言模型的思维可视化越狱攻击
提出 VoTA,构造含风险视觉思维的图像链,利用推理与安全目标的冲突,在 15 个 VLM 上平均攻击成功率从 63.70% 升至 90.41%。
- 会议论文NeurIPS 2025
CARES:医疗 LLM 安全性与对抗鲁棒性综合评测
构建含 1.8 万余条提示的医疗安全基准,发现多数模型易受改写式越狱且对正常问题过度拒答,并提出轻量分类器缓解。
- 会议论文NeurIPS 2025
SECA:语义等价且连贯的攻击以诱发 LLM 幻觉
通过保持语义等价与连贯的真实提示改写,用约束零阶优化搜索对抗提示,攻击成功率高于现有方法,开源与商用 LLM 均对此敏感。
- 会议论文NeurIPS 2025
Best-of-N 越狱
提出黑盒 BoN 越狱:反复采样带扰动的提示直到诱出有害回复,10000 次采样下对 GPT-4o 成功率 89%、Claude 3.5 Sonnet 78%,可跨文本、视觉、音频模态,成功率随样本数呈幂律增长。
- 会议论文NeurIPS 2025
极简高效的攻击基线:对 GPT-4.5/4o/o1 等黑盒模型成功率超 90%
通过局部裁剪并在嵌入空间对齐目标图像,在语义丰富区域集中扰动,对商业 LVLM 的迁移式定向攻击成功率超 90%。
- 会议论文NeurIPS 2025
“Erasing the Invisible”技术报告:2024 NeurIPS 图像水印压力测试竞赛
组织水印攻击竞赛并发布基准,前五名团队平均可去除至少 89% 图像的水印且保持画质,暴露了现有水印方法的脆弱性。
- 会议论文NeurIPS 2025
ReliabilityRAG:面向 RAG 网页搜索的可证明鲁棒防御
利用文档可靠性信号,通过在矛盾图上求最大独立集筛除恶意文档,并给出可证明鲁棒性保证;对检索语料攻击的鲁棒性优于已有方法且保持良性准确率。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。
- 会议论文NeurIPS 2025
相邻词语,分歧意图:通过任务并发越狱大语言模型
提出词级任务并发方法并构建 JAIL-CON 迭代攻击框架,将有害任务与良性任务并发,能越狱主流 LLM,且比顺序式攻击更难被护栏检测。
- 会议论文NeurIPS 2025
WASP:Web Agent 抗提示注入安全基准
提出端到端评测基准 WASP,发现顶级模型也会被简单人工注入欺骗,攻击部分成功率高达 86%,但完整达成攻击目标的情况较少。
- 会议论文NeurIPS 2025
强化学习中扩散模型引导的对抗状态扰动
提出基于扩散模型的 SHIFT 攻击,生成语义不同但逼真的扰动状态,能突破现有 RL 防御并优于已有攻击。
- 会议论文NeurIPS 2025
跨层对抗攻击:攻破文生图模型的多层防御
提出黑盒 TAA 框架,同时绕过提示过滤、概念擦除和图像过滤,在 14 个 T2I 模型上平均攻击成功率 85.6%。
- 会议论文NeurIPS 2025
HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
提出黑盒框架,文本端用反拟合词向量替换,图像端用对比学习优化扰动,在三个基准上攻击成功率显著优于基线。
- 会议论文NeurIPS 2025
消失于无形:针对 SAM2 的跨提示通用对抗攻击
提出首个针对 SAM2 的跨提示通用对抗攻击 UAP-SAM2,通过双重语义偏移扰动,在六个数据集上大幅超越现有攻击。
- 会议论文NeurIPS 2025
通过参数与表示扰动实现共识鲁棒的迁移攻击
将迁移攻击建模为共识鲁棒优化,提出 CORTA,在单一代理模型下对 CNN 与 ViT 目标迁移成功率比最佳既有方法高 19.1 个百分点。
- 会议论文NeurIPS 2025
压缩的代价:针对 ℓ2 范数估计 Sketch 的紧二次黑盒攻击
提出通用非自适应黑盒攻击,用约 k² 次查询使任意线性 sketch 的范数估计失效,下界与已知上界匹配,并与图像分类对抗攻击相通。
- 会议论文NeurIPS 2025
通过对手偏好对齐增强基于扩散模型的无限制对抗攻击
把无限制对抗样本生成视为对手偏好对齐问题,两阶段 APA 框架在保持视觉一致性的同时显著提升黑盒攻击迁移性。
- 会议论文NeurIPS 2025
AdvPrefix:面向细腻 LLM 越狱的目标函数
提出可即插即用的前缀强制目标,按预填充攻击成功率与负对数似然选择模型相关前缀;将 GCG 默认前缀替换后,Llama-3 上细腻攻击成功率从 14% 升至 80%。
- 会议论文NeurIPS 2025
IMPACT:基于两阶段优化的不规则多补丁对抗组合
提出无梯度的对抗补丁攻击框架,联合优化补丁形状、位置、数量与内容,并生成连续不规则补丁,效果优于多种现有方法。
- 会议论文NeurIPS 2025
基于类比的多轮 LLM 越狱
先用良性任务让模型学会目标响应结构,再在最后一轮做受控语义替换,在六个模型上平均攻击成功率 93.3%。