全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
通过自信息改写攻击揭示文本水印的弱点
提出 SIRA 改写攻击,利用水印多嵌入高熵 token 的设计缺陷,对七种水印方法攻击成功率近 100%,成本极低。
- 会议论文ICML 2025
Speak Easy:用简单交互诱发 LLM 的有害越狱
提出 HarmScore 指标与多步多语言攻击框架 Speak Easy,在四个安全基准上平均提升攻击成功率 0.319、HarmScore 0.426。
- 会议论文ICML 2025
针对 LLM 代码补全的黑盒对抗攻击
提出 INSEC 攻击,在补全输入中注入优化后的注释字符串,使黑盒代码补全引擎生成不安全代码的比例提高超 50%,并在 Copilot 上验证可部署。
- 会议论文ICML 2025
DiffAdvMAP:基于扩散模型生成自然的无限制对抗样本
以扩散模型先验近似后验分布来生成更自然的无限制对抗样本,在 ImageNet 上于图像质量、灵活性和迁移性之间取得更好平衡。
- 会议论文ICML 2025
MemFreezing:有限未来知识下针对时序图神经网络的对抗攻击
注入虚假节点或边,使节点记忆进入冻结状态并向邻居传播,在无需攻击后图信息的情况下持续降低 TGNN 多种任务的性能。
- 会议论文ICML 2025
PANDAS:通过正向肯定、负面示范与自适应采样改进 many-shot 越狱
改造 many-shot 越狱中的伪造对话,并发布 ManyHarm 数据集;长上下文场景下显著优于基线,并用注意力分析解释其机制。
- 会议论文ICML 2025
语言模型鲁棒性的规模化趋势
从 scaling 视角研究对抗攻防:无安全训练时大模型并不更鲁棒,攻击算力增加使成功率平滑上升,攻击规模增速超过对抗训练,但更大的对抗训练模型长期或利于防守。
- 会议论文ICML 2025
TtBA:基于决策的对抗攻击的三分之二桥接方法
提出基于法向量的硬标签黑盒对抗攻击 TtBA,降低查询复杂度,在多个数据集和模型上优于现有攻击方法。
- 会议论文ICML 2025
理解可迁移对抗攻击中的模型集成
为模型集成对抗攻击建立理论框架,将迁移误差分解为脆弱性、多样性和常数项,并用 54 个模型的实验验证降低迁移误差的三条准则。
- 会议论文NDSS 2025
AlphaDog:利用 Alpha 通道的无盒伪装攻击
利用 RGBA 图像 Alpha 通道让人眼与模型看到不同内容,无需查询即可欺骗 100 个图像识别系统,并提出直方图检测方法。
- 会议论文NDSS 2025
自动化恶意软件工厂:搭载式重打包与对抗样本结合的安卓恶意软件生成
将恶意代码搭载进热门应用并生成对抗扰动,批量产生可规避检测的安卓恶意软件,对 Drebin、MaMaDroid 平均攻击成功率 88.3%。
- 会议论文NDSS 2025
编译模型自带漏洞:揭示 DNN 可执行文件中普遍存在的比特翻转攻击面
首次系统研究 DNN 可执行文件的 BFA,发现仅需已知模型结构即可攻击,平均约 1.4 次翻转就能使精度降至随机水平。
- 会议论文NDSS 2025
L-HAWK:针对远距离目标的可控物理对抗补丁
提出由激光触发的物理对抗补丁攻击自动驾驶视觉感知,50 米处平均攻击成功率 91.9%,明显优于 TPatch。
- 会议论文NDSS 2025
Magmaw:针对机器学习无线通信系统的模态无关对抗攻击
提出可对任意多模态无线信号生成通用对抗扰动的攻击,在软件无线电平台实测,即使有强防御仍显著降低性能。
- 会议论文NDSS 2025
重新审视交通标志识别的物理世界对抗攻击:商用系统视角
首次大规模测量物理对抗攻击对商用交通标志识别系统的效果,发现攻击不易泛化,空间记忆设计是主因,并提出新的攻击成功率指标。
- 会议论文NeurIPS 2025
GASP:高效黑盒生成对抗后缀以越狱 LLM
用潜空间贝叶斯优化在黑盒设定下生成可读性强的对抗后缀,提高越狱成功率并缩短训练与推理时间,适用于 LLM 红队测试。
- 会议论文NeurIPS 2025
注意!你的视觉语言模型可能被恶意操控
提出 VMA 攻击,用动量优化和可微变换生成图像对抗扰动,精确操控 VLM 输出,可用于越狱、劫持、隐私泄露和拒绝服务,也可注入水印。
- 会议论文NeurIPS 2025
面向视觉语言模型的思维可视化越狱攻击
提出 VoTA,构造含风险视觉思维的图像链,利用推理与安全目标的冲突,在 15 个 VLM 上平均攻击成功率从 63.70% 升至 90.41%。
- 会议论文NeurIPS 2025
CARES:医疗 LLM 安全性与对抗鲁棒性综合评测
构建含 1.8 万余条提示的医疗安全基准,发现多数模型易受改写式越狱且对正常问题过度拒答,并提出轻量分类器缓解。
- 会议论文NeurIPS 2025
SECA:语义等价且连贯的攻击以诱发 LLM 幻觉
通过保持语义等价与连贯的真实提示改写,用约束零阶优化搜索对抗提示,攻击成功率高于现有方法,开源与商用 LLM 均对此敏感。
- 会议论文NeurIPS 2025
Best-of-N 越狱
提出黑盒 BoN 越狱:反复采样带扰动的提示直到诱出有害回复,10000 次采样下对 GPT-4o 成功率 89%、Claude 3.5 Sonnet 78%,可跨文本、视觉、音频模态,成功率随样本数呈幂律增长。
- 会议论文NeurIPS 2025
极简高效的攻击基线:对 GPT-4.5/4o/o1 等黑盒模型成功率超 90%
通过局部裁剪并在嵌入空间对齐目标图像,在语义丰富区域集中扰动,对商业 LVLM 的迁移式定向攻击成功率超 90%。
- 会议论文NeurIPS 2025
“Erasing the Invisible”技术报告:2024 NeurIPS 图像水印压力测试竞赛
组织水印攻击竞赛并发布基准,前五名团队平均可去除至少 89% 图像的水印且保持画质,暴露了现有水印方法的脆弱性。
- 会议论文NeurIPS 2025
每次查询泄露的比特数:LLM 对抗攻击的信息论界
以观测信号与目标属性的互信息衡量泄露量,推出攻击所需查询数下界;在七个 LLM 上,仅答案约千次查询,加 logits 约百次,披露思考过程仅需数十次。