全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
FlipAttack:通过文本翻转越狱大语言模型
利用 LLM 自回归从左到右的理解特点,通过翻转扰动伪装有害提示,单次查询即可越狱黑盒模型,8 个 LLM 平均成功率约 78.97%,绕过 5 个护栏模型约 98%。
- 会议论文ICML 2025
AdvI2I:针对图像到图像扩散模型的对抗图像攻击
提出 AdvI2I,通过优化生成器制造对抗图像,诱使 I2I 扩散模型生成 NSFW 内容,可绕过 SLD 等防御,自适应版本更能抵御对策。
- 会议论文ICML 2025
Emoji Attack:增强针对 Judge LLM 检测的越狱攻击
利用分隔符导致的 token 切分偏差,借助上下文学习向文本插入 emoji,扭曲 embedding,使 Judge LLM 将有害内容误判为安全,显著降低不安全内容检出率。
- 会议论文ICML 2025
REINFORCE 对抗攻击大语言模型:自适应、分布式、语义化目标
指出肯定回复目标会高估鲁棒性,用 REINFORCE 提出基于响应分布的语义目标,在 GCG 和 PGD 上使 Llama3 的攻击成功率翻倍,对 circuit breaker 防御从 2% 升至 50%。
- 会议论文ICML 2025
HyperNear:针对超图神经网络的不易察觉节点注入攻击
提出首个面向超图神经网络的节点注入攻击框架 HyperNear,通过监测同配性变化保持隐蔽性,实验显示攻击有效且泛化良好。
- 会议论文ICML 2025
Gandalf the Red:面向 LLM 的自适应安全
提出 D-SEC 威胁模型,并借众包红队平台 Gandalf 收集 27.9 万条提示攻击,发现系统提示类防御会损害可用性,限定领域与纵深防御更有效。
- 会议论文ICML 2025
越狱时的对抗推理
利用损失信号引导测试时计算的自动越狱方法,在多种对齐 LLM 上达到 SOTA 攻击成功率,包括以推理算力换鲁棒性的模型。
- 会议论文ICML 2025
Pixel2Feature Attack:重新思考扰动空间以提升对抗迁移性
指出现有特征级攻击迁移性受限的原因,提出把扰动空间从像素移到特征空间多次扰动,迁移性优于现有 SOTA 攻击。
- 会议论文ICML 2025
面向 LLM 越狱的可解释 N-gram 困惑度威胁模型
基于 1T token 的 N-gram 模型统一比较越狱攻击,发现对现代模型的成功率低于既有报告,离散优化类攻击优于 LLM 类攻击。
- 会议论文ICML 2025
AdvPrompter:面向 LLM 的快速自适应对抗提示
训练一个 LLM 在数秒内生成可读的对抗后缀,在 AdvBench、HarmBench 上表现有竞争力并可迁移到闭源模型,用其数据训练还能提升鲁棒性。
- 会议论文ICML 2025
通过自信息改写攻击揭示文本水印的弱点
提出 SIRA 改写攻击,利用水印多嵌入高熵 token 的设计缺陷,对七种水印方法攻击成功率近 100%,成本极低。
- 会议论文ICML 2025
Speak Easy:用简单交互诱发 LLM 的有害越狱
提出 HarmScore 指标与多步多语言攻击框架 Speak Easy,在四个安全基准上平均提升攻击成功率 0.319、HarmScore 0.426。
- 会议论文ICML 2025
MELON:针对 AI Agent 间接提示注入攻击的可证明防御
通过用掩码用户提示重新执行 Agent 轨迹,比较动作相似度来检测间接提示注入,在 AgentDojo 上攻击防御与效用保持均优于已有防御。
- 会议论文ICML 2025
针对 LLM 代码补全的黑盒对抗攻击
提出 INSEC 攻击,在补全输入中注入优化后的注释字符串,使黑盒代码补全引擎生成不安全代码的比例提高超 50%,并在 Copilot 上验证可部署。
- 会议论文ICML 2025
DiffAdvMAP:基于扩散模型生成自然的无限制对抗样本
以扩散模型先验近似后验分布来生成更自然的无限制对抗样本,在 ImageNet 上于图像质量、灵活性和迁移性之间取得更好平衡。
- 会议论文ICML 2025
MemFreezing:有限未来知识下针对时序图神经网络的对抗攻击
注入虚假节点或边,使节点记忆进入冻结状态并向邻居传播,在无需攻击后图信息的情况下持续降低 TGNN 多种任务的性能。
- 会议论文ICML 2025
PANDAS:通过正向肯定、负面示范与自适应采样改进 many-shot 越狱
改造 many-shot 越狱中的伪造对话,并发布 ManyHarm 数据集;长上下文场景下显著优于基线,并用注意力分析解释其机制。
- 会议论文ICML 2025
语言模型鲁棒性的规模化趋势
从 scaling 视角研究对抗攻防:无安全训练时大模型并不更鲁棒,攻击算力增加使成功率平滑上升,攻击规模增速超过对抗训练,但更大的对抗训练模型长期或利于防守。
- 会议论文ICML 2025
TtBA:基于决策的对抗攻击的三分之二桥接方法
提出基于法向量的硬标签黑盒对抗攻击 TtBA,降低查询复杂度,在多个数据集和模型上优于现有攻击方法。
- 会议论文ICML 2025
理解可迁移对抗攻击中的模型集成
为模型集成对抗攻击建立理论框架,将迁移误差分解为脆弱性、多样性和常数项,并用 54 个模型的实验验证降低迁移误差的三条准则。
- 会议论文NDSS 2025
AlphaDog:利用 Alpha 通道的无盒伪装攻击
利用 RGBA 图像 Alpha 通道让人眼与模型看到不同内容,无需查询即可欺骗 100 个图像识别系统,并提出直方图检测方法。
- 会议论文NDSS 2025
自动化恶意软件工厂:搭载式重打包与对抗样本结合的安卓恶意软件生成
将恶意代码搭载进热门应用并生成对抗扰动,批量产生可规避检测的安卓恶意软件,对 Drebin、MaMaDroid 平均攻击成功率 88.3%。
- 会议论文NDSS 2025
编译模型自带漏洞:揭示 DNN 可执行文件中普遍存在的比特翻转攻击面
首次系统研究 DNN 可执行文件的 BFA,发现仅需已知模型结构即可攻击,平均约 1.4 次翻转就能使精度降至随机水平。
- 会议论文NDSS 2025
L-HAWK:针对远距离目标的可控物理对抗补丁
提出由激光触发的物理对抗补丁攻击自动驾驶视觉感知,50 米处平均攻击成功率 91.9%,明显优于 TPatch。