全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
ProAdvPrompter:两阶段高效对抗性提示生成方法
提出结合损失引导探索与优质后缀微调利用的两阶段对抗提示生成方法ProAdvPrompter,大幅提高了针对已对齐大模型的越狱攻击成功率。
- 会议论文ICLR 2025
将大语言模型越狱视为奖励错误指定问题
将LLM易受对抗攻击归因于对齐过程中的奖励错误指定,并提出自动化红队系统ReMiss生成对抗提示,在AdvBench上取得SOTA越狱成功率。
- 会议论文ICLR 2025
泛函同伦:平滑离散优化以实现大模型越狱攻击
提出泛函同伦优化方法,通过连续参数平滑离散输入空间,用于大模型越狱攻击合成,在规避Llama-2和Llama-3等安全模型时成功率提升20%-30%。
- 会议论文ICLR 2025
视觉语言模型间可迁移图像越狱攻击的失败现象研究
对40余个开源VLM的研究发现,基于梯度的通用图像越狱攻击在不同模型间极难迁移,表明VLM对此类攻击更具鲁棒性。
- 会议论文ICLR 2025
基于双射学习的无限越狱攻击
提出利用上下文学习诱导模型掌握随机双射编码的越狱攻击算法,发现模型能力越强越容易受到复杂双射攻击,揭示了随规模涌现的安全脆弱性。
- 会议论文ICLR 2025
h4rm3l:用于可组合越狱攻击合成的领域特定语言
提出领域特定语言h4rm3l及合成框架,将越狱攻击形式化表达为变换原语组合,在多个主流大模型上实现超90%成功率。
- 会议论文ICML 2025
面向鲁棒多智能体强化学习的 Wolfpack 对抗攻击
提出受狼群捕猎启发的 Wolfpack 协同对抗攻击破坏 MARL 合作,并提出 WALL 框架训练鲁棒策略,实验显示攻击破坏显著、防御提升明显。
- 会议论文ICML 2025
对抗扰动由对抗 Jacobian 右奇异向量的线性组合迭代学习而成
提出 RisingAttacK,基于 SQP 在对抗 Jacobian 右奇异向量张成的子空间中优化有序 top-K 目标攻击,在 ImageNet 四个模型上超过 QuadAttacK。
- 会议论文ICML 2025
通过刷票提升 Chatbot Arena 上的模型排名
展示 Chatbot Arena 众包投票可被操纵,提出 target-only 与 omnipresent rigging 策略,基于约 170 万历史投票,仅需数百票即可改变目标模型排名。
- 会议论文ICML 2025
De-mark:大语言模型中的水印移除
提出 De-mark 框架,通过 random selection probing 探测水印强度并识别 n-gram 水印的红绿名单,在 Llama3 和 ChatGPT 上有效移除水印。
- 会议论文ICML 2025
见树不见林:利用启发式与偏差诱导 LLM 的非理性选择
提出受人类认知偏差启发的越狱框架 ICRT,通过认知分解和相关性偏差重组提示,并用排序聚合指标评估有害程度,能稳定绕过主流 LLM 安全机制。
- 会议论文ICML 2025
大语言模型的弱到强越狱
用两个小模型(安全与不安全)修改大型安全模型的解码概率,每个样本仅一次前向即可在 5 个开源 LLM 上将失配率提升至 99% 以上,并给出初步防御。
- 会议论文ICML 2025
全角度攻击:针对人脸识别的隐形强力物理对抗攻击
提出 UVHat,用帽子上的紫外发射器和强化学习优化参数,在黑盒设置下对人脸识别实施隐蔽的物理对抗攻击,成功率显著提升。
- 会议论文ICML 2025
X-Transfer 攻击:面向 CLIP 的超强迁移对抗攻击
提出 X-Transfer,通过动态选择代理模型的 surrogate scaling 生成通用对抗扰动,可跨数据、领域、模型和任务欺骗 CLIP 及下游 VLM,优于现有 UAP 方法。
- 会议论文ICML 2025
针对语言模型水印的自适应攻击优化
用偏好优化针对特定水印方法调校自适应改写攻击,能规避所有被测水印,对未见水印也有效且成本低,说明需用自适应攻击测试鲁棒性。
- 会议论文ICML 2025
FlipAttack:通过文本翻转越狱大语言模型
利用 LLM 自回归从左到右的理解特点,通过翻转扰动伪装有害提示,单次查询即可越狱黑盒模型,8 个 LLM 平均成功率约 78.97%,绕过 5 个护栏模型约 98%。
- 会议论文ICML 2025
AdvI2I:针对图像到图像扩散模型的对抗图像攻击
提出 AdvI2I,通过优化生成器制造对抗图像,诱使 I2I 扩散模型生成 NSFW 内容,可绕过 SLD 等防御,自适应版本更能抵御对策。
- 会议论文ICML 2025
Emoji Attack:增强针对 Judge LLM 检测的越狱攻击
利用分隔符导致的 token 切分偏差,借助上下文学习向文本插入 emoji,扭曲 embedding,使 Judge LLM 将有害内容误判为安全,显著降低不安全内容检出率。
- 会议论文ICML 2025
REINFORCE 对抗攻击大语言模型:自适应、分布式、语义化目标
指出肯定回复目标会高估鲁棒性,用 REINFORCE 提出基于响应分布的语义目标,在 GCG 和 PGD 上使 Llama3 的攻击成功率翻倍,对 circuit breaker 防御从 2% 升至 50%。
- 会议论文ICML 2025
HyperNear:针对超图神经网络的不易察觉节点注入攻击
提出首个面向超图神经网络的节点注入攻击框架 HyperNear,通过监测同配性变化保持隐蔽性,实验显示攻击有效且泛化良好。
- 会议论文ICML 2025
越狱时的对抗推理
利用损失信号引导测试时计算的自动越狱方法,在多种对齐 LLM 上达到 SOTA 攻击成功率,包括以推理算力换鲁棒性的模型。
- 会议论文ICML 2025
Pixel2Feature Attack:重新思考扰动空间以提升对抗迁移性
指出现有特征级攻击迁移性受限的原因,提出把扰动空间从像素移到特征空间多次扰动,迁移性优于现有 SOTA 攻击。
- 会议论文ICML 2025
面向 LLM 越狱的可解释 N-gram 困惑度威胁模型
基于 1T token 的 N-gram 模型统一比较越狱攻击,发现对现代模型的成功率低于既有报告,离散优化类攻击优于 LLM 类攻击。
- 会议论文ICML 2025
AdvPrompter:面向 LLM 的快速自适应对抗提示
训练一个 LLM 在数秒内生成可读的对抗后缀,在 AdvBench、HarmBench 上表现有竞争力并可迁移到闭源模型,用其数据训练还能提升鲁棒性。