全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
利用简单自适应攻击越狱主流安全对齐大语言模型
展示主流安全对齐大模型仍易受自适应越狱攻击,利用对数概率随机搜索、提示模板定制和预填充等技术,在GPT-4o、Claude等模型上实现极高越狱成功率。
- 会议论文ICLR 2025
面向大语言模型的对抗性搜索引擎优化
提出偏好操纵攻击,利用精心设计的网页内容或插件文档诱导大模型偏袒攻击者产品并贬低竞争对手,在必应等真实大模型搜索与插件中验证了威胁。
- 会议论文ICLR 2025
基于多臂老虎机上下文切换的高效大语言模型序列越狱攻击
提出上下文序列多轮越狱攻击方法,将其建模为多臂老虎机问题以学习上下文切换查询序列,在主流开源模型上取得了 95% 的越狱攻击成功率。
- 会议论文ICLR 2025
Engorgio提示使大语言模型陷入喋喋不休
提出Engorgio攻击方法,通过跟踪预测轨迹和设计损失函数抑制结束符生成,诱导大模型输出异常冗长文本,大幅增加推理计算成本与延迟,威胁服务可用性。
- 会议论文ICLR 2025
Logicbreaks:理解规则推理被颠覆的框架
将规则遵循形式化为 Horn 逻辑推理,证明恶意提示可误导理论模型和真实模型,且主流攻击算法产生的注意力模式与理论一致。
- 会议论文ICLR 2025
UV-Attack:基于动态NeRF纹理映射的行人检测物理对抗攻击
提出结合动态NeRF与UV映射的物理对抗攻击UV-Attack,通过在人体上修改衣物纹理生成对抗样本,显著提升了针对动态视频中行人检测器的逃逸攻击成功率。
- 会议论文ICLR 2025
一模迁所有:面向大语言模型的鲁棒越狱提示生成
提出针对受防御大模型的越狱攻击ArrAttack,利用通用鲁棒性判别模型生成可绕过多种防御的越狱提示,在GPT-4和Claude-3等黑白盒模型上展现出强迁移性。
- 会议论文ICLR 2025
指令分段嵌入:利用指令层级提升LLM安全性
提出指令分段嵌入技术将指令优先级直接融入模型架构,使模型能显式区分并优先处理高优先级指令,显著增强了抵御恶意提示注入的能力。
- 会议论文ICLR 2025
用迁移先验增强 hard-label 攻击的射线搜索
针对只能获得 top-1 标签的黑盒对抗攻击,用代理模型的迁移先验改进梯度估计,在 ImageNet 和 CIFAR-10 上查询效率超过 11 种现有方法。
- 会议论文ICLR 2025
ProAdvPrompter:两阶段高效对抗性提示生成方法
提出结合损失引导探索与优质后缀微调利用的两阶段对抗提示生成方法ProAdvPrompter,大幅提高了针对已对齐大模型的越狱攻击成功率。
- 会议论文ICLR 2025
将大语言模型越狱视为奖励错误指定问题
将LLM易受对抗攻击归因于对齐过程中的奖励错误指定,并提出自动化红队系统ReMiss生成对抗提示,在AdvBench上取得SOTA越狱成功率。
- 会议论文ICLR 2025
泛函同伦:平滑离散优化以实现大模型越狱攻击
提出泛函同伦优化方法,通过连续参数平滑离散输入空间,用于大模型越狱攻击合成,在规避Llama-2和Llama-3等安全模型时成功率提升20%-30%。
- 会议论文ICLR 2025
视觉语言模型间可迁移图像越狱攻击的失败现象研究
对40余个开源VLM的研究发现,基于梯度的通用图像越狱攻击在不同模型间极难迁移,表明VLM对此类攻击更具鲁棒性。
- 会议论文ICLR 2025
基于双射学习的无限越狱攻击
提出利用上下文学习诱导模型掌握随机双射编码的越狱攻击算法,发现模型能力越强越容易受到复杂双射攻击,揭示了随规模涌现的安全脆弱性。
- 会议论文ICLR 2025
h4rm3l:用于可组合越狱攻击合成的领域特定语言
提出领域特定语言h4rm3l及合成框架,将越狱攻击形式化表达为变换原语组合,在多个主流大模型上实现超90%成功率。
- 会议论文ICML 2025
面向鲁棒多智能体强化学习的 Wolfpack 对抗攻击
提出受狼群捕猎启发的 Wolfpack 协同对抗攻击破坏 MARL 合作,并提出 WALL 框架训练鲁棒策略,实验显示攻击破坏显著、防御提升明显。
- 会议论文ICML 2025
对抗扰动由对抗 Jacobian 右奇异向量的线性组合迭代学习而成
提出 RisingAttacK,基于 SQP 在对抗 Jacobian 右奇异向量张成的子空间中优化有序 top-K 目标攻击,在 ImageNet 四个模型上超过 QuadAttacK。
- 会议论文ICML 2025
通过刷票提升 Chatbot Arena 上的模型排名
展示 Chatbot Arena 众包投票可被操纵,提出 target-only 与 omnipresent rigging 策略,基于约 170 万历史投票,仅需数百票即可改变目标模型排名。
- 会议论文ICML 2025
De-mark:大语言模型中的水印移除
提出 De-mark 框架,通过 random selection probing 探测水印强度并识别 n-gram 水印的红绿名单,在 Llama3 和 ChatGPT 上有效移除水印。
- 会议论文ICML 2025
见树不见林:利用启发式与偏差诱导 LLM 的非理性选择
提出受人类认知偏差启发的越狱框架 ICRT,通过认知分解和相关性偏差重组提示,并用排序聚合指标评估有害程度,能稳定绕过主流 LLM 安全机制。
- 会议论文ICML 2025
大语言模型的弱到强越狱
用两个小模型(安全与不安全)修改大型安全模型的解码概率,每个样本仅一次前向即可在 5 个开源 LLM 上将失配率提升至 99% 以上,并给出初步防御。
- 会议论文ICML 2025
全角度攻击:针对人脸识别的隐形强力物理对抗攻击
提出 UVHat,用帽子上的紫外发射器和强化学习优化参数,在黑盒设置下对人脸识别实施隐蔽的物理对抗攻击,成功率显著提升。
- 会议论文ICML 2025
X-Transfer 攻击:面向 CLIP 的超强迁移对抗攻击
提出 X-Transfer,通过动态选择代理模型的 surrogate scaling 生成通用对抗扰动,可跨数据、领域、模型和任务欺骗 CLIP 及下游 VLM,优于现有 UAP 方法。
- 会议论文ICML 2025
针对语言模型水印的自适应攻击优化
用偏好优化针对特定水印方法调校自适应改写攻击,能规避所有被测水印,对未见水印也有效且成本低,说明需用自适应攻击测试鲁棒性。