全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
针对大语言模型的持久化量化条件失准攻击
提出Q-Misalign攻击方法,使安全失准状态在全精度大模型中保持潜伏而在量化后被激活,并利用对比任务向量增强攻击持久性,显著提升量化模型的越狱成功率。
- 会议论文ICLR 2025
千处泄露致防线失守:「安全」AI 回复中的不安全信息泄露
提出基于信息泄露的评测框架和推理型攻击者威胁模型,问题分解攻击比传统越狱更有效地从受审查 LLM 中提取危险知识,且防御必然牺牲效用。
- 会议论文ICLR 2025
TASAR:骨骼动作识别的迁移对抗攻击
揭示了骨骼动作识别中对抗攻击迁移性差的原因,提出基于损失平滑和运动动力学的迁移攻击方法TASAR,并构建了首个大规模鲁棒性基准。
- 会议论文ICLR 2025
$\sigma$-zero:基于梯度的$\ell_0$范数对抗样本优化
针对l0范数非凸非可微难题,提出基于可微近似与自适应投影的梯度攻击方法sigma-zero,无需调参即可在多种图像基准上取得更高的对抗攻击成功率与效率。
- 会议论文ICLR 2025
大语言模型的安全训练能否泛化至语义相关的自然提示?
提出ReG-QA方法评估安全微调LLM对自然提示的泛化性,发现通过未对齐模型反推自然问题能有效越狱GPT-4等对齐模型,且能规避现有平滑防御手段。
- 会议论文ICLR 2025
无标签测试时自适应的对抗脆弱性研究
针对测试时自适应提出无需测试标签的对抗攻击算法,证明现有防御几乎无效并揭示其安全漏洞。
- 会议论文ICLR 2025
分辨率攻击:利用图像压缩欺骗深度神经网络
提出利用扩散模型生成多分辨率双语义图像的分辨率攻击,成功欺骗分类器并揭示了模型对分辨率变化的脆弱性。
- 会议论文ICLR 2025
大语言模型会成为煤气灯操纵者吗?
提出两阶段攻击框架DeepCoG,通过提示与微调诱导LLM进行心理操纵(煤气灯效应),揭示其安全漏洞并提出防御对齐策略。
- 会议论文ICLR 2025
针对图像水印的迁移规避攻击
提出一种无盒设置下针对AI生成图像水印的迁移逃逸攻击,通过攻击替代模型使含水印图像逃逸目标检测器,证实主流水印检测器面对逃逸攻击并不鲁棒。
- 会议论文ICLR 2025
针对语言模型激活与Token对抗攻击的缩放定律
研究了针对语言模型内部激活与输入Token的对抗攻击,推导出攻击易感性的缩放定律,证实操纵少量激活即可精确控制模型后续大量生成Token。
- 会议论文ICLR 2025
大语言模型的拒答训练能泛化到过去时态吗?
发现将有害请求改写为过去时即可高成功率越狱主流大模型,揭示当前拒答对齐技术的泛化缺陷,并验证在微调中显式加入过去时样本可有效防御。
- 会议论文ICLR 2025
置信度诱导:大语言模型的新型对抗攻击途径
提出在黑盒分类设置下通过诱导模型输出置信度指导对抗攻击,通过最小化置信度提升误分类概率,效果显著优于现有硬标签黑盒攻击。
- 会议论文ICLR 2025
理解并提升大语言模型越狱攻击的迁移性
揭示了对抗序列因过拟合导致越狱迁移性差的机理,提出PiF方法打散注意力掩盖恶意意图,显著提升对闭源模型的越狱迁移效果。
- 会议论文ICLR 2025
AutoDAN-Turbo:自主探索越狱策略的终身智能体
提出黑盒越狱框架AutoDAN-Turbo,无需人工干预即可自主探索发现越狱策略,在GPT-4等主流模型上取得了显著更高的攻击成功率。
- 会议论文ICLR 2025
GSE:分组稀疏且可解释的对抗攻击
提出两阶段算法生成图像语义区域内的分组稀疏对抗攻击,在显著提高稀疏度与计算速度的同时实现了100%的攻击成功率。
- 会议论文ICLR 2025
大语言模型基于优化的越狱改进技术
针对GCG越狱效率低的问题,提出多样化目标模板、自适应多坐标更新策略与由易到难初始化,构建高效越狱方法I-GCG并取得近100%成功率。
- 会议论文ICLR 2025
从时间与模态视角重新审视音视频对抗脆弱性
提出时间不变性攻击与模态错位攻击,并设计音视频对抗训练框架,在 Kinetics-Sounds 上攻击效果领先,防御显著提升鲁棒性与训练效率。
- 会议论文ICLR 2025
利用简单自适应攻击越狱主流安全对齐大语言模型
展示主流安全对齐大模型仍易受自适应越狱攻击,利用对数概率随机搜索、提示模板定制和预填充等技术,在GPT-4o、Claude等模型上实现极高越狱成功率。
- 会议论文ICLR 2025
基于多臂老虎机上下文切换的高效大语言模型序列越狱攻击
提出上下文序列多轮越狱攻击方法,将其建模为多臂老虎机问题以学习上下文切换查询序列,在主流开源模型上取得了 95% 的越狱攻击成功率。
- 会议论文ICLR 2025
Engorgio提示使大语言模型陷入喋喋不休
提出Engorgio攻击方法,通过跟踪预测轨迹和设计损失函数抑制结束符生成,诱导大模型输出异常冗长文本,大幅增加推理计算成本与延迟,威胁服务可用性。
- 会议论文ICLR 2025
Logicbreaks:理解规则推理被颠覆的框架
将规则遵循形式化为 Horn 逻辑推理,证明恶意提示可误导理论模型和真实模型,且主流攻击算法产生的注意力模式与理论一致。
- 会议论文ICLR 2025
UV-Attack:基于动态NeRF纹理映射的行人检测物理对抗攻击
提出结合动态NeRF与UV映射的物理对抗攻击UV-Attack,通过在人体上修改衣物纹理生成对抗样本,显著提升了针对动态视频中行人检测器的逃逸攻击成功率。
- 会议论文ICLR 2025
一模迁所有:面向大语言模型的鲁棒越狱提示生成
提出针对受防御大模型的越狱攻击ArrAttack,利用通用鲁棒性判别模型生成可绕过多种防御的越狱提示,在GPT-4和Claude-3等黑白盒模型上展现出强迁移性。
- 会议论文ICLR 2025
用迁移先验增强 hard-label 攻击的射线搜索
针对只能获得 top-1 标签的黑盒对抗攻击,用代理模型的迁移先验改进梯度估计,在 ImageNet 和 CIFAR-10 上查询效率超过 11 种现有方法。