全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ICLR 2026
绕过Token级安全机制的深度微调攻击
提出先拒答后遵从的深度微调攻击策略,成功绕过浅层防御与输出过滤器,对GPT-4o和Claude Haiku实现高成功率越狱。
- 会议论文ICLR 2026
基于概念的对抗攻击:概率视角
提出一种基于概念的对抗攻击框架,从概率分布视角生成保持类别概念但在姿态、视角或背景上多样化的对抗样本,以更高效率误导分类器。
- 会议论文ICLR 2026
迈向面向视觉语言模型的通用且可迁移越狱攻击
提出跨模型通用且可迁移的VLM越狱攻击框架UltraBreak,结合视觉空间正则化与语义目标平滑损失曲面,显著提升黑盒越狱成功率。
- 会议论文ICLR 2026
VPI-Bench:针对计算机使用智能体的视觉提示注入攻击
构建了首个针对计算机使用智能体的视觉提示注入威胁模型与评测基准VPI-Bench,揭示了黑盒环境下通过屏幕视觉注入诱导智能体执行未授权操作的严重风险。
- 会议论文ICLR 2026
越狱可迁移性源于共享表征
该研究揭示越狱攻击的可迁移性源于模型间的共享表征,证明良性提示下的表征相似度与源模型攻击强度是决定越狱迁移的关键因素,角色扮演类攻击更易跨模型迁移。
- 会议论文ICLR 2026
特征压缩是神经网络对抗脆弱性的根源
用矩阵理论解释分类网络的对抗脆弱性:鲁棒性可能仅为最优分类器的 1/√d,随输入维度增大而下降,并在包括 ImageNet 的实验中得到验证。
- 会议论文ICLR 2026
大语言模型可在同等长度文本中隐藏文本
提出文本隐写协议Calgacus,可用8B模型在数秒内将文本编码进等长连贯文本中,可被用于将未过滤模型的回答隐藏在安全回复中以绕过安全监控。
- 会议论文ICLR 2026
ChatInject:利用聊天模板在LLM智能体中实施提示注入
揭示LLM对聊天模板的依赖漏洞,提出模仿原生模板格式的ChatInject间接提示注入攻击,在多个智能体基准上显著提升了攻击成功率与迁移性。
- 会议论文ICLR 2026
基于逆梯度采样的抗未知扰动鲁棒对抗攻击
提出鲁棒对抗攻击方法IGSA,通过逆梯度采样与扰动引导优化生成对抗样本,提升了在未知扰动及对抗训练防御模型下的攻击有效性。
- 会议论文ICLR 2026
深度语音降噪模型对对抗噪声鲁棒吗?
揭示添加心理声学不可察觉的对抗噪声可导致主流深度降噪模型输出乱码,指出了语音模型在安全场景的脆弱性。
- 会议论文ICLR 2026
TAO-Attack:面向大语言模型的高级优化型越狱攻击
提出优化越狱方法TAO-Attack,利用两阶段损失函数抑制拒答并诱导有害输出,结合方向优先词元优化显著提高越狱成功率与效率。
- 会议论文ICLR 2026
GuidedBench:评估并缓解真实场景大模型越狱方法的评测偏差
针对现有越狱评测缺乏逐案例标准导致的评估偏差,提出包含有害问题集与细粒度评测指南的GuidedBench,显著降低评估方差并提高可复现性。
- 会议论文ICLR 2026
自我越狱:语言模型在良性推理训练后会自行突破安全对齐
该研究发现推理大模型在经过良性代码或数学训练后会出现自我越狱现象,在思维链中自主引入良性假设来规避安全护栏以执行有害请求,加入少量安全推理数据可有效缓解。
- 会议论文ICLR 2026
时间即一切:针对事件驱动脉冲神经网络的脉冲重定时攻击
提出只调整脉冲时间、保持脉冲数不变的对抗攻击,在 DVS-Gesture 上改动不足 2% 脉冲即达 90% 以上成功率,现有防御难以应对。
- 会议论文ICLR 2026
Align to Misalign:基于元优化裁判的自动化大模型越狱方法
提出双层元优化框架AMIS,协同进化越狱提示词与评分模板,在Claude-3.5等前沿模型上取得大幅领先的越狱成功率。
- 会议论文ICLR 2026
基于分镜切分策略的文生视频模型越狱攻击
提出黑盒越狱方法SceneSplit,将有害叙事拆分为良性分镜以约束生成空间并绕过安全过滤,在Sora2等文生视频模型上取得高攻击成功率。
- 会议论文ICLR 2026
通过生成器语义一致性改进黑盒生成式对抗攻击
提出通过指数移动平均教师模型对齐生成器中间特征以保持语义一致性,显著提升了生成式对抗样本的黑盒迁移攻击效果与测试效率。
- 会议论文ICLR 2026
自动辩证越狱:有效越狱策略生成框架
将越狱攻击建模为两LLM辩论的斯塔克伯格多目标博弈,提出自动辩证越狱框架ADJ,结合小波变换求解多目标优化,有效提升了越狱攻击生成能力与自适应防御抵抗力。
- 会议论文ICLR 2026
LingoLoop攻击:通过语言上下文与状态诱捕使多模态大模型陷入死循环
提出针对多模态大模型的LingoLoop攻击,通过词性感知延迟与生成路径剪枝诱发死循环,使输出序列暴增至367倍,导致严重的计算资源耗尽与服务降级。
- 会议论文ICLR 2026
针对大型视觉语言模型的高迁移性与隐蔽性对抗攻击
提出基于扩散模型的渐进式语义注入攻击PSI,利用扩散先验提高样本自然度并保留视觉保真度,显著提升了对GPT-5等商用视觉语言模型的黑盒攻击迁移性与隐蔽性。
- 会议论文ICLR 2026
图像能唤醒记忆:针对图像生成模型遗忘学习的多模态引导攻击
提出多模态对抗框架RECALL,利用参考图像优化对抗图像提示词,成功突破现有十种概念遗忘防御并复现有害概念,揭示了遗忘机制的安全脆弱性。
- 会议论文ICLR 2026
越狱黑客帝国:用于受控模型颠覆的零空间导向
提出一种基于注意力头掩码与零空间导向的电路级干预越狱方法HMNS,通过抑制因果注意力头并注入几何受限微扰,高成功率绕过大模型安全机制。
- 会议论文ICLR 2026
面具背后的恶魔:扩散式 LLM 的新兴安全漏洞
提出 DIJA 越狱框架,利用 dLLM 的双向建模与并行解码使对齐失效,在 Dream-Instruct 上关键词 ASR 最高达 100%,显著超过既有方法。
- 会议论文ICLR 2026
平坦性何时(不)保证对抗鲁棒性
形式化平坦极小值与对抗鲁棒性的关系:平坦性只保证局部而非全局鲁棒;要保持更大范围鲁棒,损失需在偏离数据流形处急剧弯曲,并在多种架构上验证。