全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACM CCS 2025
FlippedRAG:针对 LLM 检索增强生成的黑盒观点操纵攻击
- 会议论文ACM CCS 2025
天气预报中的对抗性观测
- 会议论文ACM CCS 2025
GASLITE:探索基于稠密嵌入的检索中的漏洞
- 会议论文ACM CCS 2025
评估生产级恶意软件检测系统对可迁移对抗攻击的鲁棒性
- 会议论文ACM CCS 2025
AI 蠕虫来了:阻止对抗性自我复制提示在 GenAI 生态中传播
- 会议论文ICLR 2025
AdvWave:针对大音频语言模型的隐蔽对抗越狱攻击
提出首个针对大音频语言模型的越狱攻击框架AdvWave,通过双阶段梯度优化和自然环境音伪装,在保持音频自然隐蔽的同时大幅提高了越狱成功率。
- 会议论文ICLR 2025
针对大语言模型的持久化量化条件失准攻击
提出Q-Misalign攻击方法,使安全失准状态在全精度大模型中保持潜伏而在量化后被激活,并利用对比任务向量增强攻击持久性,显著提升量化模型的越狱成功率。
- 会议论文ICLR 2025
大语言模型能否分离指令与数据?
针对LLM因无法分离指令与数据而易受间接提示注入攻击的风险,提出指令与数据分离的形式化度量与SEP基准,实证发现主流模型均无法有效实现二者分离。
- 会议论文ICLR 2025
千处泄露致防线失守:「安全」AI 回复中的不安全信息泄露
提出基于信息泄露的评测框架和推理型攻击者威胁模型,问题分解攻击比传统越狱更有效地从受审查 LLM 中提取危险知识,且防御必然牺牲效用。
- 会议论文ICLR 2025
TASAR:骨骼动作识别的迁移对抗攻击
揭示了骨骼动作识别中对抗攻击迁移性差的原因,提出基于损失平滑和运动动力学的迁移攻击方法TASAR,并构建了首个大规模鲁棒性基准。
- 会议论文ICLR 2025
$\sigma$-zero:基于梯度的$\ell_0$范数对抗样本优化
针对l0范数非凸非可微难题,提出基于可微近似与自适应投影的梯度攻击方法sigma-zero,无需调参即可在多种图像基准上取得更高的对抗攻击成功率与效率。
- 会议论文ICLR 2025
大语言模型的安全训练能否泛化至语义相关的自然提示?
提出ReG-QA方法评估安全微调LLM对自然提示的泛化性,发现通过未对齐模型反推自然问题能有效越狱GPT-4等对齐模型,且能规避现有平滑防御手段。
- 会议论文ICLR 2025
无标签测试时自适应的对抗脆弱性研究
针对测试时自适应提出无需测试标签的对抗攻击算法,证明现有防御几乎无效并揭示其安全漏洞。
- 会议论文ICLR 2025
分辨率攻击:利用图像压缩欺骗深度神经网络
提出利用扩散模型生成多分辨率双语义图像的分辨率攻击,成功欺骗分类器并揭示了模型对分辨率变化的脆弱性。
- 会议论文ICLR 2025
大语言模型会成为煤气灯操纵者吗?
提出两阶段攻击框架DeepCoG,通过提示与微调诱导LLM进行心理操纵(煤气灯效应),揭示其安全漏洞并提出防御对齐策略。
- 会议论文ICLR 2025
针对图像水印的迁移规避攻击
提出一种无盒设置下针对AI生成图像水印的迁移逃逸攻击,通过攻击替代模型使含水印图像逃逸目标检测器,证实主流水印检测器面对逃逸攻击并不鲁棒。
- 会议论文ICLR 2025
针对语言模型激活与Token对抗攻击的缩放定律
研究了针对语言模型内部激活与输入Token的对抗攻击,推导出攻击易感性的缩放定律,证实操纵少量激活即可精确控制模型后续大量生成Token。
- 会议论文ICLR 2025
大语言模型的拒答训练能泛化到过去时态吗?
发现将有害请求改写为过去时即可高成功率越狱主流大模型,揭示当前拒答对齐技术的泛化缺陷,并验证在微调中显式加入过去时样本可有效防御。
- 会议论文ICLR 2025
置信度诱导:大语言模型的新型对抗攻击途径
提出在黑盒分类设置下通过诱导模型输出置信度指导对抗攻击,通过最小化置信度提升误分类概率,效果显著优于现有硬标签黑盒攻击。
- 会议论文ICLR 2025
理解并提升大语言模型越狱攻击的迁移性
揭示了对抗序列因过拟合导致越狱迁移性差的机理,提出PiF方法打散注意力掩盖恶意意图,显著提升对闭源模型的越狱迁移效果。
- 会议论文ICLR 2025
AutoDAN-Turbo:自主探索越狱策略的终身智能体
提出黑盒越狱框架AutoDAN-Turbo,无需人工干预即可自主探索发现越狱策略,在GPT-4等主流模型上取得了显著更高的攻击成功率。
- 会议论文ICLR 2025
GSE:分组稀疏且可解释的对抗攻击
提出两阶段算法生成图像语义区域内的分组稀疏对抗攻击,在显著提高稀疏度与计算速度的同时实现了100%的攻击成功率。
- 会议论文ICLR 2025
大语言模型基于优化的越狱改进技术
针对GCG越狱效率低的问题,提出多样化目标模板、自适应多坐标更新策略与由易到难初始化,构建高效越狱方法I-GCG并取得近100%成功率。
- 会议论文ICLR 2025
从时间与模态视角重新审视音视频对抗脆弱性
提出时间不变性攻击与模态错位攻击,并设计音视频对抗训练框架,在 Kinetics-Sounds 上攻击效果领先,防御显著提升鲁棒性与训练效率。